文字也有角度?搜索引擎与向量相似度
想象一个场景:用户搜索"苏州园林",系统要从一堆景点介绍中找出最相关的。
有四条候选文本:
A:"拙政园,苏州的古典园林之首"
织梦者的原创世界 · 分享技术与生活
想象一个场景:用户搜索"苏州园林",系统要从一堆景点介绍中找出最相关的。
有四条候选文本:
A:"拙政园,苏州的古典园林之首"
经济学里有个概念叫"稀缺性"——用来衡量价值。黄金比铁贵,钻石比玻璃贵。
但在搜索技术中,"稀缺性"却能带来另外一种重要作用——消除歧义。
想想看:为什么有些词一搜就能精准定位,有些词一搜却冒出一堆无关结果?
你有没有想过,当你在搜索框里敲下几个字,背后到底发生了什么?
你可能第一时间会想到 Elasticsearch,或者 Solr —— 这两个耳熟能详的搜索中间件,几乎是"搜索引擎"的代名词。但你有没有注意到,它们的文档里都频繁出现同一个名字:Apache Lucene。
没错,ES 和 Solr 的底层,都站着同一个引擎。Lucene 几乎统治了整个 Java 搜索生态,只是大多数时候它藏在幕后,被上层框架的光芒遮住了。