基础认知:到底在解决什么问题
说白了,就是解决「同名不同物」的问题。
我们日常搜内容的时候,输入「苹果」,系统要搞清楚你是要找那个能吃的水果,还是做手机的科技公司。
实体链接是把文本里提到的这个词,对应到知识库里面某个确定的条目,消歧就是从一堆同名的条目里,挑出符合上下文的那一个。
再举个例子,你看财经新闻里提到「李娜」,是那个退役的网球冠军,还是某上市公司的董事?这个区分的过程,就是实体消歧。

实际应用里的常见注意点
说实话,很多人一开始会觉得,这不就是关键词匹配吗?有什么难的。
据一些用户反馈,不少入门级的NLP应用,折就折在消歧这一步。
比如一句话「我早上喝了小米粥,然后看了小米发布的新车预告」,同一句话里就出现了两个「小米」,一个是谷物,一个是科技公司,需要分别做链接和消歧,不能一概而论。
需要留意的是,做垂直领域应用的时候,歧义词的优先级要调整。比如做医疗知识库,「人参」就要优先链接到中药材,而不是东北特产的那个水果。

和普通关键词匹配的差异

普通的关键词搜索,只要内容里有你搜的词,就会被推出来,不管这个词指的是什么。
实体链接与消歧不一样,它要的是精准对应到某个特定的对象。
从实操角度看,现在很多做垂直知识库的团队,通常会先用开源工具做粗粒度的消歧,再人工梳理高频的歧义词,这样整体的成本会控制在比较合理的范围。
有意思的是,现在大模型本身具备一定的上下文理解能力,消歧准确率比早年的统计方法高了不少,但碰到特别冷门的同名实体,还是会出错。
您在使用AI搜索的时候,还遇到过因为同名搞错结果的情况吗?欢迎结合具体场景继续探讨。