基础认知:两者到底是怎么配合干活的
实体识别其实就是先从一堆杂乱的文字、数据里,把「实实在在有明确指代的内容」抠出来。可能是人名、地名、商品名,也可能是时间、日期这类概念。
知识图谱呢,就是把抠出来的这些实体,按真实存在的关系连起来,织成一张可以快速调取的关系网。
比如你在搜索引擎搜「北京到上海的高铁票」,实体识别先抠出北京、上海、高铁票三个核心实体,知识图谱再直接调取两个城市之间的交通关联,把实时时刻表放在结果最前面,不用你再翻一堆网页找。

实际应用里要留意的常见问题
很多新手刚接触的时候容易踩坑,觉得实体识别只要抠出关键词就完事了。说实话没这么简单。
比如句子里出现指代「它去年的销量涨了三成」,这个「它」到底对应哪个产品实体?很多基础模型识别不出来,得靠人工加业务规则补全。
另外,知识图谱不是建完就能一劳永逸。据一些用户反馈,不少中小公司建完一次图谱就扔在那儿,过了半年实体信息都变了——品牌改名、新产品上新、旧产品下市,原来的关联关系全错了,用的时候错漏百出。
我们通常建议,高频更新的电商、社交类场景,每个月同步一次实体数据,低频的政务、文献类场景,一个季度更新一次也够用。

它和普通关键词检索的区别

有意思的是,很多人会把两者混为一谈。
普通关键词检索,核心是找「包含关键词的内容」,知识图谱加实体识别,核心是找「实体和实体之间的真实关系」。
比如你搜「孙俪演过的电视剧」,普通关键词搜索会给你一堆带这句话的网页,用了这套组合技术的搜索,会直接整理出所有作品列表,还会同步带出合作导演、评分信息放在侧边,一目了然。
从实操角度看,现在大部分主流互联网产品都已经落地了这套技术,只是普通用户感知不到而已。
您在实际接触知识图谱与实体识别的场景中,还遇到过哪些问题?欢迎结合具体情况继续探讨。