基础认知:二者怎么配合完成工作
实体识别是第一步,负责从杂乱的文本里,把有具体意义的独立对象摘出来。
比如你搜「上海迪士尼春节客流量」,实体识别会先帮你拆分出「上海迪士尼」是地点实体、「春节」是时间实体,剩下的是你的查询需求。
知识图谱则是把所有识别出来的实体,按照相互关系织成一张网,告诉你上海迪士尼在上海,春节的客流量通常高于平日,票价是多少,直接把关联信息推给你。

生活化的例子还有很多,比如你刷短视频搜「减脂期可以吃的早餐」,实体识别先捞出「减脂期」「早餐」两个核心实体,知识图谱再把符合属性的菜品实体推给你。
实操中容易踩的几个误区
说实话很多刚接触的团队,都会踩同一个坑:觉得实体识别的粒度越细越好。
拆完品类拆成分,拆完成分拆产地,最后知识图谱冗余得根本跑不动。从实操角度看,粒度完全要看用途,做电商推荐拆到品类、适用人群就够用,做学术文献拆解才需要更细的颗粒度。

另一个常见问题是实体歧义处理不到位。比如「小米」可以是手机品牌,也可以是农作物,「苹果」可以是水果也可以是科技公司,没做消重处理的话,搜小米股价能出来一堆小米粥的食谱,挺乱的。
大模型时代的新变化

有意思的是,大模型火了之后,不少人说知识图谱和实体识别要被淘汰了。其实完全不是这么回事。
大模型生成内容容易出现不实信息,把预先验证好的知识图谱和实体识别接入,就能帮大模型提前锁定正确的实体关系,降低出错概率。
据一些用户反馈,在企业客服这类对准确率要求较高的场景里,加了知识图谱和实体识别的大模型,回答准确率有明显提升。
这个可能因人而异,小场景用简单的规则模型做实体识别就够用,不用强行追超大模型的风口。
您在实际使用或搭建知识图谱的过程中,还遇到过哪些实体识别相关的问题?欢迎结合具体场景继续探讨。