到底是什么,通常用在哪儿
实体识别,说直白点就是帮AI从杂乱的文本里,把有用的特定信息抠出来。比如人名、地名、品牌名、商品品类,都属于要识别的“实体”。
知识图谱呢,就是把抠出来的这些实体,按照它们之间的关系连起来,织成一张方便检索的信息网。
比如你在外卖平台搜“中关村附近的咖啡”,实体识别先拆分出“中关村”是地点、“咖啡”是品类,知识图谱再把符合条件的商户信息关联起来,直接推给你,不用你自己翻半天。

实操过程中要留意的常见问题
说实话,很多刚接触的人容易踩坑,以为随便跑个开源预训练模型就能用。
较为常见的问题就是多义词歧义,比如“小米”可以是粮食,也可以是数码品牌,不对业务领域做适配,识别错一个实体,整个知识图谱的关系链就错了。
据一些用户反馈,不少中小项目图快省事儿,跳过了领域微调这一步,出来的实体错误率偏高,后续维护知识图谱反而要花几倍的时间补坑。

延伸:和普通文本分类有什么区别

很多人会把它和普通的文本分类弄混,其实差得挺多。
普通文本分类只是给整段文本贴个标签,比如判定“这是一篇体育新闻”,不会挖里面具体的信息点。知识图谱与实体识别,是要挖出里面具体的球队名、球员名、赛事名,再把这些信息的关系理清楚。
有意思的是,现在很多内容平台的推荐算法,也依赖这套逻辑。你点赞过“云南的咖啡”,实体识别挖出关键词,知识图谱关联到相关的产区、店铺、测评内容,接着推给你。
实体识别的精度直接决定知识图谱的可用程度,根子错了,后面的关系再顺也没用。
您在实际使用中还遇到过哪些情况?欢迎结合具体场景继续探讨。