核心关系:实体识别是知识图谱的基础入口
很多人会把两个概念搞混,其实分工很明确。实体识别是知识图谱的基础入口,先把文本里的不同目标对象拆出来,才能给知识图谱做素材。
举个生活化的例子,你在搜索引擎搜“北京到上海的高铁时刻表”,实体识别第一步,要拆分出“北京”“上海”“高铁”三个不同实体,才能触发知识图谱里的交通线路关系,直接给你出可查询的结果,不用你在一堆网页里翻。

实操避坑:最容易忽略的核心细节
说实话,很多刚接触的朋友都会踩同一个坑:觉得实体识别就是抠关键词,不用在意歧义。
实体消歧是实体识别环节的核心难点,比如同样是“小米”,有的指小米公司,有的指粮食小米,错分之后,知识图谱的关联关系全错。据一些用户反馈,不少小团队做领域知识图谱,省了实体消歧的标注环节,最后搭出来的图谱根本没法用。
需要留意的是,通常我们做项目,会把三成以上的预处理时间花在实体标注和消噪上,不要上来就急着搭图谱框架。

当前行业的通用做法

通用场景下,现在大多用预训练模型微调做实体识别,成本比早年全手工标注低不少。
有意思的是,垂直专业领域比如医疗、法律,通常还是会加人工规则兜底,毕竟专业术语的特殊歧义,通用模型很难一次性分对。不过话说回来,成型的知识图谱也会反过来给实体识别提供训练数据,慢慢优化精度,形成正向循环。
您在实际使用或搭建知识图谱的过程中,还碰到过哪些实体识别的问题?欢迎结合具体场景继续探讨。