知识图谱与实体识别:日常场景里的隐形技术拆解

我们每天刷推荐、搜信息,其实都在享受知识图谱与实体识别带来的便利,只是大多时候没察觉。

基础认知:拆分实体,织成知识网

实体识别,说穿了就是帮机器从一大段文字里,把具体的「人、事、物」给挑出来,打上分类标签。

比如你发了一条朋友圈:“周末去故宫看了《清明上河图》特展”,实体识别会自动把「故宫」标成景点,「清明上河图」标成古画,特展标成活动。

知识图谱呢,就是把这些识别出来的实体,按相互关系连起来。比如故宫在北京,清明上河图现藏于故宫,作者是张择端,这些关系连在一起,就是一张小型知识图谱。

知识图谱实体关系连接示意图
知识图谱实体关系连接示意图

实操中容易踩的误区

说实话,很多刚上手做小项目的朋友,很容易栽在实体歧义这个坑里。

比如你做电商知识图谱,搜“小米”,机器要是没做好上下文判断,会把谷物小米和小米手机混在一起,出来的结果完全不对。

据一些用户反馈,十个体积不大的知识图谱项目,有六七个都在初期遇到过歧义识别的问题。解决这个问题,通常要给模型加入上下文关联判断,再结合行业的实体词典,就能大幅降低出错概率。

自然语言处理实体歧义识别示例图
自然语言处理实体歧义识别示例图

需要留意的是,不同行业对要识别的实体要求完全不同。医疗场景要识别病症、药品,金融场景要识别企业、标的,没有通用模型能适配所有需求。

它给日常找信息带来了什么变化

它给日常找信息带来了什么变化
它给日常找信息带来了什么变化

有意思的是,和早年全关键词匹配的搜索比,这套技术把找信息的逻辑从“匹配文字”改成了“理解语义”。

以前你搜“广州有哪些孙中山相关的景点”,搜索引擎会把所有带“广州”“孙中山”“景点”的网页堆给你,你得自己翻。现在用知识图谱加实体识别,直接会把各个景点按关系整理出来,连开放时间、位置都给你聚合好。

从实操角度看,现在很多企业整理内部知识库,都会用这套技术,把存量文档里的客户、项目、产品实体抽出来搭网,找相关资料的效率提升不少。

您在实际接触知识图谱与实体识别的过程中,还遇到过哪些问题?欢迎结合具体场景继续探讨。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:知识图谱与实体识别:日常场景里的隐形技术拆解
文章链接:https://m.ttrenwu.com/geo/1028.html