知识图谱自动化构建的探索与挑战

helloworld_38131402
• 阅读 345

知识图谱自动化构建的探索与挑战|论文分享 达观数据

知识图谱的自动化构建是知识图谱中具有极强挑战性且巨大应用价值的技术方向。就实体抽取技术,达观数据副总裁、上海市人工智能技术标准委员会委员王文广提到“狭义的实体抽取,即命名实体识别(NER)技术发展至今已较为成熟,能够很好地抽取出人名、地名、机构名等少数类型的实体。但在知识图谱实际应用中,则需要抽取出各式各样各不相同的广义实体,比如金融业中的产品名称、品牌名、业务名、风险提示、观点等,制造业中的失效模式、失效现象、工艺、设备、零部件、物料、方法、故障原因、改善措施等,商业中的产品、功能、特点、适合人群、搭配方法等等。抽取出这些广义实体的挑战巨大。”关系抽取技术也同样问题多挑战大,已有关系抽取大多基于实体对之间共现,而现实复杂的场景中,实体对共现既可能不存在任何关系,可能存在万千种的关系,这就造成了关系抽取的难题。此外,在知识图谱构建中,还涉及实体消歧、实体融合等方面的技术要求。

除了技术发展本身并不成熟之外,在实际场景中还遇到样本少的问题。在真实落地的项目或产品中, 往往存在标注样本少的问题,其原因即可能是标注成本高导致样本少,也可能是本身样本就少,无法获得大规模的标注样本。这方面王文广深有体会,他提到“在很多场景下,总的文档数量有几千或几万份,对于具体某些类型的实体或关系来说则文档数量更少。在这种情况下要做好知识图谱的构建,是极大的挑战,也是在实际落地中必须综合使用十八般武器,逢山开路遇水搭桥,使用最新的技术结合业务经验、专家规则等来解决这些问题。”

为了促进知识图谱自动化构建技术的进一步发展,达观数据在CCKS2020(2020全国知识图谱与语义计算大会)组织了金融研报知识图谱的自动化构建的算法竞赛。竞赛选择了样本丰富但复杂度较高的金融研报文档作为知识的来源,根据金融投研领域常见的需求,设计了简化版的知识图谱模式,并标注了大规模的金融研报知识图谱数据集FR2KG。竞赛任务从预定义的知识图谱模式和少量的种子知识图谱开始,从非结构化的金融研报文本中抽取出符合知识图谱模式的实体、关系和属性值, 并进行适当的实体消歧和实体融合,构建出知识图谱,并使用FR2KG来评估竞赛参赛队伍所提交的结果。

金融研报是各类金融研究结构对宏观经济、金融、行业、产业链以及公司的研究报告,是金融行业中最为复杂、多样的文档。报告通常是专业人员撰写,对宏观、行业和公司的数据信息搜集全面、研究深入,质量高,内容可靠。报告内容往往包含产业、经济、金融、政策、社会等多领域的数据与知识,是构建行业知识图谱非常关键的数据来源。另一方面,由于研报本身所容纳的数据与知识涉及面广泛,专业知识众多,不同的研究结构和专业认识对相同的内容的表达方式也会略有差异。这些特点导致了从研报自动化构建知识图谱困难重重,解决这些问题则能够极大促进自动化构建知识图谱方面的技术进步。同时所构建的图谱在大金融行业、监管部门、政府、行业研究机构和行业公司等应用非常广泛,如风险监测、智能投研、智能监管、智能风控等,具有巨大的学术价值和产业价值。

数据集

达观数据所构建的大规模金融研报知识图谱数据集FR2KG是用于评测知识图谱自动化构建技术的专业数据集,是当前最大规模的中文金融研报知识图谱。下图是数据集构建过程示意图

知识图谱自动化构建的探索与挑战

FR2KG的知识图谱模式包含10个实体类型,19个关系类型和6种属性,如下图所示。

知识图谱自动化构建的探索与挑战

构建好的金融研报知识图谱数据集FR2KG包含17,799实体,26,798关系三元组,1,328属性三元组,SeedKG和EvaluationKG的数据情况如下图所示。

下图是数据集的样例,使用达观数据渊海知识图谱平台可视化:

知识图谱自动化构建的探索与挑战

目前数据集已经发布在SCIDB和OpenKG上,欢迎大家前往下载。在使用数据集进行研究时请引用本论文。

文章:Data Set and Evaluation of Automated Construction of Financial Knowledge Graph

作者:王文广,徐永林、杜春辉、陈运文、王逸捷、文辉

引用: Wang, W.G., et al.: Data set and evaluation of automated construction of financial knowledge graph. Data Intelligence 3(3), 418-443 (2021). doi: 10.1162/dint_a_00108

竞赛技术回顾

本次评测一共有740个队伍报名,其中F1分数最高的18支队伍中,有3支队伍来自企业,10支队伍来自高校,3支队伍高校和企业的组合,另外2支队伍未透露相关信息。本次评测的top5队伍都梳理并提交了他们所使用的方法的简要说明,下文对这些方法和说明进行分析总结。

所有队伍都使用了规则或者labelling function来生产训练样本,只有一个队伍在自动生成样本之外,又额外人工标注了20份的研报来作为补充和验证的训练样本。

所有队伍在实体抽取中都使用了基于BERT的模型,并且在模型之外也都使用了基于规则的方法来对特定的实体类型进行补充。

在关系和属性抽取方面,所有的队伍都使用了基于共现的方法,共现是远程监督的基本假设,也就是说,当两个实体共同出现在一个较短的一段文本时,即可假设它们存在符合相应的关系。在基于共现的假设之上,三支队伍使用了规则来判断是否真正存在这种关系,另外两只队伍使用了基于BERT的模型来对关系进行分类。

其中一支队伍使用了聚类的方法来将相似或相同主题的研报给聚在一起,对研报进行了预处理。

知识图谱自动化构建的挑战

从本次基于知识图谱模式的自动化构建知识图谱评测的结果来看,单纯使用算法来构建完全自动化地构建知识图谱,尚存在较多挑战,这里总结了一些具有相当挑战性的课题和研究方向:

在给定知识图谱模式和种子知识图谱来自动化的构建知识图谱上,现有的方法效果都不太好,如何实现端到端或者多步的框架实现知识图谱的完全自动化构建是值得继续探索的。

通过知识图谱及其对应的Schema如何实现自动化标注语料是一个值得研究的课题,能够实现高精度的自动化标注语料可以带来更好的抽取模型。此外,自动化标注语料方面的评测也是一件非常有意义的事情。

实体抽取方面,评测的优秀选手都使用了基于BERT的模型,再加上基于规则的方法来实现,在这种真实的场景且计算力资源受限的情况下,如何在少量语料的情况下实现高精度的抽取。

关系和属性抽取与识别上,目前集中在采用短文本内共现并过滤的方法来实现,这极大的依赖于实体抽取的F1分数,高precision和高recall的实体抽取决定了关系和属性抽取有好的效果。那么如何在噪声较多,即不那么高的情况下来实现好的关系和属性抽取?

本次评测没有看到使用端到端的实现实体和关系联合抽取的模型,可能的原因是实体和关系类型较多且没有大量的语料,那么在这种情况下如何开发出端到端的模型也是非常具有挑战性的课题。

当Schema的规模进一步扩大时,比如50种实体类型,数百种的实体属性和实体间的关系,对这样的知识图谱研究其自动化构建是一个兼具挑战性与现实意义的课题。

多语言的知识图谱自动化构建技术的研究。本次评测集中在中文,以及中文中存在的少量英文的情况,特别的,没有涉及到多语言之间实体融合的情况。但在真实场景下,多语言语料以及构建多语言图谱是非常重要的。这涉及了多方面的内容,包括多语言的实体、关系和属性的抽取,多语言之间实体的融合等等方面技术的研究。同时,组织多语言知识图谱自动化构建方面的评测也是非常有意义的事情。

本次评测中隐含着少量实体的消歧与融合,这块没有显性的进行评测,未来可以将这块明确的表达出来,以促进相关领域的研究。

点赞
收藏
评论区
推荐文章
知识图谱Knowledge Graph构建与应用
《新一代人工智能发展规划》明确提出了“建立新一代人工智能关键共性技术体系”的重点任务,特别强调了要解决“研究跨媒体统一表征、关联理解与知识挖掘、知识图谱构建与学、知识演化与推理、智能描述与生成等技术,开发跨媒体分析推理引擎与验证系统”的关键共性技术问题。一、知识图谱概论1.1知识图谱的起源和历史1.2知识图谱的发展史——从框架、本体论、语义网、链
Stella981 Stella981
2年前
Jure Leskovec等顶尖学者倾情授课,斯坦福知识图谱课程完结
  机器之心报道  参与:杜伟、魔王斯坦福知识图谱春季课程视频上线B站,领域内顶尖学者和业界大牛倾情授课,对知识图谱感兴趣的小伙伴赶紧去观看吧!  从Google搜索,到聊天机器人、大数据风控、证券投资、智能医疗、自适应教育、推荐系统,这些应用无一不跟知识图谱相关。知识图谱在技术领域的热度也在逐渐上升。  但
知识图谱|知识图谱的典型应用
作者:cooldream2009 我们构建知识图谱的目的,在于利用知识图谱来做一些事情。有效利用知识图谱,就是要考虑知识图谱的具备的能力,知识图谱具有哪些能力呢,首先我们知道知识图谱包含了海量的数据,是一个超级知识库,所以我们可以依赖它进行搜索一
知识图谱丨知识图谱赋能企业数字化转型
知识图谱丨知识图谱赋能企业数字化转型相互关联是大数据时代的鲜明特征。激增且日益复杂的海量数据正通过各种方式对企业发展产生重要影响。如何正确理解和解读数据,发掘其内在价值,从而推动企业的智能决策备受关注。在当今的商业世界或者日常生活中,无论是企业还
知识图谱丨行业应用广泛,未来发展前景好,参与学习势在必行
学习和关注人工智能技术与咨询,企鹅l89696oo7,更多详情可咨询19511122152(v同号)。多领域发挥重要作用知识图谱本质上是基于语义网络(semanticnetwork)的知识库,旨在描述客观世界的概念、实体、事件及其之间的关
知识图谱:技术成熟度飞速跃升,与产业互联结合更加紧密
国双数据科学团队刘燕对比2020和2019年Gartner发布的人工智能领域的技术“成熟度曲线”(HypeCycle),在短短1年时间,知识图谱的成熟度由创新触发阶段一跃达到预期膨胀高峰阶段且非常接近最高点。知识图谱逐渐成为人工
秦朗 秦朗
2个月前
知识图谱实战系列(Python版)
//下仔のke:https://yeziit.cn/14456/知识图谱是一种以图状形式展示知识的手段,它将复杂的知识领域通过数据挖掘、信息处理、知识计量和图形绘制的方式显示出来,揭示知识领域的动态发展规律。知识图谱通常由节点和边组成,节点代表实体,边代表
金旋 金旋
2个月前
小象学院《知识图谱》入门课程
//下仔のke:https://yeziit.cn/14443/知识图谱是一种以图状形式展示知识的手段,它用节点代表实体,边表示实体之间的关系。知识图谱提供了一种从“关系”的角度去分析问题的能力,能更好地描述复杂、多样和海量的互联网数据。知识图谱的构建是一
胡赤儿 胡赤儿
2星期前
知识图谱技术的深度解析与应用前景展望
在数字化时代,信息爆炸式增长,如何有效地组织、存储和查询知识成为了一个亟待解决的问题。知识图谱作为一种新型的知识表示和组织方式,正逐渐成为信息领域的研究热点。本文将对知识图谱的技术原理、构建方法以及应用前景进行深度解析,旨在为读者提供一个全面而深入的了解。
知识图谱进阶UP!UP!
知识图谱一、知识图谱概论1.1知识图谱始于20世纪50年代,至今大致分为三个发展阶段:•第一阶段(1955年—1977年)是知识图谱的起源阶段,在这一阶段中引文网络分析开始成为一种研究当代科学发展脉络的常用方法;•第二阶段(1977年2012年)是知识图谱的发展阶段,语义网得到快速发展,“知识本体”的研究开始成为计算机科学的一个重要领域,知识图谱