首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

用于从异构文档构建知识图的本体引导、重复数据删除感知的提取层

2026-08-03 1 阅读 约1分钟阅读 Vaibhav Dangaich, Kevin Lewis, Kundeshwar Pundalik
分享:
字号:
arXiv:2607.28662v1 公告类型:新摘要:大型语言模型从非结构化文档中提取实体和关系,流畅但不一致:文档中的类型词汇断裂,同一个人在多个姓名变体下出现,关系重复,以及共享姓名的不同个人存在无声合并的风险。本文介绍了生产提取层的设计、实现和经验改进,该层将实时文档流转换为与正式本体对齐的经过验证的知识图。该系统使用来自 Kafka 的文档元数据,通过为每种格式构建的处理程序路由 PDF、电子表格、Office 和图像内容,并使用在本体上调整的本地托管的 Qwen3.5-9B 模型分两次提取实体和关系。其独特之处在于本体引导提取:通过嵌入相似性从图形数据库中实时检索精选本体的相关切片并将其注入提取提示中,相对于静态域切片,目录开销减少了约 94%。然后,提取的结果通过五个阶段的细化管道:确定性清理、跨块合并、第二次关系传递、六种不需要模型推理的重复数据删除算法,以及嵌入解析子系统,其冲突防护没有相似性分数可以覆盖。对情报语料库的评估将搜索召回率从大约 70% 提高到 95%,没有错误合并,并纠正了七类无声质量缺陷,从将源文本截断单个字符的错误到带有标题前缀的实体的系统重复。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱