首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

软件不是文件:KDC 的知识工程主张

摘要

作者:vivo 肖博 AI 合作者:ChatGPT(GPT-5.5) 创作模式:Human-led, AI-collaborated 责任声明:文章观点、理论体系及最终内容由作者负责;AI 参与讨论、推演、表达优化及部分内容生成。 研究说明:知识驱动计算(Knowledge-driven Computing, KDC)是我们正在提出和持续打磨的一套 AI 应用软件工程理论,目前仍处于开放研究阶段。...

Representation RAG Knowledge Reality 知识驱动计算 KDC API Embedding 知识库 vivo
2026-08-13 1 阅读 约10分钟阅读 vivo肖博
分享:
字号:
作者:vivo 肖博 AI 合作者:ChatGPT(GPT-5.5) 创作模式:Human-led, AI-collaborated 责任声明:文章观点、理论体系及最终内容由作者负责;AI 参与讨论、推演、表达优化及部分内容生成。 研究说明:知识驱动计算(Knowledge-driven Computing, KDC)是我们正在提出和持续打磨的一套 AI 应用软件工程理论,目前仍处于开放研究阶段。上一篇讨论了应用软件为什么应该从领域现实出发,以及数据、文档、API 和事件为什么只是现实的数字表示。这一篇继续追问:表示在什么条件下,才能成为 AI 系统可以信任和复用的知识?本文摘要:检索到相关材料,并不等于系统获得了可以用于判断的知识。本文区分 Representation、Knowledge 和 RAG 的职责,提出知识对象、来源证据、成熟度、版本与适用边界等工程要求,说明认知成果如何被验证、引用和持续更新。KDC系列文章: 《软件从现实开始:知识驱动计算(KDC)的 Reality First 主张》 " 继续说案例。 用户向售后 Agent 提出一个问题: 我在活动期间购买的商品还没有发货,现在取消订单会收手续费吗? 系统从企业知识库中检索到一段高度相关的退款政策。文档写得很清楚:活动订单取消时,需要收取一定比例的服务费。检索得分很高,引用片段与问题直接相关,模型也忠实地依据片段生成了回答。 但答案是错的。 被检索到的是半年前的旧版政策。新政策已经取消了这项费用,只是旧文件仍然保留在共享目录中,也仍然存在于向量索引里。新旧政策标题相似,旧版文字与用户问题的语义匹配甚至更高。 从 RAG 链路看,这次处理没有明显故障:文件解析成功,切块成功,Embedding 生成成功,相似度检索成功,模型也没有脱离上下文自由发挥。 然而,系统找到了相关材料,却没有获得当前可用的知识。 这个区别是企业 AI 系统中最容易被忽略、也最可能影响后续行动的区别之一。 “知识库”这个词经常掩盖了不同问题 在很多 AI 项目中,“建设知识库”通常意味着完成下面这条流程: 上传文件 -> 解析文本 -> 文档切块 -> 生成向量 -> 相似度检索 -> 注入模型上下文 -> 生成回答 这条流程解决了一个真实而重要的问题:如何让模型在回答时访问外部材料,而不是只依赖参数中压缩的信息。对于企业私有文档、快速变化的制度、项目资料和专业内容,RAG 是非常有价值的工程机制。 但“材料可以被找到”与“系统知道了什么”不是同一个问题。 文件管理关注内容如何保存、共享和授权。搜索关注用户如何找到相关材料。向量检索关注语义上相似的内容如何被召回。RAG 关注相关材料如何进入模型上下文。这些机制都参与知识系统,却没有单独回答: 这段内容来自谁?它当前是否有效?它经过什么验证?它与其他来源是否冲突?它适用于哪些对象、时间和业务条件?它能否被用于当前判断,尤其是高影响判断?使用后的现实结果是否支持它? 如果系统无法回答这些问题,“知识库”可能只是一个可以被模型检索的材料库。 这并不是文字上的挑剔。旧政策被检索出来时,召回系统完成了自己的职责。真正缺失的是版本判断、有效性验证、冲突处理和适用边界。把所有问题都归因于“RAG 不准”,会掩盖知识治理责任本身。 从现实到表示,还没有自然地走到知识 上一篇文章建立了下面这条链路: Domain Reality -> Reality Model -> Representation 现实经过观察和建模,进入数据库、文档、API、事件、日志、图片、向量、图谱和模型上下文。这些对象都是表示(Representation):它们以不同方式编码现实。 表示可以承载知识,但表示并不自动成为知识。 Representation 可以承载 Knowledge Representation 不等于 Knowledge 退款政策 PDF 是表示。它可能承载当前有效的退款规则,也可能承载已经废止的条款、未经批准的草案、错误描述或只适用于特定时期的临时安排。 数据库记录也是表示。refund_fee = 0 可以记录一个配置事实,但如果缺少适用范围、版本、生效时间和业务解释,系统仍然不知道它是否适用于当前订单。 Embedding 也是表示。它把内容编码到向量空间,帮助系统计算相似性,但相似性无法自动证明真实性、有效性或适用性。 甚至模型生成的总结也是表示。它可以准确压缩原文,也可能遗漏条件、混合不同版本,或者把推测写成确定结论。 这意味着,从文件到文本、从文本到向量、从向量到上下文,都只是表示形式的变化。格式改变不等于认知成果已经形成。 先用反例划清知识的边界 在给知识下定义之前,更可靠的方法是先检查那些经常被称为“知识”的对象,为什么又不能直接等同于知识。 PDF 不是知识 PDF 是一种文档表示。它可以承载制度、经验、方法和事实,也可以承载噪声、广告、过期规则和未经确认的观点。同一个 PDF 对文件系统而言是文件,对搜索引擎而言是索引材料,对模型而言是上下文,对员工而言可能是制度依据。 真正需要判断的不是它是不是 PDF,而是其中哪些认知成果仍然成立。 数据库不是知识 数据库保存事实记录、约束和关系,但记录不会天然解释自己对当前目标意味着什么。 订单表可以说明某位用户买过三次影像旗舰手机。“该用户在换机时更重视影像能力”则是对商品、时间、行为和场景进行解释后形成的候选认知。前者可以作为来源,后者才开始接近知识。 向量和 Embedding 不是知识 向量可以表达统计相关性和语义邻近性,却不会自动携带来源权威性、证据完整性、生效时间、冲突状态和行动边界。 两个片段很相似,只能说明它们在某个表示空间中接近,不能说明哪个更新、哪个正确,也不能说明它们能否共同成立。 RAG 片段不是知识 RAG 片段是某次检索为当前任务召回的上下文。它首先说明“这段材料可能与问题相关”,而不是“这段材料已经被验证”。 相关性是知识使用的必要条件之一,但不是充分条件。高相关的过期政策,可能比低相关的新政策更危险,因为它会让错误回答显得更有依据。 知识图谱不是知识的全部 知识图谱能够表达实体、属性和关系,是很重要的知识表示机制。但一条图谱关系如果没有来源、上下文、证据、版本和有效期,仍然可能只是结构化关系数据。 图结构解决“对象如何连接”,不自动解决“为什么相信这条连接”。 Memory 不是 Knowledge 记忆(Memory)强调历史、时间、经验和演化轨迹。用户过去说过“我喜欢小屏手机”,是一条值得保留的历史线索。它不一定是当前仍然有效的用户偏好知识。 知识可以进入记忆,记忆也可以为知识提供验证材料,但两者关注点不同。知识更关心当前能够复用的认知成果,记忆更关心过去如何影响未来。第四篇会专门讨论这个边界。 这些反例指向同一个结论:知识不能由存储介质、索引方式或调用机制定义。否则,任何被保存、向量化或检索出来的内容都会被默认升级为知识。 KDC 如何定义知识 基于前面的反例,KDC 当前采用下面这个定义: 知识(Knowledge)是已经验证、可复用,并能够降低预测、推理、决策或行动不确定性的认知成果。 这是 KDC 当前阶段的理论定
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱