开发者生态
evening
让 Agent 读懂业务世界:Snowflake Cortex Agents 的本体驱动推理实践
2026-08-11
1 阅读
约10分钟阅读
Ricky Ho
字号:
2026 年,智能体将在企业级应用中取得哪些实质性突破? 点击下载 "《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式! Snowflake 正持续投入,让 AI 智能体能够更轻松地原生理解并推理业务概念及其关系。 本文展示了已经拥有本体的团队在当下可以实现哪些能力。许多行业都维护着正式本体,为基于表、列和连接关系所表达的语义推理补充一层领域专属推理能力。这有助于 AI 智能体理解层级关系、同义词,以及仅靠语义层未必能够完整捕获的领域概念。 我们使用一个高度简化的生物医学数据集,将基于 Semantic View 的 Cortex Agent 基线方案,与基于知识图谱、GraphRAG 和针对性术语映射的本体感知方案进行了比较。本次基准测试结果表明,在所评估的条件下,更充分的结构化知识锚定有望提升准确性与可靠性;同时,这也为需要构建更精准、可解释、更可信的企业级 AI 智能体的团队提供了一套可落地的参考框架。 将本体融入 Snowflake Cortex Agents 企业数据中充满了从未在数据库模式中被显式呈现的含义。这些内在的领域知识必须被捕获,才能为可靠的智能体系统提供支撑。 在各个行业,组织都会维护正式本体、分类体系和受控词表,用于编码类层级、类型化关系、约束条件和规范标识符。在医疗与生命科学领域,这类资源包括 SNOMED CT、UMLS、Gene Ontology(基因本体)和 Cell Ontology(细胞本体);在供应链与零售领域,GS1 等标准定义了产品与包装语义;在金融服务领域,FIBO 为金融工具、实体和监管分类提供共享模型。这些行业资产通常以 OWL、RDF 或 SKOS 等表示格式发布,往往包含数千个概念、丰富的同义词集合,以及数以万计的层级边和关联边。然而,大多数企业 AI 与分析系统仍主要运行在关系抽象之上,也就是表、列、键和连接,并不能原生访问定义概念继承、传递关系、等价映射或领域约束的知识层。由此,组织对真实世界含义的建模方式,与 AI 系统检索和推理业务数据的方式之间,可能存在一道鸿沟。 例如,供应链分析师提出“显示所有电子元器件的总支出”时,“电子元器件”位于一个分类体系的顶端,其下包括电容器、电阻器、集成电路以及数十个子类别。又如,生物医学研究者提出“显示 PD-1 抑制剂在上皮来源癌细胞系中的药物疗效”时,系统需要将一个父概念扩展到数十种细胞类型和 13 个组织类别。两种情况下,Snowflake 的 Semantic View 都提供了关系构造的基础,包括实体、关系、指标和维度;同时,递归 CTE 这一 SQL 扩展能力提供了动态路径长度查询机制,可支持层级类型以及 subclass-of、传递属性和逆属性等关系公理。 本文将讨论:把更深层的本体语义引入 Snowflake,并与业务数据结合,用来锚定 AI 智能体的推理,会带来怎样的效果。具体而言,我们在一个用于测试智能体数据检索中本体依赖型推理能力的生物医学基准上,评估了一个语义层基线方案和三种本体感知增强方案。 生物医学基准测试 在药物发现领域,寻找新的候选疗法,需要沿着编码在多个本体中的“基因—通路—细胞—疾病—药物—结果”关系进行推理,而这些本体往往与实验数据彼此割裂。我们的目标,是构建并测试能够进行本体驱动推理、消解语义歧义,并从癌细胞系药物筛选的细胞存活率数据中提取洞察的智能体架构。这里的细胞存活率,是根据存活细胞比例衡量药物疗效的指标。 这项基准测试旨在提供方向性证据。我们引入一个行业本体,在受控条件下处理一项复杂的数据洞察任务,以衡量本体感知技术能够带来的增量提升。我们在 Snowflake 中结合了两个公开资源: Cell Ontology(细胞本体,CL):用于分类和描述细胞类型的本体,包含 33,651 个术语,由约 50,000 条层级边和关系边连接。PRISM(Profiling Relative Inhibition Simultaneously in Mixtures)药物再利用数据集:记录 4,518 种药物在 578 个人类癌细胞系上的生长抑制活性,共产生 260 万余条细胞存活率测量数据。 真正的难点在于:PRISM 按组织类型(如肺、乳腺)标注数据,而 Cell Ontology 按细胞谱系(如上皮细胞、基质细胞)组织概念。智能体必须跨越这道语义鸿沟,才能回答分析问题。 我们设计了 22 个高难度问题,刻意聚焦一个特定问题:以本体知识为基础的智能体,在术语解析、队列比较、跨组织分析、药物排序、分布分析和多类别比较等任务中的表现如何。为衡量一致性,每种智能体配置都重复运行了 5 次。 起点:Semantic View 与 Cortex Analyst 我们的基线智能体使用 Semantic View,并借助 Cortex Analyst 将自然语言转换为针对该语义层、经过验证的 SQL。 Semantic View 在物理表之上引入受治理的语义层,使 AI 系统能够面向清晰、贴合领域的模型工作,而不是直接处理原始数据库模式。一个 Semantic View 中可以包含实体表、关系、事实、维度和指标。 在生物医学场景中,这个语义层可以把药物、蛋白质靶点、细胞系和疾病表型表示为逻辑实体;用事实记录药物—靶点相互作用等可测量事件;用维度提供组织类型或疾病状态等分析上下文;再用指标编码效力或疗效等派生度量。这个基线方案构成了一个受治理的对照点,用于衡量叠加在语义模型之上的本体感知技术能够带来多少增量提升。 因此,基线智能体也是评估其他技术增益的对照基准。 知识图谱 图 1:知识图谱的查询处理流程 在 Semantic View 之上,我们使用 Snowflake 表实现了一个简单的知识图谱,使系统能够更自然地支持图遍历操作。这里的知识图谱,是以相互连接的实体和类型化关系来表示知识的一种方式。 知识图谱遍历 知识图谱直接存储在 Snowflake 中,采用节点—边表模型: KG_NODE 表存储所有实体,包括唯一标识符、类型(药物、疾病、细胞)和属性;属性通常保存在灵活的 VARIANT 列中。KG_EDGE 表存储关系,包括源节点 ID、目标节点 ID、边类型(例如 treats、targets、expressed_in),以及时间戳或置信度分数等可选元数据。 这种实现方式充分利用 Snowflake 的分布式存储、自动扩展、查询优化、安全与治理能力,不需要额外引入独立的图数据库。 递归 CTE 知识图谱的一项关键能力是遍历,也就是在事先不知道需要多少步的情况下,从一个实体出发,跨越多个跳数访问与其相连的邻居。在 Snowflake 中,这种动态、可变长度的遍历可以通过递归公共表表达式(Recursive CTE)实现。递归 CTE 会反复将边表与自身连接,逐步扩展可达节点的搜索边界,直到找不到新节点、达到设定的深度上限,或运行超时。固定自连接需要预先写死跳数,而递归 CTE 则允许路径长度由数据决定,保持动态和灵活。 假设我们希望识别通过生物通路与某种药物存在机制关联的疾病,一个简化图谱中可能包含如下关系: 药物 → targ
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱