智能AI
evening
全球首个通用决策大模型,AI推演现实世界的技术揭秘
摘要
编辑|杜伟 生成答案正在成为 AI 的基础能力,而推演现实世界,才是下一阶段更难的命题。 真实决策不是一道静态问答。它发生在一个持续变化、多主体同时行动、信息不完备且充满不确定性的世界里。 比如一个新开源模型突然把成本打下来,头部模型公司会不会跟进降价,云厂商、开发者和应用公司又会怎样重新站队?这类决策中,一方行动会改变其他方下一步面对的条件,新的反应又会继续改写局势。就像一盘所有棋手同时落子的棋...
MetaWorld
Decitron
决策机
SAO
AutoABM
World
生成答案正在成为
的基础能力
而推演现实世界
才是下一阶段更难的命题
2026-09-03
1 阅读
约10分钟阅读
机器之心
字号:
编辑|杜伟 生成答案正在成为 AI 的基础能力,而推演现实世界,才是下一阶段更难的命题。 真实决策不是一道静态问答。它发生在一个持续变化、多主体同时行动、信息不完备且充满不确定性的世界里。 比如一个新开源模型突然把成本打下来,头部模型公司会不会跟进降价,云厂商、开发者和应用公司又会怎样重新站队?这类决策中,一方行动会改变其他方下一步面对的条件,新的反应又会继续改写局势。就像一盘所有棋手同时落子的棋,每落下一子,棋局都会随之改变。 也正是在这一背景下, 中科闻歌决策机 Decitron(简称决策机) 发布后,被多家主流科技媒体称为「 全球首个通用决策大模型」。该称谓所强调的,并非世界模型、多智能体或博弈求解等某项单一技术的首次出现,而是 决策机 首次将这些能力统一到一套面向开放世界的决策框架中,形成持续建模、推演、求解和校准的完整闭环。 所谓「 通用」,是其试图将不同领域的复杂决策问题抽象为一套共同结构 —— 世界状态、参与主体、行动空间、约束关系、多轮互动和不确定结果,并在同一套框架中持续推演与求解。 技术报告地址:https://chinaxiv.org/abs/202608.00064 8 月 3 日,决策机 Decitron 完整技术报告正式发布,首次系统公开其三项核心技术贡献: 一是提出 显式世界模型 MetaWorld ,将多源信息整理成结构化、持久化和可计算的世界状态及其因果建模;二是采用 State–Action–Outcome (SAO) 形式化表示,将复杂决策转化为可计算的表达与推理形式;三是构建融合多智能体模拟、博弈推理和形式化优化的 混合推理架构 AutoABM ,基于多智能体决策推演系统求解博弈均衡、策略规划与约束满足等复杂决策问题。三者共同构成决策机的技术底座,目标是将 AI 系统的一次性判断,转变为一个随世界变化持续更新的计算与推演过程。 让 AI 参与真实决策, 需要怎样一套架构? 当前,围绕「决策推演」,AI 需要的几项关键能力(如世界模型、多智能体、博弈推理、概率预测)其实已经陆续出现。真正的难点在于:当 AI 从封闭任务进入开放现实世界,这些能力必须围绕同一个、持续更新的世界状态协同工作,而不能只在一次 Prompt 里给出彼此独立的分析。 先看世界模型。提到 World Model,人们很容易想到 Sora、World Labs、V-JEPA 等主要面向视觉、空间、物理或机器人环境的物理世界模型。而决策机提出的 MetaWorld 关注的则是更为复杂的决策场景:经济、政策、企业竞争、地缘等开放系统,系统建模涉及的主体、变量、关系和约束更加繁杂 。 MetaWorld 可以看作世界模型向社会系统的一次延伸,需要处理三类棘手的问题:规则差异、反身性(因果之间双向互动、循环影响)和无法彻底消除的不确定性。这也带来了一个直接问题:如果对当前世界的判断出现偏差,后面的推演会不会跟着跑偏? 一旦进入社会系统,只维护环境状态还不够,AI 还要判断其他参与者怎么做。Meta 的 CICERO、北大等团队提出的 Richelieu 已经展示了多个 Agent 在有限信息下进行互动与博弈的能力;而对于开放世界的真实决策,在模拟出各方行动之后,还要继续判断策略是否可行、博弈可能落在哪些均衡上以及不同未来发生的可能性和条件。 决策机的意义正在于此 :其混合推理架构 AutoABM 将 LLM 的语义理解、SAO 结构化表示、多智能体建模与仿真、策略推理与优化统一在同一条实现链路上,打通了「理解世界 — 模拟推演 — 求解决策 — 评估未来」这四步。 从事实到未来, 决策机如何完成一次复杂推演? 决策机由输入与任务、数据与知识、建模与形式化、模拟与推理、预测与校准、报告与解释六个层级组成,形成从现实信息到决策输出的完整链路。 接下来,我们以「 未来半年,某场复杂贸易冲突可能如何演化? 」为案例,看决策机如何从现实信息出发,一步步建立当前世界状态、模拟各方行动、推演未来可能出现的不同路径,以及这些路径会在什么条件下发生。 第一步:先不急着推演未来,首先弄清「现在发生了什么」,以及哪些事实值得相信。 现实世界的信息很杂,可能重复或彼此冲突,也可能已经过时。决策机首先将用户的问题转成一个结构化任务,明确要回答什么、涉及哪些主体、观察多长时间,以及有哪些约束。以案例来说,系统会先锁定这场冲突涉及的主要参与方、时间范围和当前争议焦点,梳理关税、供应链、产业政策、企业行为等可能影响局势变化的条件,随后 围绕这些要素从新闻报道、社交媒体、研究报告等不同来源收集信息 。 图 2: 数据处理流程图 收集到的信息会先经过去重、聚类和事件抽取,整理成事件时间线和一组更细的证据单元。然后系统通过 Evidence Quality Score (EQS) 逐条判断信息质量,包括与当前问题的相关性、来源可信性、内容时效性与完整性、不同信源之间的一致性。同时根据证据的不同置信度决定它们的去向,其中置信度高的直接进入后续推演。 如果现有证据不足或者不同来源出现冲突,系统继续执行 基于 ReAct 的交替推理与检索 ,根据当前缺少的信息调整下一轮搜索,并把新找到的信息补充进已有时间线。 图 3:采用基于 ReAct 的推理与检索交替机制 第二步,把筛选后的事实转化为一个持续更新的「世界状态」 。事实告诉系统发生了什么,接下来还要进一步判断:这些变化叠加在一起,现在的世界究竟处于什么状态。 决策机采用 State–Action–Outcome (SAO) 表示把这个过程形式化,其中 State 描述当前世界状态,Action 记录各个 Agent 在当前状态下采取的行动,Outcome 记录行动带来的收益、损失、成本和风险等结果。值得注意的是, State 区分宏观状态和更细的可量化状态 。在案例中,摩擦升级可以是宏观状态,关税水平、商品价格、供应链受影响程度等可以进入更细的状态记录。 此外,系统还单独考虑外部冲击,比如政策突变、环境变化或其他不由 Agent 控制的事件。一次行动和外部事件发生后,世界状态随之更新。更新后的状态再成为下一轮行动的起点。如此循环往复,形成了一条连续的 SAO 轨迹。 图 4:SAO 运行过程 负责把这些状态真正维护起来是 MetaWorld ,它输出的是一套可以计算和更新的结构化世界状态。状态又可以拆成三个层次:Environment Layer 记录所有参与者共享的整体环境,例如局势阶段、资源价格等;Agent Metrics Layer 记录每个 Agent 的资源、能力和目标进展;Relationship Matrix Layer 记录不同 Agent 之间的关系变化。 MetaWorld 还使用 因果 DAG (Causal Directed Acyclic Graph) 约束状态如何变化:变量之间可能的影响,在建模阶段就被组织进因果关系图。推演过程中,系统更新节点状态和因果边的权重,但不会每一轮重新生成一张因果图。 这对长程推演很重要。前一轮关税变化影响价格,价格又改变企业选择和其他参与者的回应,这些变化都需要被保留下来,才能继续往后算。MetaWorld 承担的就是这
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱