智能AI
morning
VC开始靠AI预测未来了
摘要
VC开始靠AI预测未来了 思邈 2026-08-25 10:16:43 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 七月,DigClaw的预测框架Rhizome v1,在FutureX评测平台上取得了 #1、#3、#7 三个席位。 三个席位来自三个不同的基础模型——包括Kimi-K3、DeepSeek-V4-Pro等。同一套框架同时让它们进入Top 7,DigClaw是唯...
量子位
VC开始靠AI预测未来了
2026
凹非寺
公众号
QbitAI
DigClaw的预测框架Rhizome
在FutureX评测平台上取得了
三个席位
三个席位来自三个不同的基础模型
2026-08-25
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> VC开始靠AI预测未来了 思邈 2026-08-25 10:16:43 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 七月,DigClaw的预测框架Rhizome v1,在FutureX评测平台上取得了 #1、#3、#7 三个席位。 三个席位来自三个不同的基础模型——包括Kimi-K3、DeepSeek-V4-Pro等。同一套框架同时让它们进入Top 7,DigClaw是唯一做到这一点的参赛方。 59道覆盖政治、经济、科技领域的真实事件预测题,不存在训练数据泄露的可能。 这组成绩支持了DigClaw正在验证的判断: 预测能力可以沉淀在基座模型之外。 随着基座进步,系统可以获得能力红利;预测轨迹、结算反馈、校准经验和持续演化的工作流,则持续沉淀在系统内部。 △DigClaw 2026Jul.Week4在FutureX榜单表现 这不是一次偶然的竞赛结果, 这是DigClaw对“预测到底应该怎么做”这个问题,给出的第一个外部验证。 预测是AI最被低估的能力 随着预测任务逐渐走向标准化和工程化,AI也被寄予了规模化处理复杂预测问题的期待。 但这里有一个根本性的问题:大语言模型天然不擅长预测。 LLM学习的是correlation,而非causation。它们从过去的语料中提取模式,但“学习过去”和“预测未来”是两件本质不同的事。 这带来了三个致命问题: 因果方向盲区 。模型知道A和B经常一起出现,但不知道是A导致B,还是B导致A,还是存在共同原因C。 干预推理失效 。你无法问模型“如果美联储降息,会对东南亚科技股产生什么影响”——因为它只学过历史共现,没有因果图谱支撑干预计算。 校准缺失 。模型输出的“70%概率”没有经过任何概率论意义上的校准,本质上只是token分布的副产品。 到目前为止,现有方案各有局限:人类群体智慧(prediction markets)需要流动性,冷门问题上价格不可信; LLM模式匹配没有因果结构;端到端训练有结果导向偏差——一个逻辑严密但“答错”的推理过程会被惩罚,碰巧“猜对”的粗糙判断反而被强化。 这正是DigClaw存在的原因。 DigClaw构建的是以因果结构为骨架、以概率计算为引擎、以搜索智能为数据管道的预测基础设施。 核心假设是:预测不应该由一个模型端到端完成。 搜索、因果推理、概率推断是三个正交的能力,应该由三个专门的系统分别解决,然后结构化地组合。 三个前十,验证预测能力的跨基座迁移 FutureX是当前最具挑战性的实时预测榜单:每周发布真实世界事件预测题目,提交预测时标准答案尚未产生,事后结算。 数据集托管在HuggingFace,评估框架 开源 在GitHub,结果可复现、可验证。 Rhizome在三个基座上采用同一套预测框架和运行条件,各自独立生成并提交答案,不做跨模型聚合。 因此,这三个名次是同一套系统方法在三个基座上的分别运行,即一次清晰的跨基座对照。 但这并不意味着基座模型不重要。 基座仍然提供语言理解、推理和工具使用等通用能力。 这一榜单结果说明的是: 如何组织检索、处理时间、表达概率、维护证据和控制长程运行,可以形成独立于模型权重的系统能力。 如下是DigClaw在FutureX上Rhizome框架的technical report: Rhizome Technical Report Rhizome的设计围绕三个工程判断展开:搜索和推理必须解耦、预测轨迹必须完整保留并形成校准资产、概率更新必须感知因果结构: △DigClaw预测大脑架构图 设计决策一:搜索与推理多模型解耦 Rhizome的核心设计洞察:搜索质量和推理质量是两个正交的问题,不应由同一个模型同时优化。 当前主流的DeepResearch agent(Perplexity、Gemini Deep Research)将搜索和推理绑定在同一个模型内——搜索质量被推理负担拖累,推理质量被搜索噪声污染。 Rhizome的做法是彻底解耦:搜索agent只负责找相关信息,推理层只负责在已有证据上做结构化推理。 预测任务对信息的需求不是“准确回答用户问题”,而是“尽可能发现所有相关联的信号”。 搜索agent的优化目标是信息相关性(relevance),不是答案正确性(accuracy)。如果搜索agent被训练去“找答案”,它会倾向于找到看起来像结论的内容,这恰恰最危险。 训练采用强化学习框架(SearchRL),两条路径并行迭代: 路径A:开源模型RL微调——在8B/30B参数的开源模型上,以搜索相关性为reward做RL训练(参考:Search-R1, COLM 2025; ReSeek, ICML 2026) 路径B:闭源模型Harness——对Claude/GPT等闭源模型,构建外部搜索约束框架 不同基座在预测任务中呈现出稳定差异:有的适合长时间检索与复杂推理,有的更擅长定量建模,有的则在成本和响应速度上更有优势。 Rhizome将预测协议、Agent编排、工具调用和结果评测放在基座之外,机构可以根据任务价值和运行规模选择基座,在推理能力、成本与响应速度之间做取舍。 设计决策二:轨迹记录与概率校准,沉淀数据资产 Rhizome为每一次预测保留一条带版本信息的完整轨迹:题目的时间条件与结算标准、预测时能够获得的证据、Agent编排与工具调用过程、最终答案与概率,以及对应的模型和系统版本。 这些记录形成于结果揭晓之前,保存了Rhizome在尚不知道答案时做出的真实判断。 事件结算后,Rhizome将预测轨迹与现实结果放回同一条记录中,回看当时掌握了什么信息、遗漏了哪些反向证据,以及错误发生在检索、时间判断、推理、答案表达还是概率校准。 一次高置信度的错误与一次接近五五开的错误,虽然都被记为“答错”,暴露的问题并不相同。 Rhizome会对同一道题进行多次独立预测。系统不会把结果简单平均,而是先在对数几率(logit)空间进行聚合,再结合已结算题目的Brier Score调整极端化强度。 不同轨迹提供的信息越独立,聚合结果可以越明确;证据重叠越多,调整就越克制。 △DigClaw预测概率校准方式 在此基础上,Rhizome通过Platt缩放,利用已结算题目识别持续的过度自信或过度保守,并对后续概率进行校正。 校准的标准很直观:系统给出60%的事件,长期应该约有六成发生;给出80%的事件,长期应该约有八成发生。 每次运行对应到当时的系统版本与关键配置,使概率变化和异常结果能够回到具体原因。 基座可以升级或更换,问题定义、证据记录、信念变化、结算结果和校准经验仍然保持连续。 这类反馈数据无法在结果揭晓后批量补造——每个样本都必须在未来尚未发生时留下判断,再等待现实给出答案。 代码可以复刻,时间沉淀的数据资产无法速成。 设计决策三:因果链感知的持续更新 事件尚未结算时,新的数据、政策和市场信息会持续出现,系统需要判断原有概率是否应该更新。 Rh
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱