智能AI
morning
一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一
摘要
一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一 思邈 2026-08-24 21:21:22 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。 同样是今年,OpenAI、Anthropic、英伟达等科技巨头相继官宣入局AI4S这一方向。 这批“跨界”大厂玩家的目标高...
量子位
AI科学家
发现回合
一篇论文改写AI科研评价规则
中国公司拿出实践数据
双榜第一
2026
凹非寺
公众号
QbitAI
2026-08-24
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一 思邈 2026-08-24 21:21:22 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。 同样是今年,OpenAI、Anthropic、英伟达等科技巨头相继官宣入局AI4S这一方向。 这批“跨界”大厂玩家的目标高度一致:不只做科研辅助工具,而是打造能自主跑完“假设→设计实验→执行验证→迭代优化”完整科研循环的“ AI科学家 ”。 不只这些科技巨头,有许多公司已经更早入场。成立于2024年的中国企业 深度原理 ,是全球最早押注AI自主科研方向的公司之一。 这一赛道背后是一片广阔的“金矿”。一旦AI能够实现自主闭环科研, AI就能从“卖软件”升级为新材料、新药物等万亿实体产业的生产力基座 。 国家战略层面也重视这个赛道。AI驱动科学发现已被纳入 我国新一轮科技强国战略 。 行业越热,一个问题就越绕不开:怎么评价这些“AI科学家”们到底做得好不好? 旧的衡量标尺,已经不够用了 长期以来,行业通用的衡量AI科研水平的标尺是HLE这类闭卷知识考试。 它们本质上是只看最终答案的考卷,只看答案,不会看答案生成的过程。 获得高分的这类AI科研工具,通常让它做一个实际实验就会暴露问题:它们可能可以流畅的引用文献,但无法停下来审视反思异常数据,也可能给出看似头头是道,实际上无法执行的实验方案。 8月19日,一篇名为《Measuring AI Scientists: From Exams to Discovery》的论文发布,第一次为“AI进行真实科研的水平”提出了系统完整的评价范式,正式填上了这个衡量标尺的缺口。 论文由中国AI4S企业深度原理(Deep Principle)联合微软研究院、斯坦福大学、FutureHouse、Edison Scientific、艾伦人工智能研究所、加州大学伯克利分校等全球顶尖产学机构共同完成。 全球最大材料开源数据项目Materials Genome和库Materials Project创始人Kristin Persson、FutureHouse和Edison Scientific的创始人,近期《Nature》期刊Co-Scientist论文核心作者Andrew White、 科研智能体评测标杆ScienceWorld核心开发者Peter Jansen、2023年Nature上AI4S review的第一作者Yuanqi Du、 Terminal Bench的最后通讯作者Ludwig Schmidt等AI4S泰斗级学者奠定了框架的学术权威性; 深度原理作为唯一的中国产业代表 ,以真实研发管线跑出来的一线经验,让这套框架具备落地的可操作性。 文章中甚至出现 诺贝尔化学奖得主Frances Arnold的署名 ,一个不以AI见长且几乎不在AI4S界出现的科学家的名字,表明科学界的“权威”对这个方向的日益重视。 2026年,从科技大厂到创业公司,各类玩家纷纷入场AI科研赛道,行业竞争加剧。这一评测体系在这个时机出现,有其必然性。 如何系统、完整地评价AI的科研水平 论文的核心创新,是提出了 发现回合(discovery episode) 的评估体系。 这一体系的核心逻辑是用“ 综合考核 ”的形式,全程记录AI在整个科研周期里的每一步决策,最终对整条轨迹的科学性、严谨性和有效性进行综合评分。 考核方式和以前的“应试”逻辑迥然不同。 围绕科研闭环的三个阶段:科研假说、方案执行、实验结果解读,这个评估体系分别建立了评判维度,最终还要进行“全流程闭环测试”,衡量AI产出真实科研发现的综合能力。 △论文指出知识评测和发现评测的差别,并定义“发现回合”包含的评估要点 这套体系还重新定义了失败数据的价值:失败的实验数据恰恰是训练和评估AI科研的核心资产。 人类科学家能从失败中总结经验、规避弯路,AI做科研也应该学会从失败中获得经验。 而且,这个考核还对AI科研结果的真实性和独立性提出了高要求,确保实验结果是“货真价实“的新发现,不是无法实证的“自宣称成果”。 深度原理的MIRA,就是这套体系的现实样本 在这篇标准论文发布之前,头部玩家已经在产品中跑通了闭环逻辑, 深度原理的MIRA平台就是其中最典型的产业样本 。 普通科研AI的定位是“答题工具”,科研人员给出明确问题,AI返回对应答案。 MIRA的设计逻辑与普通科研AI截然不同,它搭建了覆盖“假设生成→模拟计算→实验验证→知识沉淀”的完整闭环系统,用三层架构 实现真实科研团队的完整协作逻辑 。 上层是分工协作的多智能体小队,可以统一规划和调度科研进程; 中层是打通高性能计算与自动化实验室的双执行引擎,实现干湿实验室联动; 底层是可沉淀、可复用的科研记忆体系,让每个项目的数据和试错结论都能留存,成为后续研究的基础。 △AI Scientist Mira实际操作页面 这套设计的产业价值,已经被公开基准测试印证。 在化学、能源、材料综合评测Research Claw Benchmark和药物发现评测Science Agent Arena中,MIRA均位列第一,且完成单项任务的平均成本也同样处于行业最优水平(最低),同时在性能和成本两个维度形成优势。 △MIRA在Research Claw Benchmark等评测中的结果 △Science Agent Arena药物发现榜单:MIRA以81.1%的综合分位列第一 深度原理此前推出的React-OT模型,可在0.4秒内计算化学反应过渡态,奠定了平台底层的高精度计算能力。 MIRA正是在这类专业模型的基础上,进一步串联起科研全流程。这一演进路径,恰是整个AI4S行业从工具到平台、从单点到闭环的缩影。 作为这套评测体系的核心产业共创方,深度原理已依托MIRA与自建高通量实验平台的干湿闭环,在 锂电、工业冷却液、新能源材料 等赛道布局多条自研管线,由AI主导全周期科研,真实沉淀闭环数据,让平台与评测框架形成持续的互相验证与迭代。 跨越干湿实验室的完整科研实践数据,是帮助AI快速掌握假设边界、规避重复试错的核心资产,预计未来也将成为下一阶段AI for Science发展的关键基础设施。 结语 这一标准范式的发布,是AI for Science赛道的一个里程碑节点,给所有奔跑的玩家划出了清晰的评判标尺。 但检验这个新标尺的数据却不易得。只有像深度原理和Edison Scientific这些拥有化学、材料、生物全流程研发能力、并且是AI native的公司才有可能做到。 过去的上半场,行业比拼的是“谁懂得更多”——大厂拼基座、拼参数、拼考试分数,用越来越难的题库,证明模型的知识厚度。 这些努力奠定了AI科研的基础,但也逐渐摸到了天花板。 接下来的下半场,比拼的将是“谁能真的做出东西”。 今年以来,从海
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱