智能AI
morning
1300万天压到0.25秒!分子之心用AI把化学反应拍成电影,成果登Science子刊
2026-09-15
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 十万个原子,发生一次化学反应,用计算机模拟一遍要多久? 如果用传统的量子化学方法,每往前走一步, 理论上要约一千三百万天,大约三万五千六百多年,现实中根本难以执行。 原因一点也不复杂。 模拟是一步一步往前推的,每一步只推进1飞秒,也就是千万亿分之一秒;可每推这么一小步,都得把十万个原子的电子结构和相互作用力重新算一遍。 这,只是一步。 想看完一次完整的反应,得走几十万甚至几百万步。 所以计算化学领域一直有个绕不过去的「不可能三角」:精度、速度、尺度,三样只能挑两样。 量子力学看得准,却跑不远,通常只能算几百上千个原子、皮秒级的片段。 经典力场跑得远,却看不见反应,成键关系一开始就写死了,化学键既不会断,也不会生。 把反应区交给量子力学、其余交给经典力场,结果区域边界本身又成了新的误差来源。 机器学习力场(MLFF)试图兼得,却还要通过长时间动态稳定性的考验。 这个三角,困住了计算化学几十年。 如今,一个中国团队正在把这个「不可能三角」的边界向外推。 分子之心(MoleculeMind)自主研发的反应性机器学习力场 QuantaMind ,以接近DFT的精度、与经典分子动力学相当的速度,在万原子级体系上稳定模拟了完整的酶催化循环,并在内部产业项目中把尺度推到了 十万原子、百纳秒 。 论文登上《Science Advances》。 而十万原子级反应体系的单步模拟耗时,已经从传统方法的千万天量级,压缩到了 0.25秒 。 一千三百万天到0.25秒,4.5万亿倍的提速,这不是优化,这是范式的跃迁。 为什么「反应性模拟」这么难 要理解QuantaMind的突破有多难,得先知道「反应性分子动力学」到底卡在哪。 常规的分子动力学(MD)能模拟分子结构如何运动——蛋白质怎么折叠、配体怎么结合、构象怎么变化。但它有一个根本局限: 原子之间的成键关系是预先固定的,不会自行断裂或形成新的化学键 。 这意味着,常规MD能告诉你「分子怎么动」,但无法告诉你「反应怎么发生」。 而酶催化、质子转移、配体结合后的构象变化、药物分子与靶点的共价作用,这些恰恰是研发中最关键的机制问题。 要模拟这些过程,需要反应性分子动力学:让AI在原子尺度上完整「看见」质子转移、化学键断裂与生成,乃至完整的催化循环。 但反应性模拟的难度,比常规MD高出一个数量级。 第一,精度要求极高 。 化学反应涉及电子结构的变化,只有量子力学方法(如DFT)才能准确描述成键和断键。但DFT的计算成本是O(N³)甚至更高,体系稍大就完全算不动。 第二,时间尺度要求极长 。 很多化学反应是罕见事件——水的自解离可能要跑几纳秒才出现一次,酶催化的限速步骤可能需要更久。 要捕捉这些事件,模型必须在数十万至数百万时间步的连续推演中保持稳定,不能跑着跑着就「崩了」。 第三,空间尺度要求极大 。 真实的生物体系包含蛋白质、底物、离子和大量显式水分子,动辄数万乃至十万原子。 精度、时间、空间三个维度同时拉满,这就是反应性分子动力学的「地狱难度」。 机器学习力场(MLFF)的出现,让人们看到了希望:用神经网络拟合量子化学数据,以推理代替每步电子结构计算,理论上可以兼顾精度和速度。 但MLFF有一个致命问题: 单个构型上预测准确,不等于能完成可靠的长时间模拟 。 准确生成一帧画面,不意味着能连续生成一部符合物理规律的「原子电影」。很多MLFF在短时间模拟中表现不错,但一跑长轨迹就出现能量漂移、构型崩坏,最终只能算小分子、短时间。 QuantaMind要解决的,正是这个「从一帧到一部电影」的问题。 QuantaMind怎么破局 三个关键设计 QuantaMind是分子之心自主研发的反应性机器学习力场框架。 MLFF本身已是国际前沿机构持续投入的方向,Meta、微软、DeepMind等近年来均发布了相关模型与研究。 但QuantaMind的关键,不在于简单堆叠更大的模型,而在于围绕「反应性」重新设计了数据组织和训练方法。 第一,以过渡态为中心的训练数据 。 许多MLFF主要从平衡或近平衡构象中学习,模型没见过「过渡态长什么样」,遇到断键成键就露怯。 QuantaMind重点纳入非平衡构型和以过渡态为中心的反应数据,论文用 5286个酶催化过渡态构型 训练模型,让AI「真正见过」键正在断裂、正在形成的瞬间。 这就像教一个人画画:如果只给他看成品照片,他永远画不出中间的动态过程;但如果给他看每一帧的分解动作,他就能理解运动的规律。 第二,DFT方法分类嵌入 。 不同泛函和基组的量子化学数据精度不同,传统做法要么只用一种精度的数据(浪费了其他数据),要么简单混合(模型分不清数据质量)。 QuantaMind将计算设置编码为模型可识别的类别特征,统一纳入训练,让模型能区分并利用不同精度层次的数据。 第三,主动学习式迭代闭环 。 面对新体系,QuantaMind先跑出轨迹,识别模型尚未充分覆盖的构型,补充DFT计算继续训练。 每一次新任务不仅解决具体问题,也沉淀可复用的反应数据,持续扩大模型能可靠处理的体系和反应类型,这是一个不断自我强化的数据飞轮。 稳定性也有硬指标:1ns NVE(微正则系综)模拟中,纯水体系的总能量漂移只有 10⁻⁵ kcal/mol/atom/ps 量级,可稳定支撑数十纳秒的长时间模拟。 这个数字看起来很小,但在MLFF领域,能量漂移控制在这个量级意味着模型真正通过了「长时间动态稳定性」的考验。 硬核验证 四个最震撼的数字 技术设计说得再好,最终要看数据。 QuantaMind的验证沿着体系和过程复杂度逐级展开,这里提炼四个最有冲击力的数字。 数字一:偏差降低87% 。 质子转移是生命化学中最基础的反应,质子扩散系数是对模型长时间反应性模拟能力的严苛检验——它不是一次跳跃的速度,而是质子沿氢键网络在水分子之间上万次「接力」后形成的统计结果。 QuantaMind对六种尺寸水体系分别做1纳秒模拟,最大体系24001原子,每条轨迹观察到上万次质子转移。最终预测扩散系数 0.87±0.10 Ų/ps ,与实验值0.94、0.96高度吻合。相比此前报道的同类MLFF研究(Huo et al . , 2023), 偏差降低了约87% 。 更关键的是,QuantaMind并没有专门训练过水合氢离子,它凭「通用反应能力」自己学会了质子跳跃。 数字二:AI自己算出了水的pH 。 水的自电离是一个极其罕见的事件,很难在有限模拟中直接捕捉。 QuantaMind在373K下对9,999原子体系模拟3纳秒,成功捕获多次自发电离事件,预测平均pH 6.34±0.06 ,与同温度实验值6.13±0.03接近。 模型并未预先写入传统恒pH模拟中的经验酸碱规则,而是从原子级反应动力学中自然涌现出与实验接近的宏观pH。又通过100条独立模拟估算酸碱中和速率,与实验值处于同一数量级,再现了皮秒尺度的微观中和过程。 数字三:pKa 5.81,与NMR实验值5.5接近 。 蛋白质残基的质子化状态会影响结构、相互作用和功能,但传统模拟通常需要预先指定这些状态。 QuantaMind将溶菌酶放入真实磷酸盐缓冲液中模拟20纳秒, 让组氨酸自己「决定」质子化 ,缓冲液中磷酸盐物种的电离、水解与
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱