智能AI
morning
让大模型真正学会「发现」,设计下一个实验
摘要
许多科学发现问题,本质上是在开放空间中面向特定奖励的决策问题。近期, 伦敦大学学院汪军老师领导的团队 发布了 大发现模型(Large Discovery Models, LDMs) ,专门用于解决科学发现领域中 “如何设计下一个实验” 的问题。 LDM 是一套递归式的基础模型架构,核心是将生成式基础模型与高斯过程奖励模型相结合:基础模型依托历史信息与上下文,在开放空间中持续拓展、重塑当前的有效搜索...
LDM
https
Large
Discovery
Models
discovery
Model
largediscovery
net
Auto
2026-08-30
1 阅读
约10分钟阅读
机器之心
字号:
许多科学发现问题,本质上是在开放空间中面向特定奖励的决策问题。近期, 伦敦大学学院汪军老师领导的团队 发布了 大发现模型(Large Discovery Models, LDMs) ,专门用于解决科学发现领域中 “如何设计下一个实验” 的问题。 LDM 是一套递归式的基础模型架构,核心是将生成式基础模型与高斯过程奖励模型相结合:基础模型依托历史信息与上下文,在开放空间中持续拓展、重塑当前的有效搜索空间;高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。LDM 能够依据实验数据与基础模型的上下文更新完成实时迭代,奖励信号也可以通过后训练融入基础模型参数,由此形成快、慢两套学习闭环。 论文:https://arxiv.org/abs/2608.15669 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search. 项目网站: https://largediscovery.net/ 项目 GitHub: https://github.com/yzailab/Large-Discovery-Models Hugging Face: https://huggingface.co/collections/Yangtze-ailab/large-discovery-model-v01 提供反馈:https://largediscovery.net/feedback/ LDM v0.1 在 Auto-Research(神经网络训练)、抗体设计、多目标分子优化三个场景取得初步验证: Auto-Research BPB 下降幅度是纯大模型反思的 2.4 倍 ; 抗体设计结合能相对纯大模型反思平均降幅达 18.2% ; 分子多目标超体积相对纯大模型反思和贝叶斯搜索提升 >60%。 为什么科学发现需要另一种大模型 近年来,大语言模型已经从对话、文本生成,拓展到数学、代码等领域的复杂推理与问题求解。其中一项关键技术,是依托可高效验证的奖励信号开展测试时搜索(Test‑time search)或强化学习。但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。 纯大语言模型拥有丰富的结构先验,可以编写代码、生成蛋白序列与 SMILES 表达式,但往往会将语言流畅度、生成似然度视作方案质量的评判标准,无法基于实验反馈校准自身的生成分布与不确定性;传统贝叶斯优化(BO)能够依靠后验均值和方差做出审慎决策,却通常局限于预先给定的有限搜索空间,很难探索全新模块、全新基团或是全新的序列家族。 图 1:大模型从生成、推理到开放式发现的演化。基于昂贵的黑盒实验评估,LDM 在开放式空间中不断迭代和改进实验设计。 Large Discovery Model(LDM) 融合生成模型与贝叶斯优化两者的优势,搭建起完整的实验闭环:生成模型拓展候选方案的边界,代理模型为每一个候选方案输出可靠的决策价值。模型不仅会在已知范围内优化,还能够判断何时探索不确定性较高的区域,甚至提出过往候选集合中从未出现过的全新方向。 探索与利用之外,我们还需要 “发现” 图 2:从利用、探索到发现。真正的 “发现” 会把尚未被表示的区域变成可搜索的新区域。 我们对开放式设计空间的认知可以被划分进 “认知矩阵”: “已知的已知”,指处于搜索范围内、性能已经被充分掌握的候选集合,可在该范围内通过利用(exploitation)寻找确定性的高质量解。 “已知的未知”,指已经纳入搜索范围,但性能尚不明确的候选集合,可在该范围内开展探索(exploration),实现由未知向已知的转化。 而 “未知的未知” 完全不在当前搜索范围或模型的表征范围之内,这就需要依靠发现(discovery),把全新的领域纳入搜索范围。 传统序贯优化讨论 exploration–exploitation:利用是在已知高价值区域精修,探索是在当前表示范围内收集信息。LDM 进一步强调 discovery—— 当候选池饱和时,模型要改变表示本身,把新机制、新结构或新家族纳入搜索。 生成模型结合统计模型,快慢两个学习闭环 LDM 由生成模型与经验价值模型共同驱动。生成模型输出程序、蛋白序列、分子等开放式候选方案;高斯过程(GP)基于已获取的实验数据,估算候选方案的价值与不确定性,从中选出最值得开展评估的设计批次。 图 3:LDM 的完整学习回路。快环在每次实验后更新数据与上下文;慢环把高价值搜索轨迹蒸馏进模型参数。 LDM 基于以下核心公式来构建下一次提议的分布: pθ,α 是大模型的生成先验,aₜ(x) 是 GP 奖励模型所导出的 acquisition value;θ 为大模型权重,α 为大模型推理参数,η 控制价值信号强度。该分布既保留生成多样性,又把实验预算推向更有价值的候选。 快学习闭环:用真实观测决定下一步 每一轮中,LLM 根据当前上下文生成开放式候选,灵活调整和扩张搜索边界;GP 用已观测数据,提供奖励的预期与不确定性。再通过 acquisition function(如 UCB、EI 或多目标 EHVI)给出实验优先级。高价值候选既可能表现更好,也可能显著减少不确定性。 生成:LLM 提出结构化、开放式候选的基础分布 筛选:GP 奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。 实验:通过 Test-time search (TTS)选择高实验价值的候选,用于代价昂贵的实验评估 更新:新结果写回数据与上下文,用于下一轮的实验决策 慢学习闭环:把高价值决策蒸馏进模型 快环解决单个任务中对于实验反馈的持续、快速适应,慢环则负责把 “基于经验提出新设计” 的元能力固化到模型参数中。LDM 保留 TTS 中的候选、搜索状态和采集函数值,构造按采集函数值加权的训练数据,从而通过 SFT 把 “何时利用、何时探索、何时跨出旧边界” 的策略蒸馏进生成模型。 慢闭环学习的不是静态高分答案,而是潜在的实验价值。 即便某个候选方案当前预测均值并不高,只要它能够打开全新搜索区域、或是为后续搜索提供新信息,就依然具备优先开展实验的价值。 三类任务:LDM 是怎样在快闭环中 “发现” 的 论文在代码、抗体和小分子三类开放式设计任务上测试 LDM。重点不只是终点分数,而是它能否跨过平台、切换搜索区域,并形成新的候选家族。这三类任务的设计空间是完全不同的模态: 代码:Auto-Research 可改变程序表示 序列:2011 规模的 CDRH3 组合空间 分子:开放式 SMILES 字符串空间,双目标 Pareto 优化 场景一|AutoResearch:从调参走向发现新训练机制 该任务的目标是,在固定硬件与训练时长约束下持续修改 NanoGPT 的 train.py 脚本,实现验证集 BPB 指标最小化。LDM 依靠大模型维护动态参数空间,有效参数空间会随着训练机制的迭代持续变化,同时搭建高斯过程代理模型,确定下一轮待尝试的方案。 图 4:Auto-Research 代表性轨迹
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱