智能AI
morning
35B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了
摘要
编辑|+0、杨文 AI 开始参与造 AI,下一步学什么成了新问题。 Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后 ,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。 视频来自:https://www.youtube.com/watch?v=aR20FWCCjAs 行业的注意...
BigBang
https
35B
endlessfrontier
tech
开始参与造
下一步学什么成了新问题
Ilya
Sutskever
去年底指出
2026-08-08
1 阅读
约10分钟阅读
机器之心
字号:
编辑|+0、杨文 AI 开始参与造 AI,下一步学什么成了新问题。 Ilya Sutskever 去年底指出,预训练数据终将耗尽,单纯把现有训练规模再放大 100 倍,很难带来根本性变化。经历数年的规模扩张后 ,AI 行业正在重新进入「研究时代」,下一次能力跃迁需要新的训练方法和学习机制。 视频来自:https://www.youtube.com/watch?v=aR20FWCCjAs 行业的注意力也开始转向研究流程本身 。昨天,在谷歌效力 27 年的技术元老 Jeff Dean 官宣离职,拉着 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 三位老伙计共同创办 Discovery Loop。而这家公司干的,就是自动化科学与工程中的完整实验循环,让 AI 提出实验、完成实现、运行评估,再根据结果调整下一步方向。 那么问题来了,当模型越来越擅长解决问题,下一批真正有价值、足够困难的问题该由谁提出?这些问题的答案又该如何可靠验证? 来自上海交通大学人工智能学院、深势科技和上海算法创新研究院的无尽前沿团队,最近给出的思路是让 AI 参与创建、筛选和迭代自己的训练任务,并由此发布 科研大模型 BigBang-V1 。 模型:https://huggingface.co/endless-frontier/BigBang-v1 项目主页:https://endlessfrontier.tech/ 论文标题:BigBang: Pursuing Open-Ended Intelligence through Self-Evolving Synthesis of Verifiable Frontier Tasks 完整技术报告:https://endlessfrontier.tech/ BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,在后训练阶段使用了完全由 AI 合成的数据。实验结果显示,在所选 35B 规模模型中,BigBang-V1 在 10 项评测上取得最高已报告分数,并在若干高难度任务上达到或超过部分更大规模的前沿模型。 BigBang-V1 与代表性闭源、开源前沿模型及 35B 参数规模模型在长程搜索、编程、科学研究和 AI 研究基准上的对比。“-” 表示相关分数尚未公开或未经测试。 又一次「小模型挑战大模型」的叙事?并非如此,BigBang-V1 的真正亮点是它背后的数据生产方式。 在传统流程中,人类专家确定方向、设计问题、准备答案并检查结果,模型负责学习已经整理好的数据。BigBang 则试图把其中更多工作交给 AI,它不仅生成问题和答案,还参与修改数据生产程序、调用工具完成任务、检查候选结果,并根据数据是否切实提升了模型能力调整下一轮合成策略。 过去,AI 主要是被出题、被训练、被考试,BigBang-V1 则让 AI 开始参与决定 下一代模型应该学习什么 。 模型越来越强,人类开始出不动题了 Scaling Law 大家已经耳熟能详,增加参数、投入更多算力、收集更多数据,模型能力通常也会随规模增长而提升。 过去几轮模型能力的跃迁,几乎都可以从参数、算力和数据的扩张中找到解释。久而久之,「更大」也就成了「更强」的同义词。 但模型也不能只依靠现有数据持续扩张,随着高质量数据和有效任务被反复使用,继续增加投入所带来的边际收益也会逐渐下降。 尤其当模型开始接近人类专家在部分任务上的水平, 下一批真正能让模型继续进步的训练任务,要从哪里来 ? 这和「互联网上还有多少文本」并不是一回事。 网上的数据当然还有很多,但具备训练价值的新任务未必充足。模型已经反复见过的知识,再学十遍也难以扩展能力边界。真正困难的是,如何持续提出模型还不会、又值得学习的问题。 这类问题通常需要专业研究人员来设计、求解和验证。GPU 可以采购,专家时间却很难按卡扩容。大模型几天就能消耗掉海量数据,人类专家却无法突然进入倍速模式。哪怕一天喝三杯咖啡,也很难跟上计算集群的数据胃口。 更准确地说,模型缺的不只是题,而是「题目加反馈」。 一道题足够难却无法判断答案对错,很难形成稳定的训练信号;一道题容易验证却低于模型当前能力水平,训练价值同样有限。 真正适合持续训练的任务,需要同时满足两个条件: 足够前沿,也能够验证 。前沿性决定模型能否学到新东西,可验证性决定它学到的是不是对的。 BigBang 把 科学研究 选作了这两个条件的交汇点。 科学会不断产生新问题,同时提供形式化证明、程序执行、数值计算、模拟器、数据库、实验反馈和领域规则等多种验证手段。模型的答案可以直接放进工具里跑一遍,不必只靠另一个模型来评判。 更重要的是,解决一个完整的科学问题,往往需要搜索资料、判断证据、提出假设、编写代码、调用工具、分析结果,并在失败后调整路线。科学因此成为训练通用问题解决能力的综合课程。 但模型能力会不断变化,固定题库迟早会过期。上一轮还很困难的问题,训练之后可能迅速变成送分题。BigBang 真正要解决的,不只是「如何生成更多科学数据」,还得是 如何让训练任务的生产系统,随着模型能力一起变化 。 BigBang 如何让「造题程序」自己进化? BigBang 的技术框架包含内外两层循环。 内层持续改进合成数据,外层验证这些数据 能否真正 提升模型 。 内层循环 由 Generator Agent 和 Critic Agent 组成。前者持续生成并求解候选任务,后者负责对抗式审查。通过审查的样本进入训练数据池,存在缺陷的样本会被修改或淘汰。Critic 给出的反馈还会影响下一轮生成策略。 BigBang 整体框架。Generator Agent 持续更新数据合成策略并构造任务,Critic Agent 执行质量评估和约束检查,经过筛选的合成数据用于后训练 BigBang-V1。 Generator Agent 并非只根据提示词批量生成题目,它以代码 Agent 的形式工作,可以直接修改、执行和调试数据合成程序,在任务构造、工具使用、答案验证和样本筛选等环节搜索更好的策略。 每轮实验结束后,生成器会记录修改动机、结果和失败原因,供后续轮次继承。系统优化的对象由单条样本扩展至整套数据生产程序。 Critic Agent 承担快速评估。 理想情况下,每改变一次合成策略,团队都可以重新训练模型,再观察下游能力是否提高。这样的实验成本很高,反馈周期也很长。Critic 先估计一批数据的训练价值,为 Generator 提供更密集的优化信号。 它的审查分为两层。第一层检查基本约束,包括推理轨迹是否保留足够信息、工具调用是否有效、数据格式是否完整,以及样本能否被训练与执行系统正确解析。第二层检查更高阶的质量,包括关键结论有没有证据、不同步骤是否存在矛盾、最终答案能否客观验证,以及任务是否需要非平凡的研究和推理。 这套内层循环可以持续改进合成策略,却仍然存在一个风险。Critic 可能把「看起来很难」误判成「能够帮助模型进步」。一个任务拥有复杂叙述和很长的工具轨迹,不代表它具备真实训练价值。 BigBang 为此加入 外层循环 ,用于校准这种偏差。 系统会选择不同版本的数据生产管线,使用其生成的数据分别训
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱