首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI

2026-08-09 1 阅读 约9分钟阅读 闻乐
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 当题库追不上模型,AI开始给自己出题:中国这支团队跑通了数据层RSI 闻乐 2026-08-09 11:40:25 来源: 量子位 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 硅谷今年最贵的词,叫 Recursive Self-Improving 。 它就是指让AI参与迭代自身的模型、算法、数据和研发流程。 这个概念有多火呢? Jeff Dean 离职创办的Discovery Loop,方向就是探索AI自动化科学研究。 不只姐夫,AlphaGo缔造者 David Silver 等一众大牛也在同一条赛道上。 看得出来,这些顶级AI研究者正在形成一个共识: 让AI参与创造下一代AI,让AI持续自我改进并构建更强的AI 。 在这个共识之下,一个更棘手的问题出现了。 模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来? 一支中国团队给出了他们的答案。 由 上海交大人工智能学院、深势科技、上海算法创新研究院 组成的 无尽前沿团队 发布 BigBang-V1 —— 这是首个基于recursive self-improving原生方式训练出的基座模型。 在训练过程中,出题、解题、验证都交给AI把控,通过可验证前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。 35B跑赢1T大模型 模型已开源,技术报告也同步公开。 BigBang-V1参数规模35B,推理时激活约3B参数,支持262K长上下文。 它的 后训练数据100%由AI自主合成,以科学前沿任务为核心 。 在这样的条件下,模型在长程搜索、代码、科学研究、AI研究等评测中, 拿下全部35B模型里的10项第一 。 不仅如此,在FrontierScience Research、PaperBench等多项高难度科研任务上,成绩甚至超过了1T级的DeepSeek V4 Pro Preview。 基准分数之外,具体任务里的表现更能说明BigBang-V1解决复杂问题的水平。 先看一个高难度生物信息学任务。 转座子定位 要求在全基因组测序数据里定位一个47bp的转座子插入位点,模型不仅要识别相关序列,还得遵守RefSeq染色体命名和1-based坐标约定。 BigBang没有去猜坐标,而是利用转座子与染色体之间的连接证据做约束映射: 一个junction对应一个坐标,最终把断点锁定在4144431,每一步证据都可追溯。 在论文复现任务里,BigBang的表现又像一个会自我纠错的工程师。 任务要求 把LBCS论文复现为可运行的代码仓库 ,它在通读完论文之后没有急着交卷,而是在冒烟测试里发现自己写出的实现违反了论文的核心主张: 样本量被固定死了,核心集根本没法收缩。 它推算了扰动规模,发现无法越过触发阈值,于是连续否决了三个候选修复方案,最终把连续扰动改成二进制掩码翻转,问题才真正解决。 第二轮它又发现一个梯度项从计算图中脱离,主动恢复了梯度流,最终复现评分0.7657,全部485个评分点通过331个。 这些案例体现的并不只是分数。 BigBang真正展现出的是 把多步证据组织成可验证结论 的能力,以及 在失败中发现问题、修正方案 的本事。 对科研AI来说,这两种能力恰恰最要紧。 毕竟,科研不是背答案,而是从噪声里找证据,在出错时改方案。 不过,以科研任务为核心构建的数据,并没有把BigBang-V1训练成只会答科学题的垂直模型。 BrowseComp基准达到76.5,SWE-Bench Pro拿到54.2,能力增益同时迁移到了长程搜索、软件工程、代码等场景。 我们也拿它实测了一把长程搜索。 让它盘点8月第一周AI圈的大事。它一天一天连着检索了二十多轮、翻了十几个来源。 先用定位候选事件,再逐条打开信源交叉验证,最后还专门找到一手页面核对细节,连发布日期都逐个确认才给出结论。 而且它现搜列出的来源全部真实可访问。 然后我们又让它写了一个太空射击小游戏。 代码写得非常丝滑,打中后爆炸产生粒子特效,左上角还展示了分数、生命、等级游戏UI。 100%纯AI合成的训练数据,为什么能有这样的表现? 要解开这个疑问,得先从训练数据本身说起。 训练数据生产,也可以成为AI优化对象 Recursive Self-Improving火热,业界也都在谈论,但大多数探索还仅仅徘徊在概念层,真正跑通完整闭环的落地案例并不多。 落到实际工作里,现在常见的有两类尝试。 一部分方案只是给模型套上一层工具外壳,比如harness,让模型自己调调工具、改改提示词。 但这样相当于只是把模型的调用方式做了增强,底层的训练管线几乎原封不动,并没有触动模型自我迭代的根源。 还有一类做法则是用大模型对生成的数据做打分筛选。 但这套评判标准是人类预先写死的规则,筛选逻辑本身不会跟着模型能力成长而自我演化。 模型变强之后,旧的评判标尺很快就会失效,依然源源不断产出低价值样本。 单纯靠扩大数据集规模、对已有数据反复清洗过滤,已经很难再撬动能力的进一步跃升。 训练数据仍由人类逐题生产, 模型的进化速度被人类出题的速度卡住 ,这是Recursive Self-Improving落地的核心问题之一。 BigBang团队换了一个角度思考这个问题。 如果模型可以自我改进,那么能不能让训练数据的生产系统本身,也成为被优化的对象? 于是,问题从「如何收集更多科学数据」,变成了「如何让数据生产系统,随着模型能力一起持续进化」。 要解决它,就要回到数据质量这一源头,数据质量不是清洗洗出来的,是任务本身的属性决定的。 如果想要搭建一套能持续自我进化的数据系统,任务必须同时满足两个条件。 首先是 前沿性 。 任务要位于当前知识或模型能力的边界,甚至没有已知最优答案。 新理论、新数据、新工具不断出现,科学前沿就会持续产生新问题,不会像静态题库一样被模型迅速耗尽。 其次是 可验证性 。 候选方案要能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具做客观检查。 只有前沿而无法验证,系统拿不到可靠训练信号;只有验证但缺乏难度,任务又会迅速落后于模型能力。 二者缺一,数据都会快速贬值。 BigBang团队将科学领域作为模型的训练载体,恰好同时满足前沿性与可验证性两大条件。 它天然组合了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析和结果写作,相当于一套面向通用智能的综合课程。 Jeff Dean说Discovery Loop这条路线适用于有可衡量目标的科学和工程领域,BigBang选科学当训练场,底层逻辑同源。 用可验证的前沿任务牵引数据生产,让数据生产系统跟着模型一起进化,这就是BigBang给出的回答: AI advancing science, and science advancing AI.(AI推动科学,科学推动AI) AI开始决定,下一代AI学什么 把理论答案落为工程实现,BigBang的关键是一套 能持续修改和改进自身生产策略的自演化合成数据
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱