首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

当 AI 开始为 AI 造“认知外骨骼”:不训模型,也能让小 AI 能力翻倍?AI4AI 正从这里开始

摘要

2026 年,AI 领域正在发生一个很容易被普通用户忽略、却可能相当深刻的变化。过去几年,行业讨论 AI 能力时,最常见的问题一直是: 模型有多大?推理有多强?下一代模型又提升了多少? 但到了今年,越来越多注意力开始从 “模型本身” 移向模型周围的整个系统。2 月,OpenAI 就开始以 Harness En gi neering 为题讨论如何通过环境、规则、验证机制和工程约束让 Agent 更可...

Harness Builder Target AI4AI OpenAI 100 Strong Weak Test GPT
2026-08-30 1 阅读 约10分钟阅读 机器之心
分享:
字号:
2026 年,AI 领域正在发生一个很容易被普通用户忽略、却可能相当深刻的变化。过去几年,行业讨论 AI 能力时,最常见的问题一直是: 模型有多大?推理有多强?下一代模型又提升了多少? 但到了今年,越来越多注意力开始从 “模型本身” 移向模型周围的整个系统。2 月,OpenAI 就开始以 Harness En gi neering 为题讨论如何通过环境、规则、验证机制和工程约束让 Agent 更可靠; 7 月,OpenAI 更是直接披露 Codex 每周用户已经超过 500 万,其中超过 100 万人的使用场景已经走出传统编程。Harness 这个「模型外部运行框架」也越来越频繁地进入企业 AI 的讨论中。 这一变化背后其实藏着一个比 “哪个模型更强” 更本质的问题: 一个 AI 系统的能力,究竟有多少存在于模型的大脑里,又有多少存在于组织这个大脑工作的方式里? 我们可以做一个很简单的类比。如果语言模型是一名员工,那么过去提升 AI 的主流路线,是不断把这名员工送去培训:给它更多数据、更好的反馈、更昂贵的训练,最后真正改变它 “大脑里的参数”。这就是包括知识蒸馏、后训练在内的许多传统能力迁移方法。但另一条路线是: 完全不改变这个员工本身,而是给它设计一套更好的工作制度。 复杂任务先自动分类; 容易算错的部分交给计算器; 需要长期记忆的信息写进表格; 固定规则直接写成程序; 最后再设置检查清单,防止答案格式出错。 在这个过程中,员工的大脑一点没有变,但整个系统却突然变得可靠得多。从这个角度出发,来自 Salesforce AI 和 UIUC 的研究人员在最新的研究中,探索了这个问题的更激的进版本: 能不能让一个更强的 AI,自动为一个更弱的 AI 设计这套 “认知外骨骼”,从而在完全不训练弱模型的情况下,把自己的部分能力迁移过去? 论文把这个问题称为 Strong-to-Weak Scaffolding。这一概念,也正是 「AI4AI」 最本质的样貌和雏形。 论文标题:AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 论文链接: https://arxiv.org/pdf/2608.12307 实验给出的答案相当惊人:在主实验中,一个原本平均准确率只有 0.488 的 GPT-5.4-mini,在强模型自动设计的 Harness 加持下,最佳结果达到 0.912 ,已经接近翻倍;57 次针对 GPT-5.4-mini 的自动构建实验全部超过原始模型,而最佳方案甚至远远超过了不加 Harness、直接裸跑的众多更强模型。 但这篇工作的意义并不只在于让模型表现翻倍。真正有意思的是: 研究人员进一步拆开了这将近 100% 的提升,试图去回答究竟是什么被 “迁移” 了。 这其中隐藏的秘密,可能比单纯的分数更加值得我们挖掘。 一、不重训小模型, 而是让强模型 给 它设计工作方式 文章中整个实验的设置其实非常像现实中的 “师傅带徒弟”。 研究人员首先准备一个较弱的 Target AI「目标模型」 ,它是真正负责回答问题的 “执行者”。然后再给一个更强的 Builder AI「构建模型」 一个开放的编程环境。Builder 不负责最终考试,而是负责观察 Target 到底为什么会犯错,并围绕它设计 Harness。 所谓 Harness,其实可以理解成包在模型外面的一整套工作机制: 可以判断问题属于什么类型; 可以针对不同问题选择不同 Prompt; 可以写 Python 程序处理部分推理; 可以建立显式的状态和规则; 可以做答案检查和格式修正; 甚至可以发现某些任务根本没必要让模型自己 “想”,直接写一个可靠算法就能解决。 在这其中最关键的一点是, Builder 始终不能看到最终测试题。研究人员只随机开放每个 Benchmark 的 5% 数据 作为 Validation Set。Builder 可以在这少量样本上不断测试 Target、分析错误、修改代码和 Harness;等到 Builder 认为系统设计完成之后,整个 Harness 会被冻结,然后直接拿去跑此前完全没有见过的 Hidden Test Set。 所以,对于 Builder AI,它所构建的 Harness 不能只是简单的让 Target AI “背答案”。它真正需要做的,是从少量案例中发现: 这个任务到底有什么结构?这个小模型到底弱在哪里?哪些思考应该继续交给它,哪些思考应该被搬到系统外面? 图 1:AI4AI 的整套设计流程:Builder AI 并不直接解决问题,而是给 Target AI 搭建脚手架以减轻其认知负担,从 Harness 角度实现最基本的 AI4AI 能力迁移。 二、用心智理论度量 AI 的认知负担分配 文章选择了四个 Theory-of-Mind「心智理论」Benchmark: BigToM、Hi-ToM、MMToM-QA 和 MuMA-ToM。 可以把 Theory of Mind 简单理解成: 理解别人 “知道什么、相信什么、想要什么” 的能力。 举个例子:小明把钥匙放进抽屉,然后离开房间;小红趁他不在,把钥匙移到了柜子里。问题不是 “钥匙实际上在哪里”,而是: 小 明回来以后,会去哪里找? 人类必须同时区分 “真实世界” 和 “小明脑中的世界”。而更困难的问题甚至会继续套娃: 小红认为,小明以为,小红知不知道钥匙的位置? 这类任务既包含可以形式化的状态追踪,也包含递归信念、隐含意图、对话理解甚至 Bayesian Goal Inference,因此很适合观察: AI 到底能把多少思考外包给程序,又有多少真正需要语言模型自己完成。 论文随后让不同强度的 Builder,在 Cursor、Claude Code、GPT Codex 等 Agentic Coding Environment 中自由设计 Harness,并进行了 72 次实验构建 ,从效果、稳定性、验证预算、Harness 技巧、平台差异、Target 差异、Builder 推理强度、认知负担以及残余错误等多个角度进行了拆解分析。 表 1:以 GPT-5.4-mini 为 Target AI 的实验结果摘要及对比 图 2:全量主实验结果 三、给小模型换工作方式比直接上强模型还有效 我们先来看最简单的一组数字: GPT-5.4-mini 什么都不加,直接回答四个任务,平均准确率是 0.488 所有自动构建 Harness 的实验平均表现为 0.763 (最佳一次 0.912 ),相对原模型提升约 86.7% 作为对比,更强的 GPT-5.4 在没有 Harness 时只有 0.619 。 也就是说,在这些任务上,一个被好好 “组织起来” 的较弱模型,可以明显超过一个裸跑的更强模型。更重要的是,这并不是碰巧撞中了一个特别好的 Run。针对 GPT-5.4-mini 的 57 次 Scaffold Run 全部都能超过原始 Baseline ,11 种 Builder Configuration 平均也全部产生正向提升。 当然,这并不意味着 Harness 已经
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱