智能AI
evening
模型换个Harness就「变笨」?EverMind把自进化从研究推向产品,让AI「越用越聪明」
摘要
机器之心发布 同一个模型,权重一个参数都不改,只是换一套 Harness,表现就可能大幅波动。这看似是 Agent 工程中的「玄学」,实际上暴露了自进化走向产品必须回答的两个问题:怎样证明改进真实有效,以及怎样获得足够连续、真实、可回溯的数据,让改进能够长期发生。 EverMind 正试图用 HarnessBank、Raven 与 EverMe,把这两个问题接成同一条产品路径。 模型没有变,为什么...
Harness
Agent
HarnessBank
EverMind
prompt
Qwen3
27B
测试集
Pass
任务过拟合
2026-08-11
1 阅读
约10分钟阅读
机器之心
字号:
机器之心发布 同一个模型,权重一个参数都不改,只是换一套 Harness,表现就可能大幅波动。这看似是 Agent 工程中的「玄学」,实际上暴露了自进化走向产品必须回答的两个问题:怎样证明改进真实有效,以及怎样获得足够连续、真实、可回溯的数据,让改进能够长期发生。 EverMind 正试图用 HarnessBank、Raven 与 EverMe,把这两个问题接成同一条产品路径。 模型没有变,为什么换个 Harness 就「变笨」? 在 AI Agent 的实际应用中,模型只是能力的一部分。包裹在模型外围的提示词、知识注入、工具调用、运行时逻辑与配置,共同构成了 Harness,也就是 Agent 的「运行外壳」。同一颗模型放进不同 Harness,可能像同一个人进入不同组织:知识与智力没有改变,决策流程、工具条件和反馈机制一变,最终表现便会截然不同。 EverMind 在 HarnessBank 研究中给出了一个直观结果:在 AppWorld 测试集上,同一颗冻结权重的 Qwen3.6-27B 模型,仅通过 Harness 进化,测试集 Pass@1 从 41.3% 提升至 56.7%。在覆盖终端操作、代码生成、数学推理、网页研究、知识工作、应用控制与代码修复的七个基准中,测试集 Pass@1 均取得正向提升,幅度为 5.1 至 15.4 个百分点。 但真正困难的并不是让某一次分数上涨,而是 证明上涨来自可复用的机制改进,而不是随机波动、任务过拟合,甚至沙箱崩溃与验证器超时造成的「假成功」。 如果连提升是否真实都无法判断,所谓自进化就可能变成自动制造回归。 HarnessBank:把「自我改进」变成可验证的工程 01. 核心架构:一个 Agent 跑任务,一个 Agent 改 Harness HarnessBank 的核心思路是将系统拆分为两个角色,形成一种「非对称」的进化结构: 任务 Agent: 负责在现行的 Harness 下执行具体任务。它的骨干模型是被冻结的(默认使用 Qwen3.6-27B),保持稳定; Evolver Agent: 这是一个独立的、能力更强的模型(例如 Claude Opus 4.8)。它的任务是读取「任务 Agent」的执行轨迹,诊断出反复出现的失败机制,并生成新的候选 Harness。 这种设计的精妙之处在于: 改进由一个「强模型」来思考,而被改进的只是一个「弱模型」的外壳。 图 1:传统人工调优(上)需要耗费大量人力且效率低下,而 HarnessBank 自进化(下)通过双 Agent 架构和基因库分格存档,实现了精准、高效的自动化迭代。 在形式上,进化只允许修改 Harness 的 可变面 (如 prompt、注入知识、运行时逻辑、配置),而评估、记账、自进化相关的代码则被锁成 不可动内核。 这种严格的控制保证了进化前后的结果始终具有可比性。 图 2:HarnessBank 框架流程:1) 选出当前最强父代;2) 运行训练任务获取诊断;3) 基于基因库重组或重新发明机制;4) 通过四道门控筛选;5) 评估并竞争入库。 进化过程绝不是盲目的试错,而是遵循严谨的 四步循环: 选择父代: 从「基因库」中按质量偏置选出当前最强的 Harness 作为父代; 运行诊断: 运行一批训练任务,获取完整的诊断信息(分数、轨迹、评估元数据); 生成后代: Evolver 基于诊断生成后代:要么从失败轨迹中重新发明一个机制,要么将不同格子的机制重组起来; 门控筛选: 后代必须通过严格的「筛选门」,通过后才能进入完整评估并最终入库。 02. 避坑指南:现有自进化方案的三大「翻车」陷阱 为什么现有的许多自进化方案在实际应用中常常失效?EverMind 团队在论文中指出了三种典型的「翻车」方式,HarnessBank 针对性地给出了解决方案。 陷阱一:搜索塌缩 传统的贪心演化策略只保留当前看起来最好的改动。随着代数推移,改动的种类越来越窄,最后往往塌缩成 prompt 层面的保守修补。那些激进的、结构不同的方案一旦单次失败就会被彻底抛弃。 EverMind 的应对:Harness Gene Bank HarnessBank 不按分数高低只存一个最优解,而是采用类似 MAP-Elites 的思想,按「语义坐标」分格存档。 横坐标(改在哪): prompt、知识、运行时、配置。 纵坐标(为什么改): 针对哪类失败病理。 同一病理的候选在同格竞争,不同病理的方案各占一格,既保住了多样性,又确保了每一格的质量。而这件事成立的前提是每一步都过了门控:只有确认真实有效的机制才值得留存,也只有这样,把它们累加起来才是在探索更好的 Harness,而不是在累积噪声。 陷阱二:任务过拟合 如果没有门控机制,进化很容易留下「背题补丁」—— 它在训练任务上有效,仅仅是因为记住了这些具体任务,而不是修正了真实的失败机制。 EverMind 的应对:严格的留出集验收 HarnessBank 明确区分了「多样性」和「防过拟合」。按病理分格解决了多样性和可重组问题;而真正阻挡过拟合的闸门,是 测试集全程不参与进化决策,只在最后做一次验收。 陷阱三:收益不可验证 这是最隐蔽也最致命的陷阱。单次运行分数上涨,可能是机制真的起效,但也可能是执行噪声,甚至是沙箱崩溃、验证器超时等基础设施故障被误算成了成功。实测表明,无门控的循环甚至会部署比初始状态更差的「负优化」版本。 EverMind 的应对:四道严格的「门控」 03. 核心机制:四道门拦住「假提升」 Gated Harness Screening 是 HarnessBank 全文最核心的设计。每一个生成的后代,都必须在采样的任务子集上通过四道严格的关卡: 消融实验证明了这四道门的分量:如果去掉显著性检验门,收敛后的轮次中有 62% 到 76% 是「幻影进展」。而带有完整门控的版本,则能在 10 轮下限处干净退出,确保每一次部署都是真实的提升。 04. 核心洞察:没有万能的 Harness HarnessBank 在七个基准测试(覆盖终端操作、代码生成、数学推理等)中,测试集 Pass@1 全部实现了正向提升(幅度 +5.1% 到 +15.4% ),且绝大多数通过了统计可信检验。 但更重要的发现是: 没有万能的 Harness。 跨模型实验揭示了一条深刻的「病理到补丁的匹配律」:每个模型都有自己支配性的失败模式。 Qwen3.6-27B 容易死于「空转回合」, verify-finalize 补丁能带来 +15.4% 的提升。 Qwen3.6-397B 和 Gemini 3 Flash 则容易死于「粗心」,需要的是「清单补丁」。 如果把 27B 的补丁生搬硬套给 397B,效果几乎归零;如果把针对某一模型的恢复机制错误地应用到另一个模型,甚至会导致严重的负优化(如 -15.7% )。 更极端的例子在数学推理上: Qwen3.6-27B 的问题是「想太多」,Gemini 恰恰是「想太少」,同一个推理预算的旋钮,两个模型需要往相反方向拧。 结论很明确: 真正可迁移的,是从诊断失败、结构化搜索到统计验证的这整套「流程」,而不是任何一条具体的 Harness 或 Pr
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱