智能AI
morning
赋能DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造代理
摘要
过去,LlamaFactory 让每个人都能微调大模型;现在,PenguinHarness 希望让每个人都能构建自进化 Agent。 PenguinHarness 是全球首个支持多 Agent 自进化的 Harness: 0.2 元从零构建新的 Agent。耗时仅为 Codex 的一半,成本低至 Codex 的 1/200,结果更贴近可交付。 不到一元钱,让 Agent 自己变强。无需手动微调,A...
Agent
PenguinHarness
Codex
Harness
LlamaFactory
https
penguin
RAG
让每个人都能微调大模型
希望让每个人都能构建自进化
2026-08-04
1 阅读
约10分钟阅读
机器之心
字号:
过去,LlamaFactory 让每个人都能微调大模型;现在,PenguinHarness 希望让每个人都能构建自进化 Agent。 PenguinHarness 是全球首个支持多 Agent 自进化的 Harness: 0.2 元从零构建新的 Agent。耗时仅为 Codex 的一半,成本低至 Codex 的 1/200,结果更贴近可交付。 不到一元钱,让 Agent 自己变强。无需手动微调,Agent 准确率从 50% 提高到 90%。 1000 多种模型,成本更低,运行更快。支持多模态、轨迹观测、成本对比、多用户并发。 开源地址:https://github.com/Prism-Shadow/penguin-harness 主页链接:https://penguin.ooo 让 Agent 自动构建 Agent LlamaFactory 的作者郑耀威最近开源了一个新项目,名字叫做 PenguinHarness。这个「企鹅驾驭师」能帮你自动完成 Agent 的构建、评测和持续改进,真正从「手动调优 Agent」迈入「Agent 自我迭代」。 PenguinHarness 是一个原生支持自我进化的 Agent Harness,主打轻量、开源、易用。基于原创的 Agent 内核,无论是 GPT-5.6 还是 DeepSeek V4,这套框架都能稳稳驾驭。 项目的初衷与 2026 年讨论得热火朝天的 AI4AI,递归自我进化(RSI)等方向不谋而合。 Meta 前研究总监田渊栋创立的 Recursive 着力探索 AI 递归自我改进的潜力,其首篇博客已经证明出 Agent 可以训练模型、优化 GPU 算子。 MSRA 前副院长边江创立的 XYZ AI Lab,也成功探索出一条通过运作数百个 Agent 完成 Deep Research 模型后训练的路径。 而 PenguinHarness 则是立志做最好用的开源 Harness,让 Agent 自进化开箱即用,不再需要手动调优 Agent。 它的第一项能力 —— 让 Agent 自动构建另一个 Agent。我们用一个最经典的案例对比 PenguinHarness 和 OpenAI Codex 的实际表现:「让 AI 生成一个 RAG 应用,实现分块检索,流式返回通俗易懂的答案,并带上引用」。 通过视频,我们可以清晰看出,PenguinHarness 不仅花费比 Codex 更少的时间和低于数十倍的成本,还产出了几乎能直接落地的 RAG Agent 应用。 左边回答语言通顺,有流式输出,还有来源引用。而 Codex 的结果中英混杂,缺少流式输出。 过去,开发这样一套 Agent 应用需要框架选型、模型部署、接入工具、编写提示词、反复测试修改,每个应用都几乎从零开始,花费一个团队几个星期的精力。 即使有了 Claude Code 这类开发工具,它们对现有的 Agent 框架也比较陌生,很难做到像开发前端网页那么容易。而 PenguinHarness 从诞生之日起,就为自己设计好了一切选项。 而对于 PenguinHarness,你只需要说清楚需求,它立即就能开干:生成脚手架、Prompt,安装和优化 Skill,并搭建前端,直到把一个完整能跑的 Agent 应用交付给你。而这套流程,只需要花费 0.2 元的 Token 和一杯咖啡的时间。 郑耀威也为我们揭开了 PenguinHarness 的背后原理:它将文件系统作为唯一真相来源,Agent 是文件,提示词是文件,对话历史也是文件。文件是人与 Agent 最自然的协作方式。 框架只负责把文件拼装成可运行的 Agent 对象,而构造一个新的 Agent 无外乎文件的复制粘贴。 在运行时,PenguinMessage 作为唯一的消息协议,就像网络数据报文一样,在模型、环境和用户之间交换,这种统一且轻量的接口让 PenguinHarness 可以轻松接入到任意代码中。 PenguinHarness 既是一个 Agent 框架,又是一个 Agent 实体,没有人比它更懂自己。 本地可复现的 Agent 自进化闭环 让 Agent 构建 Agent 只是 PenguinHarness 的第一步,PenguinHarness 更长远的目标,是希望每个人都能在本地拥有自进化 Agent。 构建 Agent 是从 0 到 1,优化 Agent 是从 1 到 100,其中需要跨越许多挑战。 「Chaning agents is easy; improving them is hard.」 在一次关于自进化的讨论中,郑耀威曾提出这样的观点:Agent 本质上就是一堆代码和文件,修改它很容易,让他变好却很难。大模型本就已经是自带随机性的概率函数,Agent 则更是一个充满了不确定性的自主系统。要想做好 Agent 自进化,那么必须要有一个可靠的「尺子」,也就是评估系统。 ReAct 论文作者姚顺雨曾言,评估是大模型的下半场。对于 Agent 自进化,这句话同样成立,一套好的评估基准是自进化的根本。 为了探索准确的评估方式,郑耀威带领团队花费了半年多时间。最大的障碍是,现有的评估大多只有测试集,而没有训练集。如果在测试集上跑自进化,很难区分 Agent 到底是背会了答案,还是真正产生了进化。 为此,团队甚至亲手做了一套新的评估基准 ——GDPevo,专门用于测试 Agent 自进化能力,覆盖医疗、金融、法律等六大真实场景。通过划分训练 / 测试集,确保 Agent 进化时不会「偷看答案」。 PenguinHarness 吸纳了 GDPevo 的核心思想,把 Agent 的评估和优化凝练为了开箱即用的 Skills。在调用 Skill 以后,PenguinHarness 就会启动多个智能体,配合完成 Agent 的调优流程,也就是「自进化」。 试想这样一个场景:做一个 Agent 帮你更准确的预测球赛、提出投资策略、处理电商售后,但是这个 Agent 一开始准确率并不高。过去,你需要通过手动调整提示词,搭建工作流来提高精度,而现在,PenguinHarness 可以自动帮你完成 Agent 调优。 通过视频可以看出,PenguinHarness 完成了多次迭代,Agent 的分数从优化前的 53 分,提升到了优化后的 95 分。使用 DeepSeek V4 Flash 正式版,整个过程只花了 0.5 元的 Token。 这背后是一套多智能体的协作流程。PenguinHarness 首先生成一个负责出题的 Benchmark Builder,围绕目标能力生成一系列题目和答案对,通过反复测试来校准题目难度。 进入优化阶段后,三个承担不同角色职责的 Agents 会组成一个自进化闭环,反复进行下面四步过程: 1. 组织评测:Optimizer Agent 按照题目数量和运行次数,组织多个 Evaluator Agents 并行评测; 2. 独立打分:每个 Evaluator Agent 启动一个独立的被测 Agent 解答题目,并且根据只有 Evaluator 才能看到的 Rubrics 打分,将分数返回给 Optimizer
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱