智能AI
morning
贵57.1倍的Claude Opus 4.8五项全输,赢的不是模型,是Harness
摘要
机器之心发布 在很多人的印象里,AOE Tech Labs 是一家以产品创新见长的公司。 2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSc...
Agent
DeepSeek
Floatboat
Harness
Opus
Flash
175
API
五项全部超越
混合价
2026-08-09
1 阅读
约10分钟阅读
机器之心
字号:
机器之心发布 在很多人的印象里,AOE Tech Labs 是一家以产品创新见长的公司。 2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。 但这三件事没有一件是界面创新。 外界看到的是产品形态,每一次底下动的都是 Ha rness。 8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。 前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。 完整报告链接: https://floatboat.ai/news/harness-benchmark 这件事之所以值得单独看,是因为它填的是行业里一块公认重要、却长期没人报数的空白。 大家早就承认那个等式: Model + Harness = Agent。 加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。 这份数据要回答的,就是右半边到底值多少分。而它给出的答案,可以用四个字概括: 多快好省 。 一、先看「好」: $0.175 打 $10,五项全部超越 Floatboat 这次的测试底座是 DeepSeek-V4-Flash,官方 API 谁都能调,输入 $0.14 / 百万 token、输出 $0.28。按 Agent 场景典型的 3:1 输入输出比折算,混合价 $0.175/M。 对面是 Claude Opus 4.8,$5 / $25,混合价 $10/M—— 贵 57.1 倍 。 图 1|$0.175 的底座,五项全部超过 $10 的旗舰 左:混合单价对比,DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M,贵 57.1 倍(线性轴,不作对数压缩)。右:零线即 Opus 4.8 的位置,五项全部落在其右侧,条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)。这些领先幅度要和左图一起读 —— 又好,又便宜,成本只有对手的 1/57。 五项全部超越。 「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务,再便宜也不会有人每天打开它。而过去这道门槛只能用钱换:能干活的太贵,敢放开用的干不动活。 这份数据要说的是,这个交换可以被取消。而取消它的不是模型。 二、这不是一次「便宜模型真香」 这种价格反差的第一反应通常是低价模型追上旗舰的老故事。但这次的数据自己把这个读法否掉了。 同一个 DeepSeek-V4-Flash,跑在 DeepSeek 官方自己的 Harness 上,DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0。放到 Floatboat 上,它跑到了 67.25。 更完整的一组对照更能说明问题:在 Terminal Bench 2.1 上,DeepSeek 官方 Harness 与 Opus 4.8 打成平手(82.7 : 82.7),其余四项全部落后。 也就是说, 同一个模型在模型厂自己的系统里,对 Opus 4.8 一项没赢;接入 Floatboat 之后,五项全胜。 模型权重没变,单位成本没变。变量只有一个。 三、一次刻意用 最便宜模型做的单变量实验 值得先把方法学摆完整,因为整个结论的合法性都压在「单一变量」这四个字上。 Floatboat 公布的对照配置是: 双方统一使用 DeepSeek-V4-Flash 0731 模型底座; DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式 ,配置为 max 档位、top_p=0.95、temperature=1.0; Floatboat 侧统一在 Floatboat Evaluation Harness 下执行,大部分基准的模型推理由 DeepSeek 官方 API 提供; 所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行,输入参数完全一致。 这里有一个容易被读漏的细节: 对 照组不 是「裸模型 API」,而是模型厂自己的 Harness 。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩,模型厂的工程能力也在场。 这让对照比「产品对裸 API」严格得多,也让差值更难被解释成「对手没认真配」。 还有一个刻意保守的选择:对照取 0731 正式版,而不是更早的 Preview checkpoint。如果用 Preview,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代,不能归给 Harness。这一行数据在官方总表里也在,Floatboat 没有拿它做宣传口径。 至于为什么选最便宜的模型,理由是反过来的: 用顶级模型跑榜会得到「高分 + 归因不清」 ,没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座,一边接官方 Harness,一边接 Floatboat Harness,差值就只能落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。 产品本身模型中立,支持接入各家主流模型,本次单一底座只是评测方法论的要求。 四、真正的信息在排列顺序里 如果只看「五项都赢了」,这还只是一次跑分。有信息量的是增益的分布。 把同底座的 Harness 增量单独拉出来: 图 2|模型不变,只换 Harness:任务越长程,Harness 增益越大 左:同一个 DeepSeek-V4-Flash 0731 底座,两端分别为模型厂官方 Harness 与 Floatboat Harness。右:按程长从短到长排列,1.9%(短)→ 9.6%(中)→ 12.6%(中长)→ 19.9%(中长)→ 23.6%(长),五项全部具备官方 Harness 对照,程长分档非递减、增益单调递增,无例外项。Toolathlon 与 BrowseComp 同属中长程档,同档内按增益排序。 1.9% → 9.6% → 12.6% → 19.9% → 23.6%。 五项全部有官方 Harness 对照,按任务程长从短到长排下来,程长分档非递减、增益单调递增,没有例外项。 任务越长程,Harness 的增益越大,一路涨到 23.6%。 五项里只有 BrowseComp 官方未披露平均步数,它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答,检索链长度事前不可知,需跨源证据交叉验证,单
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱