首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

DeepSeek Harness,“杀死”特工黑箱

摘要

文 | 光子星球 近期,DeepSeek持续上演反转。 8月12日,没有发布会,没有预告,DeepSeek悄悄更新API文档,编号为“0813”的DeepSeek-V4-Pro正式版模型深夜静默上线。 高关注度和期待之外,是现实体验与官方跑分之间的落差,还有一经上线便预告涨价的质疑。 8月13日,距离新模型发布不到24小时,DeepSeek官网首页发布的横幅和开放平台公告突然被撤下。API文档中模...

Harness 光子星球 DeepSeek持续上演反转 8月12日 没有发布会 没有预告 DeepSeek悄悄更新API文档 编号为 0813 的DeepSeek
2026-08-15 1 阅读 约10分钟阅读 光子星球
分享:
字号:
文 | 光子星球 近期,DeepSeek持续上演反转。 8月12日,没有发布会,没有预告,DeepSeek悄悄更新API文档,编号为“0813”的DeepSeek-V4-Pro正式版模型深夜静默上线。 高关注度和期待之外,是现实体验与官方跑分之间的落差,还有一经上线便预告涨价的质疑。 8月13日,距离新模型发布不到24小时,DeepSeek官网首页发布的横幅和开放平台公告突然被撤下。API文档中模型名称没变,开发者仍可正常调用,但官方保持沉默。 事后,有开发者发现DeepSeek在Hugging Face后台代码仓库疯狂抢修,疑似因为前端接口、后端推理栈与权重配置出现了严重错位,导致体验“翻车”。 同天晚上,DeepSeek重新发布公告确认V4 Pro正式版上线,同时开源DeepSeek Harness开发者预览版,一切又回到了主场。 DeepSeek曾给出过一个公式:Model+Harness=Agent。这意味着,对可执行任务的Agent来说,只有模型是不完整的。Harness的可控、可观测、可回溯的特性,补上了模型所缺失的另一半。 模型是大脑,负责思考、推理和理解意图。但纯语言模型只能输出文本,无法直接操作文件、修改数据库和浏览网页。Harness是“身体”和“神经系统”,它提供了模型与外部世界交互所需的一切,包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。 没有Harness,模型只是一台会说话的引擎,但无法成为真正干活儿的Agent。DeepSeek试图通过自身打造的Harness系统,将模型性能发挥到最大化。 从我们的测试结果来看,也的确如此。在DeepSeek Harness加持下,DeepSeek V4 Pro正式版的响应速度更快,且比接入Claude Code缓存命中率提升了1%。 祛魅和争夺范式 “一切皆插件”是DeepSeek Harness最核心的设计理念。简单来说,就是从模型、工具到最核心的Agent Loop,都拆解为可独立、组合的插件。 这个理念由北大与DeepSeek联合提出的“时空可组合性”范式支撑,该范式将Agent组件拆解为两个维度。 一是时间可组合性通过“可逆效应”机制,让系统自动记录并撤销组件卸载后的副作用,加载过程即决定卸载过程,确保系统长期稳定。二是空间可组合性通过“响应式共效应”实现声明式依赖管理,组件只需声明需求,运行时就能自动协调依赖变化,实现动态激活与停用。 两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness因此可实现“无特权核心”,所有组件包括Agent主循环均可替换,开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的Agent基础设施奠定了方向。 在OpenAI、Anthropic等巨头纷纷定义自己的Harness时,DeepSeek的思路显得独树一帜。 OpenAI和Anthropic的战略是“向下整合”,即通过打造体验极致、深度绑定自家模型的Harness,巩固其在AI应用层的优势;DeepSeek的战略是“横向铺开”,不再满足只做一个优秀的模型供应商,而是试图通过开源一个模型中立、高度模块化的Agent底层标准,成为下一代AI应用的基础设施。 网传的DeepSeek Harness内测入选项目名单同样释放了强烈的信号,入选项目高度集中在能夯实Agent能力的基础设施领域。其项目主要围绕MCP插件、代码智能体、运行时、编排框架、可视化UI与多智能体调度等方向,直指Agent在真实世界落地的核心难题。 DeepSeek的一系列操作,可视为一场精心设计的“祛魅”运动。DeepSeek开源Harness,并大力扶持各类基建插件,本质上是在做一件事:将“如何构建一个强大的Agent”的一整套方法论和源代码,公之于众。 在此之前,OpenAI和Anthropic的Harness更像一个“黑箱”,其内部优化是核心机密,如何打造Agent产品被视为一种“特权”。DeepSeek通过开源和Cordis插件理论,主动拆解了这个黑箱,并证明Agent的强大不在于某一个神秘的内核,而在于一套可组合、可替换的工程组件。 当Harness被充分祛魅,成为一个透明、可被随时替换的组件后,整个价值链上,唯一不可被标准化、仍会持续进化的,就只剩下最底层的“模型”本身了。 如果把DeepSeek的模型、开源、Harness、涨价四个动作连在一起看,就会发现DeepSeek的目标非常明确。先建立生态,再定标准,然后用最强的模型性能,完成商业价值的最终变现。 Harness和开源就像是免费修建的高速公路,前期用来吸引车流,而当车流足够多时,顺势提高燃油的价格,便成为了最高效的商业兑现方式。 砍掉prompt,场景一次跑通 昨天的文章里,我们测评了DeepSeek-V4-Pro-0813的七项复杂任务,唯独指环王那题没有跑完整。当时为了赶时间,只给了《指环王》第一章的3句开头。 DeepSeek-V4-Pro正式版实测:山不在高,有“梁”则灵 恰好DeepSeek Harness也出来了,我们就在DeepSeek自家的Harness里跑这次完整的测试,看看自家的工具配自家的模型,能擦出怎样的火花。 安装的过程就不赘述了,推荐大家用npm(Node.js的默认包管理器,安装并管理项目所需的各种第三方库,可以简单理解为一个开放的应用市场)安装,也方便升级和安装其他插件,可以直接运行npx @deepseek-ai/dsh web启动,如果卡住不动的话,可以先运行一遍npm install -g @deepseek-ai/dsh,然后再运行刚才的命令就可以顺利启动了。 初次打开和大部分Agent一样,只不过在DeepSeek Harness这里暂时还是极简的画风。 装好环境之后正式开始今天的测试,《指环王》这个基准测的不是“会不会画一只鹈鹕”,而是“读懂一段文学→理解一个世界→把世界程序化搭出来”的完整链路,是目前圈内最狠的Agent考题之一。 昨天的测试为什么不算数?因为我们当时只给了3句开头,而Karpathy给Opus 5的是原著第一段。今天我们把原文补齐:第一章前段完整文字,从比尔博宣布111岁生日宴会,到霍比屯议论,再到弗罗多身世往事,共计1817个词、23段,一字不改。 第一次测试,我们按“评测就该严谨”的思路,把提示词写得滴水不漏,1817个词的原文,加上场景要素清单(洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷),再加上运镜要求、灯光要求、比例要求,一共五条硬性要求。 结果很打脸, 第一次生成的效果非常粗糙,叙事也不完整。 场景是搭出来了,但离“霍比屯的生日派对”相距很远。效果呈现上,运镜支离破碎,画面像是赶工出来的半成品。穿模很严重,山坡上站的小人像是插了一堆棒棒糖。我们复盘了一圈,把原因归结为提示词太长了,列出的场景限制了模型的发挥。 第二次,我们把提示词砍到只剩目标,读懂原文,用Three.js搭出霍比屯生日派对的3D世界,运镜按原文节奏走,保存为完整可运行的HTML文件。场景要素、灯光、比例要求,全部删掉。 效果反转了。 场景竟然一次就跑通,洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人,该有的都
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱