智能AI
morning
深度体验DeepSeek Harness,我原谅它涨价了
2026-08-14
1 阅读
约9分钟阅读
Jay
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 深度体验DeepSeek Harness,我原谅它涨价了 Jay 2026-08-14 00:03:19 来源: 量子位 Jay 发自 凹非寺 量子位 | 公众号 QbitAI DeepSeek Harness ,终于发布,并且将源代码开源了。 为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。 这段时间里,为了测试,我几乎把我所有Vibe Coding项目,都从Codex迁移到了黑鲸(是的,logo黑化了)。 深度体验这么久,又把官方Repo从头到尾翻了个底朝天之后,我最大的感触是—— 这简直是套 彻头彻尾为「自进化」和「DIY」而生的马鞍 啊。 内测群里,有大佬直接给改成了这样。。。 这样。 还有这样的TUI。 而DSH真正能做的,远远不止这些。 事实上,DSH的一切:模型、工具、策略、存储、上下文管理……都是可插拔的积木。 这意味着,如果你想,完全可以自己上手改造,或者针对特定场景定制运行时。 目前,官方已经内置了 一百多个插件 。后续社区会提供更多。 Agent时代的安卓,来了。 DSH「最不绕弯子」说明书 但在说底层技术相关的内容前,咱们还是先讲讲产品体验本身。 官方给出了两个安装方法: 快速体验: 在已安装Node.js开发工具链的系统中,可以使用npx命令快速启动DeepSeek Harness的Web UI。 npx @deepseek-ai/dsh web 源码安装: 获取完整项目源码,并按照仓库说明完成安装。 git clone https://github.com/deepseek-ai/deepseek-harness 其实可以更简单,直接把仓库链接(见文末)丢给AI,让它帮你全部搞定(doge)。 但暂时没有Electron APP,启动服务后,得通过浏览器Web UI用。 打开后,会先让你填模型API Key,没有的话直接到DeepSeek开发平台买一个。 但梁圣这次可能不止收你电费钱了,17号要大涨价,尤其是缓存。。。 不过,你也是可以接入其他模型的。 之后就能看到「黑鲸」真容了,基本和DeepSeek网页版长得一模一样,只不过现在对话列表成了本地项目管理列表。 使用上也和主流Agent有些区别。 开启会话前,你需要额外选择工作目录,以及—— Agent预设。 这是DSH比较新鲜的功能,目前官方有四类预设供你选择—— 标准模式:功能完整的编码Agent,涵盖文件编辑、Shell、文件与网页检索、Skills、计划模式、目标追踪、子代理和工作流等全部能力 PTC模式:在标准模式全部能力之上,额外提供Code Mode SDK,允许模型编写TypeScript程序来组合多步操作。 极简模式:仅保留bash和str_replace_editor两个工具,用于基准测试和最小化复现。 创造模式:在标准模式全部能力之上,额外提供运行时检查、插件实验和preset创作指导,用于自定义Agent预设。 此外,也支持自定义预设。 这也是DSH带给我最深的印象——这是一个 非常极客,甚至可以说是开发者天选的马鞍 。 很多设计都围绕这个第一性原理展开。 比如有个叫 轨迹 的功能。 众所周知,随着Agent跑得越久、工具链越复杂,Chat摘要就越来越黑盒,根本搞不清楚模型在背后干啥。 DSH做的这个轨迹,就是一个能随时监控Agent的回放窗口。 和Chat视图的是润色后的对话不同,Trajectory能直接看到原始事件级记录,你可以随时回放,查看会话内部到底发生了什么。 这样,能更直观地看到模型究竟是在哪栽了跟头,每个环节都烧了多少钱。 此外,DeepSeek还在仓库里内置了一堆Skill,专为开发而生。 看了一眼MD,功能大概有这些—— dsh-code-review:审PR用的。按本仓库的规范检查代码里看不出来的问题。 dsh-find-simplifications:找可以简化代码的地方,并把简化想法写成Agent Note。 dsh-doc-standards:写/审文档用的。管文档层级、区分教程和参考、砍「文档废话」。 dsh-prose-standard:全仓库文字品控。Markdown、JSDoc、代码注释、提示词、CLI/UI文案该不该写、怎么写。 …… 不过,我不是重度开发者用户,日常确实不太用得着这些。 但多轮交互下来,我发现DSH有一个非常好用的小设计—— 即便不开计划模式,黑鲸在遇见用户指令不明确的情况时,也会主动拉起提问。 这点和Codex很不一样。在DSH的鞭策下, 黑鲸会非常主动地开启头脑风暴 ,并且给出建议选项。 说实话,太爽了,能节省巨多脑力,少吃很多根香蕉(bushi)。 当然,你也可以哪个都不选,自己巴拉巴拉语音输出一堆上下文给它。 其他就和Codex没啥区别。 你可以用/,调用上下文压缩、设置目标、计划模式等功能,或者调用Skills。 像任务清单这种功能,也是有的。 比较遗憾的是,经典Agent三列表中右侧栏还没做出来,体验上还是有些不方便。 这点Codex就非常吃香了,内置浏览器、文件管理、预览…… 甚至能直接在对话中播放视频。。。 诸如此类,反正就是很多UI和交互上的小细节,跟Codex比起来肯定还是有差距,可能也得等后续更新打磨吧。 对了,DSH是支持图片作为附件上传的。 但众所周知,V4是个瞎子啊o(╥﹏╥)o,这个功能需要额外搭配多模态模型食用。 最后聊聊 Token消耗 。 也是很神了,DSH专门在屏幕最下方搞了个统计表,你可以随时在这里查看Token消耗量、缓存命中率,以防一不留神给信用卡刷爆掉。 缓存命中方面,也是很猛的,大多处于99%左右,有几次直接干到100%了。 当然,也是遇到过几次掉到60-70%的情况的。 但奈何内测的时候DeepSeek是真便宜啊! 说实话,我真就没咋关注过这个仪表盘。 感谢梁叔叔。 一手实测 最后就来拴上这套原生马具后,黑鲸的表现吧。 我让V4 Flash分别用Codex和DeepSeek自己的harness跑了几个demo,大家可以自行对比一下。 左边是DSH,右边是Codex。模型、推理强度完全一致。 首先是 鹈鹕自行车 。 比较经典的一个测试了,说实话,没太大差别,甚至右边Codex的审美更好。 但这个 猪八戒3D白模 就很离谱了。 同样是只简单嘱咐了一句任务,没有写复杂提示词,右边Codex马鞍一把梭的产物简直不像个生物。 从《后室》逃出来的是吧。 至于原因,我个人感觉是: DSH驾驭下,模型的长程任务能力会强非常非常多 。 像猪八戒这个demo,就一句「生成猪八戒3D白模」,DS直接猛跑了20min。 反观Codex,几乎就没怎么返工,6分钟就跑完了,异常自信。 甚至最开始还以为是要生成图片, 还管我要GPT-Image-2的API 。。。 搁这带货来了啊?? 这也是社区比较一致的反馈,听有个哥们说,他最长跑了 10个小时 。。。 我自己的体
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱