首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

DeepSeek-V4-Pro正式版实测:山不在高,有“梁”则灵

2026-08-13 1 阅读 约10分钟阅读 光子星球
分享:
字号:
文 | 光子星球 DeepSWE 12.8到62.7,约4.9倍。这是DeepSeek官方给出的V4-Pro正式版(版本号0813)软件工程智能体能力提升幅度。 8月12日晚,这个模型悄然出现在DeepSeek的API文档里,没有发布会,也没有官宣推文。 价格方面,DeepSeek V4 Pro是走量的高端档,价格明显高于V4-Flash。按每1M token计算,缓存命中输入0.025元,缓存未命中输入3元,输出6元。相比之下,V4-Flash分别为0.02元、1元和2元。输出token从2元涨到6元,正好是三倍。输入未命中从1元涨到3元,也是三倍。 “梁圣”就是“梁圣”,一如既往地不走寻常路,连涨价预告都一并写得清清楚楚:“计划近期整体上调DeepSeek API服务定价,预计涨幅较大”。 于是,我们花了一宿,用社区最新的一批复杂测试手法,看看它的涨价底气到底从何而来。 结论先放在这里,这次升级绝对过硬,前端审美发生质变,Agent能力稳稳得很踏实。不过,也有让我们暂时无解的卡bug问题,比如鹈鹕骑自行车翻车了,生成了两个挂在天上的弯月。 一个悄悄上线的新版本 V4-Pro不是新模型,是转正。今年4月24日,DeepSeek发布V4系列,Pro版当时还是Preview状态。三个多月后,正式版才来,命名也直白,直接用日期0813。 这次转正,参数上做了几件实打实的事。上下文支持1M上下文长度,输出上限拉到384K Token,支持thinking和non-thinking双模式,其中默认开启思考模式状态。接口同时兼容OpenAI和Anthropic两套格式,接入Claude Code这类Agent框架可以直接换base_url。 官方的叙事,换了一个词 比参数更重要的是官方换了个说法,不再强调「更会答题」,而是强调「更会把一件事干完」。有博主把官方数据翻译成人话:DeepSWE从12.8提到62.7,测的不是「会不会写一段代码」,而是「能不能像工程师一样持续干活」。 九项Agent与代码基准全线大涨。Terminal Bench 2.1打到87.9(终端操作),Cybergym提升至83.3(网络安全),NL2Repo涨到61.5(自然语言转代码仓库),DeepSWE增长到62.7(软件工程),而相对应的Preview版本分别提升15.8、30.6、23.0、49.9。 社区也存在质疑声,有开发者对比后认为0813仍略逊于Luna MX,也有人指出它约一半基准还落后Kimi K3。官方至今没有发布完整的benchmark报告,这也意味着所有声称都要靠第三方验证。 这就是我们做这次实测的原因,不转述官方数字,自己跑。 考题换代,从鹈鹕到指环王 在动手之前,有个背景必须交代,圈里的测试手法正在换代。8月2日,入职Anthropic的Karpathy发了一条长推,说我们该告别「鹈鹕骑自行车」这类测试了。 他给Opus 5塞了《指环王》第一段,配100万token的预算(约10美元),要求生成三个JS渲染版本。Opus 5跑了约2小时,写出5500行代码,用Three.js搭出一个「有点上世纪国产3D动画味」的霍比屯,穿模、漂浮不少。 随后有网友拿DeepSeek V4 Flash复现,结果画面人物全员漂浮,穿帮明显。 所以我们给0813设计的测试,全部避开了基础能力,用的都是这类最新、最复杂的手法。方式上,我们没有走网页聊天界面,而是把DeepSeek接入Claude Code的Anthropic兼容接口,让它在真实的Agent环境里干活。一共7项,按难度递进,从鹈鹕这种旧基准,到指环王3D世界这种新基准,最后到连续三轮的长周期工程任务。 第一道题,它就翻车了 先说坏消息,DeepSeek-V4-Pro上来就翻了车。 第一道题是我们的老朋友,即旧基准下的「鹈鹕骑自行车难题」,SVG生成,让鹈鹕骑上车、动起来。尽管这是Karpathy点名要「退休」的考题,但正因为人人测过,拿来当对照组最合适。 0813的表现是这样的,鹈鹕的脚踩在踏板上,但踏板不在自行车上。车架结构怎么看都不科学,这样的设计,鹈鹕的屁股不会冒火吗? 我们怀疑是推理强度太高导致过度思考,把强度从max降到high又测了一轮。结果依旧,鹈鹕形状是怪的,天上的云依旧是反向的。 有意思的是,之前测Kimi K3也出现过类似情况。难道前端能力超过某个界限之后,反而会在这种简单题上翻车?样本还太少,不好下结论。但第一道题就给我们提了个醒,测试全程不能只看高光。 60种风格,一张墙 第二道题直接翻盘,让0813在一个HTML文件里生成一张Bento卡片墙,60种设计风格,每张卡片必须用该风格最典型的视觉语言,不能只换颜色。 结果出乎意料地完整,60种风格全部实现,严格执行了不规则拼贴的要求,风格之间的差异非常明显,一次通过,没有任何敷衍的「换色卡」,以后vibe coding项目再也不用担心风格单调了。 这道题真正见功力的是它对「设计语法」的理解,玻璃拟态和粗野主义在视觉上几乎没有任何共同点,能把它们都抓准并排在一张墙上,说明模型对风格语料的积累是实打实的,而非死记硬背下几种配色方案。 把一段文字变成一部动画 第三道题是前端动画叙事,给0813一段描写「老水手夜晚等船」的文字,要求它做成自动播放、循环的动画页面,同时镜头要随时间推进,情绪要靠配色和节奏传达。 它交出了一部完整的叙事,画风、节奏、镜头推进都把握得很好,从镇子远景推到码头,再推到灯塔,自动循环流畅,文字以精致排版叠加在画面上随场景出现。 唯一的问题出在月亮,绘制明显出错。能力这么强的模型,却在简单的月亮上掉链子,和第一道题的鹈鹕简直如出一辙。我们暂时找不到它犯错的规律,只能把它记下来,等样本多了再说。 这次,配色终于不像AI了 第四道题是Three.js 3D打砖块游戏,我们给出的要求是游戏机制闭环,要能玩到比出胜负,还要兼顾UI和游戏手感。 测试下来,游戏完整可玩,碰撞准确没有穿模,丢分、结算逻辑正常,一次通过。但让我们印象最深的不是机制,是配色,配色不再是之前一眼AI的感觉。 这句话值得展开,过去大半年,AI生成的前端有个通病,蓝紫渐变、玻璃拟态、圆角卡片,一眼假。0813这次交出来的配色、碰撞音效和操作反馈,都已经进入顶级模型的层次,怪不得会宣布要涨价,这样的表现即便涨价也是极具性价比的选择。 让AI搭一个中土世界 第五道题是这次的主角,Karpathy的新基准,给0813《指环王》第一章的开头,让它用Three.js把霍比屯的111岁生日宴会搭成一个可运行的3D世界。 和Karpathy给Opus 5完整段落不同,我们只给了一个开头,这样能在短时间内拿到结果。0813的表现是,洞屋、宴会长桌、宾客、烟火要素齐全,没有漂浮、没有穿模,运镜从俯瞰霍比屯推近到比尔博,之后是单调的左右晃动。 单从这一个场景看,0813和Opus 5不相上下。需要注意的是,这不是说两个模型整体能力相当,因为单场景、单段落,样本仍然有限。但至少说明,在「读懂文学、搭出一个世界」这条新赛道上,国产模型没有掉队。我们会在后续的对比测试里给完整段落,再下最终的结论。 1.5小时,一座浮岛 第六道题是压轴
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱