智能AI
morning
实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了
2026-08-01
1 阅读
约10分钟阅读
郑廷旭
字号:
实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了 科技圈的刺激,总是来得猝不及防。 同一天,两家大模型领域的绝对顶流,不约而同地丢出了自己的重磅炸弹。一边是 OpenAI 突然宣布 GPT-5.6 系列模型价格大跳水;另一边,DeepSeek 正式发布 V4-Flash 模型,带着通过后训练(Post-Training)全面强化的推理与代码能力,霸气登场。 过去两年,大模型的竞争主线是追赶能力上限:参数更大、上下文更长、跑分更高。今天这两份公告放在一起,则释放出另一个信号: 顶级模型的竞争,正在从单纯比拼能力,转向争夺「智价比」。 这种变化对 Agent 尤其重要。 让聊天机器人写一封邮件,模型回答一次,工作基本结束。让 Codex 修一个 Bug,它却要先读项目文件、搜索代码、应用补丁,再运行测试;一旦测试报错,还得回头检查并重新执行。 任务越长,模型调用次数越多,价格就越直接地影响 Agent 能否真正投入日常工作。 DeepSeek V4-Flash 的 API 价格仍是每百万 token 输入 1 元、输出 2 元。OpenAI 则把 GPT-5.6 Luna 的 API 价格下调约 80%,Terra 也便宜了 20%。 能力继续往上走,调用成本却开始往下掉。这次我们更想知道的是:价格更低的模型,能不能把事情同样做好? 模型还是那个模型,但更会干活了 DeepSeek 今天更新的 V4-Flash,目前只能通过 API 使用,网页版和 App 都没有更新。 开发者使用 API 调用 deepseek-v4-flash ,后台则会自动换成新发布的 V4-Flash-0731。它可以一次读取 100 万 token 的内容,适合塞进大份文档或整个代码项目,也原生支持 OpenAI 的 Responses API,可以接入 Codex。 有意思的是,DeepSeek 称,V4-Flash-0731 与预览版的模型结构、尺寸完全一致,这次只重新进行了后训练。 可以把基础训练理解成上学,后训练更像入职后的专项练习。模型原本已经会写代码、读文档,接下来还要反复练习怎么拆解任务、选择工具、发现错误,以及如何把一件事情从头做到尾。身板没变,做事的习惯变了。 官方给出的提升幅度确实很大,甚至宣称 「远超 V4-Pro-Preview」 。在测试模型能否操作终端、连续完成任务的 Terminal Bench 2.1 中,它从 61.8 分涨到 82.7 分;另一项代码 Agent 测试 DeepSWE,则从 7.3 分涨到 54.4 分。 这些数字翻译成人话就是,新版不只更会写代码,也更擅长调用工具,把一件事情从头做到尾。 更关键的是,能力上涨并没有伴随涨价。V4-Flash 仍维持每百万 token 输入 1 元、输出 2 元。 几乎同一时间,OpenAI 也在降低模型调用门槛。据 Axios 报道,上线仅 3 周的 GPT-5.6 Luna 输入和输出价格均下调约 80%,Terra 也降价 20%。降价后的 Luna 每百万 token 输入 0.2 美元、输出 1.2 美元。 但便宜的前提是能把活干完。Agent 往往要连续调用模型几十次,任何一步出错,整个任务都可能返工。 所以这次,我们把 DeepSeek V4-Flash 接入了 Proma,给它安排了 5 个从简单到复杂的任务。过程中不追加提示,也不替它处理问题,看看它拿出的第一版到底能不能用。 5 个任务跑下来,V4-Flash 的惊喜不只是便宜 第一轮,我们把爱范儿和 APPSO 的 320 篇早报数据交给 V4-Flash,让它分析两个账号的阅读、互动、选题和发布节奏,并把结果做成一份网页报告。 查看文件夹里的早报文章数据,多维度分析数据,然后给我清晰明了的分析报告,输出为交互式的 html V4-Flash 先用几张数字卡片交代整体情况,再把内容拆成账号对比、阅读趋势、互动画像、选题分析、结构透视、爆款榜单和全量明细。页面里混用了柱状图、折线图、环形图、雷达图和散点图,散点图还能切换账号、缩放查看。 视觉上也相当成熟。深色背景、蓝黄色强调色和卡片层级保持一致,十几张图塞在同一页里,依然能一眼分清重点。虽然这份报告很长,但好在并没有明显的拼贴感。 接下来,我让 DeepSeek V4 做了一个稍微复杂一些的任务——一个打砖块小游戏,既要处理球、挡板和砖块的碰撞,又要加入重力、动量传递、砖块耐久、连锁爆炸、4 种道具和粒子效果。 它给出的结果意外地还不错,普通砖、金属砖和爆炸砖在视觉上有明确区分;金属砖被击中后会出现裂纹,爆炸砖会波及周围砖块。多球、加宽挡板、粘性挡板和激光也不是只出现在说明里,实际游玩时都能触发。 请为我编写一个单文件 HTML 格式的打砖块小游戏。要求使用 HTML5 Canvas 绘制,且具备以下核心要素: 真实的物理引擎:球与砖块、墙壁和挡板的碰撞遵循弹性碰撞与动量守恒。挡板移动时的速度应该能传递给球(例如:向右快速移动挡板击球时,球会获得额外的向右水平速度)。加入轻微的重力效果,使轨迹更丰富。 砖块类型与生命值:设计不同颜色和耐久度的砖块(如普通砖块需要击打 1 次,金属砖块需要击打 3 次并伴有视觉开裂效果,爆炸砖块被击碎时会炸毁周围的砖块)。 道具系统:击碎特定砖块会随机掉落道具,包括:多球模式(分裂出 3 个球)、挡板加宽、粘性挡板(球碰到挡板后先粘住,按空格键再发射)、以及激光射击(挡板可以发射子弹直接摧毁砖块)。 视觉与特效:包含击碎砖块时的粒子散落效果、球撞击时的微弱屏幕抖动、流畅的 60 FPS 动画,以及简洁现代的 UI 界面(计分板、生命值显示、暂停和重新开始按钮)。 代码结构:所有的 HTML、CSS 和 JavaScript 代码必须全部打包在一个文件中,确保可以直接双击在浏览器中运行,且无外部依赖库。 接下来,我们又把题目换成了三体轨道模拟器。这类页面很容易靠星空、光球和拖尾蒙混过关,真正的难点是算出三颗星体下一秒各自会去哪里,并让轨道持续运行。 请写一个单文件 HTML 的三体运动轨道交互式模拟器,具体要求: 物理计算:使用龙格-库塔法(RK4)或 Verlet 积分算法来计算三个质点在万有引力作用下的运动轨迹。允许用户实时调整引力常数 G、三个质点的质量、初始位置和初始速度矢量。 交互与控制:用户可以通过鼠标拖拽来改变质点的初始位置,或者通过轨迹线上的箭头调整初始速度。包含暂停、单步调试、重置、以及内置几种经典稳定轨道(如 figure-8 八字形轨道、Lagrange 轨道等)的一键预设功能。 可视化效果:使用 Canvas 绘制质点的实时运动,并保留渐隐的运动轨迹拖尾(利用半透明背景刷新实现)。实时显示每个质点的位置、速度和加速度数值。 代码要求:完全原生 JavaScript 实现,无需外部库,界面设计美观、富有科技感。 V4-Flash 交付的页面采用了四阶龙格-库塔法,也就是 RK4 来计算轨道。它还加入了引力软化,避免两个质点距离太近时数值突然爆炸;当加速度变大、天体接近相遇时,程序会自动把一个计算步长继续拆细,降低轨迹发散的
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱