首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

V4.1 Flash内测,梁文锋又当回了梁圣

摘要

文 | 字母AI 没有任何预告,DeepSeek V4.1 Flash的中间版本deepseek-v4.1-flash-expires-on-0910开始内测了。 DeepSeek官方表示,“DeepSeek V4.1 Flash采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。” 没有技术报告,也没有性能参数表,可是官方给出的信息已经挺让人震惊的了。 V4.1 Flash是De...

Flash DeepSeek Vision Agent flash expires 字母AI 没有任何预告 Flash的中间版本deepseek 0910开始内测了
2026-09-09 1 阅读 约9分钟阅读 字母AI
分享:
字号:
文 | 字母AI 没有任何预告,DeepSeek V4.1 Flash的中间版本deepseek-v4.1-flash-expires-on-0910开始内测了。 DeepSeek官方表示,“DeepSeek V4.1 Flash采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。” 没有技术报告,也没有性能参数表,可是官方给出的信息已经挺让人震惊的了。 V4.1 Flash是DeepSeek第一款原生多模态模型,V4 Flash Vision-Exp虽然也支持多模态,但它属于“外挂式”,在V4 Flash 0731纯文本底座上,外接了一个视觉编码器,以及一个对齐器(Aligner)。 V4.1 Flash是出厂就自带图文一体化输入输出。 并且V4正式版到V4.1才过了40天,就采用新结构,还能在提高性能的时候降低成本……这难道不该叫V5 Flash吗? 在经过社区多位技术博主的测试后,即使这个模型只是V4.1 Flash的中间版本,还不是正式版,它的表现却是相当惊艳。 DeepSeek V4.1 Flash牛在哪里? 就在招聘信息公布的前后,DeepSeek内部代号为DeepSeek-v4.1-flash-expires-on-0910的中间测试版本突然开启测试,测试时间截止到9月10日。 DeepSeek没有发布这个模型的技术报告,但是在官方发起的《V4.1 Flash 中间版本邀测反馈问卷》中,有这样一道题很有意思。 题目是“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”,选项分别为“可以”、“不可以”、“不确定”、“其他”。 到底能不能替代V4 Pro得先让我看看它到底怎么样。 在经过测试后发现,V4.1 Flash的速度实在是太快了。 以往我们跟大模型对话,即便响应再快,界面上往往也要跳动一两秒思考指示器。而在V4.1 Flash上,有开发者试探性地敲下一句“你好”,模型给出的思考时间只有0.3秒,生成速率瞬间飙到每秒159.3个 token,整轮对话端到端耗时仅0.8秒。 在另一组重度长文本推理的实测截图中,模型生成速度甚至直接快到了每秒420个token,端到端吞吐达409.5token/秒。 在业内人的调侃里,“这吞吐量直接把别家所谓的极速模式(Highspeed)做成了自己的日常基准”。 但这绝不仅仅是“快”那么简单,更是“又快又准”。 博主向阳乔木将一张西装照发给了DeepSeek V4.1 Flash,模型回答说他穿的是条纹西装。 起初他以为又和V4 Flash Vision-Exp一样出现了幻觉,结果打开大图仔细一看,图中的人穿的就是条纹西装。 多位抢测的资深技术博主对V4.1 Flash与此前的V4 Flash Vision-Exp做了同任务端到端对比评测。 结果显示,在49k超长上下文检索场景下,新模型的处理速度快了5.2倍;在SVG代码生成上,快了6.0倍;在经典的Manacher回文算法题解答上,快了4.6倍;在大型SQL查询生成与优化上,快了5.0倍;在高难度的asyncio异步架构重构任务里,处理速度依然达到了前代的3.9倍。 因此,官方称V4.1 Flash采用新的结构、原生支持多模态,这话一点不假。 还没完,在实现性能暴涨的同时,它的调用价格却和V4 Flash相同。 社区中有很多关于梁文锋的梗,DeepSeek性能好价格低的时候将他尊称为“梁圣”、“梁祖”,涨价的时候又叫他“梁子”、“小梁”。 到了V4.1 Flash这里,梁文锋又当回了梁圣。 小鲸鱼的成人礼 就在V4.1 Flash发布的前一天,DeepSeek突然宣布释放150人的大规模招聘名额,且明确面向2至10年的资深工程师,同时也兼顾应届生与新锐人才。 这次招聘主攻两个方向。其一是服务端开发工程师,涵盖大模型研究平台、Agent 框架组件、研发效率基建、DeepSeek API、线上服务以及数据工程;其二是 Agent 弹性计算研发工程师,包含平台开发和维护、底层调优与攻坚。 作为DeepSeek Harness的负责人,崔添翼在社交平台发文称,这次扩招绝不是为了做常规业务堆人,而是因为“量的激增引发了复杂度的指数级爆炸”。 崔添翼写到:“计算机领域的任何东西量变大之后,就会产生复杂度上巨大的增加。数据的量、机器/容器的量、训练任务的量、评测任务的量、Agent 环境的量、用户的量、请求的量,等等等等,都在急剧增加。这就产生了越来越大的复杂度,会让之前的后端系统逐渐不能完美满足将来的量的需求,所以需要大量扩招人来升级、维护和重写各种后端系统。” 过去的大众认知里,DeepSeek 是几十个天才算法科学家组成的“特种部队”,凭着极致的代码洁癖和作坊式的灵感创新,打出了让硅谷侧目的战绩。然而,从首轮融资到如今的密集动作,DeepSeek 已经演进成一家数百人规模的企业。 在拿到首轮融资之前,DeepSeek的服务器在海量流量的冲击下动辄宕机,融资到位后,服务端扩容,再也没有出现过长时间宕机。 但这仅仅是解决了浅层的网页和API问题, 今天的DeepSeek,它所面对的可不只是服务器压力。 从技术演进的角度来看,大模型正在经历一场从“静态预训练”走向“动态环境交互”的深刻质变。 过去训练一个语言模型,工程任务相对单纯,工程师把互联网上清洗好的海量静态文本塞进硬盘,让显卡吞吐数据。 到了现在的强化学习与Agent时代,模型为了学会解决真实任务,必须在毫秒级别内与成千上万个动态的“沙盒”实时交互。 打个比方,教模型下棋,过去是给它看千万盘死棋谱,现在则是让模型同时在十万个动态棋盘前跟自己博弈。 每一个棋盘环境的启动、状态恢复、网络隔离、结果抓取,都必须在毫秒级内完成。 原先DeepSeek作坊式的系统自己跑跑还行,扛不起这种级别的工业级动态负荷。 以V4.1 Flash这种级别的吞吐和推理速度来看,它需要极强的调度能力,才能满足这些开发者的需求。 比如哪些请求放在同一张GPU上批处理?长请求和短请求怎么混排才不会互相拖死?流量突然翻三倍的时候,从哪里秒级调资源过来?凌晨三点流量掉下来的时候,怎么自动缩容省钱? 作为一个实验室,DeepSeek不需要在乎这些问题,但现在梁文锋手下的是一家企业,这些工程问题反而成了关键。 同样的,新结构意味着DeepSeek可能要自己改推理框架、自己写CUDA算子、自己做模型压缩和量化,依然是一个极其费时费力的工程问题。 V4.1的Agent能力越强,需要的沙盒环境越多、弹性计算调度越复杂;V4.1 的多模态理解越成熟,数据管道和存储系统的压力就越大。 这150名工程师的作用就在于此。 虽说150人这个数量,不过是普通大厂一个部门的季度配额,可放在DeepSeek身上,这已经是翻倍量级的大动作。 DeepSeek已经完成从0到1的过程,现在梁文锋面对的问题,是从1如何到100,于是DeepSeek用150个HC作为回答,V4.1 Flash就成了DeepSeek的成人礼。 天才少年终究要长大,大模型也不能只停留在论文和打榜。真实世界的业务与工程骨架,才是这家公司长久活下去、跑赢下一轮竞争的支柱。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱