首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

说好“多模态不是主线”的梁文锋,怎么转头就发了个Vision模型?

摘要

文 | 字母AI 在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:“多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们V4的后续版本会支持原生的多模态。” 梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,De...

Flash Vision DeepSeek 它很重要 OCR 字母AI 在多模态这个问题上 梁文锋在那次投资人交流会上曾这么说过 多模态布局 我们一直在做
2026-08-24 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI 在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:“多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们V4的后续版本会支持原生的多模态。” 梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,DeepSeek官方称,这是一个多模态视觉理解模型。 和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp没有技术报告,也没开源,官方只给了一张性能表和几个演示案例。 可DeepSeek V4 Flash Vision Exp怎么看都不像是个“组件”。 以往来看,DeepSeek OCR、DeepSeek OCR 2这样的模型才贴合梁文锋口中“组件”的定位。这些模型的作用,是把图片以像素形式存在的文字,转换成电脑可以识别的纯文本字符。 因此,相较DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一个“主线”模型。 难道梁文锋对多模态的看法改变了?事实可能并非如此。不过有一点可以肯定,那就是梁文锋学会了放低姿态,用产品和用户形成更密切的交流。 梁文锋此前曾说,“通往AGI要经过产品这个台阶,但不用花太多精力做C端、B端。”而随着DSH的爆火,发布后不到一个星期,DS就发布更新,提升了多模态能力。 过去的梁文锋对于产品有一种“偏执”,不完美不发布。DeepSeek V3.2版本和DeepSeek V4预览版之间,相隔足足4个半月,如果从V3正式发布开始算,仅仅1个大版本,就用了1年零4个月。 现如今不仅更新变快了,还把DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,都是在说明梁文锋态度上发生了一些转变。 多模态是Agent和推理的入口 如果你是练跑步的,那么你应该给别人看的成绩你跑了多少米用了多少秒,这样别人才知道你到底是快还是慢。但如果你告诉别人的是三分球命中率是多少,那很显然,你想告诉别人的是你有多准。 DeepSeek V4 Flash Vision Exp也是如此,它想表达的事情,远非是一个展示DeepSeek现有的多模态能力那么简单。 明明是一个多模态模型,官方公布的测评里,放的却是一串Agent基准。比如Terminal Bench 2.1得83.9,DeepSWE 59.3。 其实在AI视觉模型圈里有一套默认的考卷。 一个新视觉模型发布,通常要放的是这几项:MMMU,跨30个学科、大学水平的图文理解与推理,考“看到图能不能做对题”;MathVista,考图片里的数学推理;DocVQA,考从扫描文档里找到答案;ChartQA,考读懂图表里的数字和趋势;OCRBench,考最基础的文字识别。 无论是Qwen-VL、Gemini 还是GPT-4o,发新版本的时候,展示的都是这套基准。 即便是DeepSeek V4 Flash Vision Exp也放了一些多模态侧的基准,然而这些基准也“不太正经”,充满了浓浓的Agent味。 Chartography考的是专业人士读专业图表做决策,ApexBench是多模态Agent基准,Agents’ Last Exam 是通用Agent评测。没有一项是“看图答题”,全是“看完图,把事做下去”。 这张跑分图,本身就是DeepSeek的一种暗示。 梁文锋自始至终都认为多模态不是AGI的主线,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent跟推理这条主线上的一个必然产物,只不过它刚好也是“多模态”罢了。 DeepSeek V4 Flash Vision Exp所展现出来的价值观是,多模态从来不是让你“看图聊天”,而是让Agent看懂网页截图、读懂图表数据、理解UI布局,然后把任务做下去。 多模态不是目的,是手段,是给主线用的插件。DeepSeek的主线仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所干的事,也不过是强化了产品的推理能力。 虽然DeepSeek V4 Flash Vision Exp这个很神秘,但它也并非是一个凭空出现的模型。 4月29日晚,DeepSeek多模态负责人陈小康(Xiaokang Chen)在X平台发文预告,配文 “Now, we see you”,宣布DeepSeek多模态识图功能开启灰度测试。 第二天,DeepSeek正式在GitHub发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包含DeepSeek、北京大学、清华大学,属于三方联合研究成果。 然而这篇论文在5月1日凌晨就被删除,相关官宣推文也消失不见,GitHub官方仓库直接变为404状态,项目彻底无法访问。DeepSeek全程未发布任何撤稿公告,也没有公开解释原因。 好在,社区留下了这篇论文的拷贝版本。 这篇论文没有去讲“我们模型看得多清楚”,而是提出一个问题:模型能看见,但不一定能想清楚。 传统多模态模型用自然语言描述图片里的对象,比如“左边那个男的”“右边那个高的”。可是在复杂场景里,这种描述非常模糊,模型很容易越推越乱,最后导致整个逻辑崩塌。 就拿集体照来说,左边一共好几个男的,那么哪个男的才是模型所描述的那个? DeepSeek的解法,是把点坐标和边界框提升为“思维的最小单元”,直接嵌进推理链,让模型“边推理边指向”,就像人数东西时会伸出手指,一个一个点着数。 靠这套机制,模型在计数、空间推理、迷宫导航这类任务上,把抽象的判断精确锚定到图像坐标,从“左边那个男的”、“右边那个高的”,变成了“我手指的这个”、“我手指的那个”。 6月,经过DeepSeek官方确认,其在客户端和网页端上线的Vision模式,底层就是这套视觉原语机制。 而DeepSeek V4 Flash Vision Exp,是把同一套技术嫁接到了V4-Flash的API基座上,重点强化多模态Agent能力,核心推理逻辑完全沿用了论文的方案,没有跳出其技术框架。 不仅如此,论文当时的实验,就是基于DeepSeek-V4-Flash作为语言骨干所搭建的多模态方案。这次的DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。 除了DeepSeek V4 Flash Vision Exp这个模型,DeepSeek在多模态方面的进展还体现在DSH上,8月19日晚,作为DeepSeek目前的主力产品,DSH更新了rc.8版本,提升了Agent的多模态能力。 rc.8的核心,是DeepSeek在多模态这件事上,“两条腿”走路。 一条叫“原生直通”。rc.8给模型适配器加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如GLM、Qwen,或者刚上线的V4-Flash-Vision-Exp,Harness就把图片原封不动送进模型,不做任何中间加工。 另一条叫“工具层视觉”,服务的是
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱