智能AI
morning
Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差
2026-08-04
1 阅读
约10分钟阅读
36kr
字号:
文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。 刚刚过去的7月,月之暗面发布Kimi K3。这款总参数2.8万亿、支持100万token上下文的MoE(混合专家模型),在Coding和长程Agent能力之外,出色的原生多模态能力是K3的另一个标签。 所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与Agent(智能体)的感知与决策。 K3发布后曾以1679分登顶Arena Frontend Code榜单。该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。 浏览器开发平台Puter曾在测试网页中制造5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。得益于出色的原生多模态能力,K3能够看懂代码运行后的视觉问题,为下一轮修改提供依据。Kimi方面将这种在代码与截图之间反复迭代的方式称为“vision in the loop”:模型写完代码后查看页面,再根据视觉结果继续调整。 这些都离不开模型的多模态能力。 除了月之暗面,阿里和字节也沿着原生多模态路线,将视觉作为通用模型的基础能力,在最新的Qwen3.8-Max和Doubao-Seed-2.1上,可以看到视觉理解和多模态输入都作为主要功能出现。 而在国产模型头部梯队的另一边,DeepSeek、智谱和腾讯混元的最新通用基座则仍以文本输入为主。 此前,DeepSeek创始人梁文锋曾说:“把AI训练做好,并不需要世界模型,甚至不用多模态。”但他同时表示:“多模态最终还是要做的。” 这两句话并不矛盾。各家公司对多模态的长期价值没有太大分歧,真正的分歧在于时机和代价。 在Coding快速迭代的阶段,要不要同步训练视觉,以及为此投入多少模型容量、数据和算力,正在影响国产头部模型的技术路线。 Agent为什么需要眼睛 做原生多模态,到底有没有必要?随着当下Agent的任务链越来越长,这个问题开始变得愈发具体。 “很多时候我就喜欢截图输入。”一位来自某头部基模团队的研究员表示,“可能文本也能做到同样的需求,但是你得花很多上下文去描述视觉关系。” 视觉输入能够带来更多便利,但不同用户对它的感知并不相同。“一般人可能感觉不到,但对于开发者群体而言,有多模态还是很方便。” 不过,这种需求并不只属于开发者。上述研究员提到,他身边一些并非AI从业者的用户,使用模型最多的场景之一就是制作PPT。“更专业的人可能需要更多能力、更多模态,但普通用户也会在具体场景里用到它。” 纯文本模型本身仍然“看不见”。实际系统可以调用OCR或独立VLM(视觉语言模型),先把图片转换成文字、标签、坐标或结构化字段,再交给文本模型推理。这些工具可以通过Agent框架或MCP接入,用“外挂”的形式获得视觉能力。 从这个角度来看,“如何让Agent获得视觉输入能力”这个命题,不仅是一个基模研发问题,也是一道产品题。 如果系统调得足够好,上游一个大的语言模型做中枢,下游放一个小一些的视觉模型,就像老板把一件小事分配给员工,足以解决大量普通任务。 但在多模态研究员看来,这种模块化方案仍有边界。“如果调用一个工具,总归还是两个模型:一个LLM是‘瞎子’,下游配一个能看清楚的小弟。”他解释道,原生多模态模型内部的视觉输入与语言主干之间“通信的通道会更宽”,而不是先把画面压缩成文字,再交给另一个模型判断。 这种差异也会延伸到后训练。“如果模型自己能做,肯定是更好的事情。”陈屿说,原生多模态模型可以在视觉强化学习中重新读取自己生成的页面或图像,把视觉结果纳入同一条训练轨迹;如果依赖外部工具,感知结果还要在两个模型之间传递。 而在需要反复查看屏幕的长链任务中,这种差别会更明显。外接视觉工具要先把画面转成文字,再交给主模型判断;原生多模态模型可以直接看懂页面变化,接着直接决定下一步怎么做。 在交流中,一位研究员向智能涌现回忆起第一次让GPT-5.6 Sol操作PC端Agent时,那种“震撼”的感受。GPT-5.6 Sol不仅能自动打开浏览器,还能处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。 威利森评价,模型“知道很多诀窍”,为了完成目标,几乎会把能用的办法都用上。 “如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。”上述多模态研究员说,“但很多面向用户的输出都是视觉的,比如网页、图片和视频,模型需要理解这些结果,再给自己反馈。” 事实上,对于视觉究竟只是模型完成任务的一种工具,还是理解世界不可缺少的部分,一直以来业内并没有达成共识。 OpenAI联合创始人、前首席科学家伊利亚·苏茨克维(Ilya Sutskever)曾把文本称为“世界的一种投射”:人类已经把大量现实规律压缩进语言,模型持续学习文本,仍可能获得对世界的理解。 图灵奖得主、Meta首席人工智能科学家杨立昆(Yann LeCun)的判断几乎相反:“绝大多数人类知识,并没有以文本形式表达出来。”语言只是经过人类筛选和概括的信息;模型要理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习。 文本是高度概括过的信息,图像和视频更像原始信号。原始信号包含文字没有记录的世界,也需要更多数据、算力和耐心,才能被提炼成可以泛化的知识。 “多模态肯定不是决定性的,但它很重要。”一位模型研究员说,“基础的图片、视频答题已经做得比较饱和了。下一步应该把多模态放进贴近生产的实际场景和复杂任务中。” 另一方面,随着Agent生态在大众用户间全面普及,用户对旗舰模型的期待也在变化。 6月底,智谱首席科学家唐杰在X平台向用户征集“下一版GLM必须加入哪些新功能”,评论区反复出现的答案就是“视觉”。 此前,曾有多位业内人士向智能涌现表示,智谱与腾讯混元的下一代通用基座模型,都可能进一步向原生多模态迈进。 趋势已经出现,但是否要全面强化原生多模态路线,基模团队们还面临着一个资源分配的问题。 模型长出眼睛的代价 “对于LLM(大语言模型)来说,多模态更像是一个挂件。”一位来自某头部基模厂商的研究员说,“模型发展的核心不是多模态,而是完成任务的能力。” 从完成任务的角度看,模型看得更多,不等于干活能力一定更强。一个更现实的问题是:LLM加入多模态能力后,甚至有可能削弱原有的语言、推理和Coding能力。 “任务越多,越难平衡。”一位多模态研究员表示,“只做一个任务,可以一直往一个方向调;同时做两个任务(视
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱