首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

面向多模态推理的高效长上下文建模|AICon深圳

摘要

大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。 8 月 21 日-22 日, AICon 全球人工智能开发与应用大会 "将在深圳举办。大会全日程现已100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前...

Agent cache World Model 在系统层面 token 大模型能力持续演进 的下一阶段竞争正在发生变化 模型能力之外 如何构建可靠的智能体
2026-08-17 1 阅读 约9分钟阅读 AICon 全球人工智能开发与应用大会
分享:
字号:
大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。 8 月 21 日-22 日, AICon 全球人工智能开发与应用大会 "将在深圳举办。大会全日程现已100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前沿方向,分享 AI 时代的技术探索与工程实践,共同探讨 AI 从能力突破走向系统构建的新路径。 浙江大学百人计划研究员庄博涵已确认出席 “ 大模型效率工程与 Agent 系统实践 "” 专题,并发表题为《 面向多模态推理的高效长上下文建模 "》的主题分享。2026 年,多模态大模型正从“被动感知”走向“主动执行”,而不断增长的上下文长度与生成成本,使“效率”成为其规模化落地的核心瓶颈。本次分享围绕面向多模态理解与生成的高效推理,介绍团队在大模型“算法—系统协同设计”上的最新进展:高效注意力方面,覆盖支撑长上下文的稀疏 / 线性注意力;高效记忆方面,介绍基于 KV-cache 压缩与缓存管理的显存优化;高效解码方面,分享近期并行解码策略。在此基础上,串联多模态大模型(Agent)在理解、生成等核心能力上的实践;并进一步简单介绍面向视频生成对齐的高效扩散强化学习,以及在交互式世界模型评测上的探索。最后分享对高效基础模型未来走向的思考,包括agentic loop等。在本次演讲中,庄博涵将对此展开详细介绍。 庄博涵,浙江大学百人计划研究员、博士生导师,入选国家级高层次青年人才计划。主要研究高效大模型算法与系统协同优化,致力于打造极致Token性价比,并围绕Agent Loops、World Models和Embodied AI开展前沿研究。曾任Monash University长聘助理教授并创立ZIP Lab,与多家全球头部科技企业保持深度科研合作。实验室首批7名博士毕业生均进入顶尖企业或高校,包括DeepSeek、ByteDance Seed等,多人入选头部人才计划;本科毕业生多赴世界一流高校攻读PhD,有成员获UC Berkeley博士奖学金。他在本次会议的详细演讲内容如下: 演讲提纲:Efficient AI:算法与infra协同设计高效注意力:化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。高效记忆:通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈。高效解码:通过并行解码提升推理吞吐、降低生成时延。2. 多模态大模型(Agent)的核心能力:理解与生成 理解:在有限算力下高效理解长视频,并支撑空间推理与决策。(场景:空间推理、视频推理)生成:以更低成本实现世界模型生成。(场景:3D世界生成重建,长视频生成)评测:用可诊断的基准牵引世界模型的演进。3. 总结与展望实践场景说明:World Model 推理提速面向游戏,具身等仿真场景,World Model不仅需要生成高质量视频,还需要支持低延迟的实时交互的生成速度,对此,我们团队做了很多工作。在系统层面,我们提出了FPSAttention 针对视频 DiT 的三维注意力进行改进。在 NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成加速 4.96×,同时保持生成质量基本无损。在算法层面,我们也做了许多工作,其中FlashBlock 在block diffusion范式探索新的缓存机制,在长文本和视频生成实验中实现最高 1.44× token 吞吐提升和 1.6× 注意力耗时降低,并且几乎不影响生成质量。近期的工作Mirage将视频模型的空间记忆保存在潜空间中,使得三维缓存的显存占用降低最高55倍,并且有最高10x的端到端加速,并且在WorldScore上取得了最佳结果。根据我们针对Block Diffusion范式的系统与算法的研究,正在持续整合到我们的统一的框架Inferix,Inferix 进一步提供面向 World Model 的 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成和交互式 world rolloutAgent loop 里面的效率问题在现在的Agent框架,比如Claude Code,Codex,OpenClaw中,上下文长度正在越积越长,首轮prefill时间和KV cache的显存占用正在不断上升。在系统层面,为了解决上述问题,我们提出了很多工作,比如TriAttention 面向长推理中的 KV-cache 压缩,在 AIME25 的 32K token 生成实验中,在保持与完整注意力相当推理准确率的情况下,实现 2.5× 吞吐提升或 10.7× KV-cache 显存压缩。在算法层面,我们也提出一些加速方案,例如我们探索在Agent任务中进行大小模型协同工作来提高效率。R-Stitch 根据熵来切换大小模型。其在不同尺寸的模型的推理任务上分别实现3-4倍的加速,同时保持接近完整大模型解码的准确率,而Agent-as-a-Router 将模型选择本身设计成 Agent Loop,在2900个编码任务上测试,带router的框架的平均任务得分高于opus的分数,并且成本不到opus的一半。这样的技术在实践过程中有哪些痛点?效率与质量的权衡问题。稀疏/线性注意力、KV-cache 压缩等手段可显著降本提速,但往往会带来可控但非零的质量损失,且最优适配区间会随任务、模态、序列长度发生漂移,需要投入大量精力调参与验证,无法通过一套配置适配所有场景。听众收益系统了解面向多模态理解与生成的高效推理全链路方法(稀疏 / 线性注意力、KV-cache 压缩与缓存管理、并行解码)及其算法—系统协同设计思路。了解这些效率技术如何落地到多模态Agent的理解、生成等能力,以及视频生成对齐、世界模型评测的最新实践。获得对高效基础模型未来方向的判断,为自身技术选型与工程落地提供参考。 除此之外,本次大会还策划了 AI Infra、推理工程与异构计算 "、 超级个体与蜂群智能的共生进化 "、 迈向机器人 AGI 的关键技术与产业实践 "、 Agent 安全:从风险到可控 "、 大模型效率工程与 Agent 系统实践 "、 AI Agent 高价值商业场景实战 "等10个专题论坛,届时将有来自不同行业、不同领域、不同企业的50+资深专家在现场带来前沿技术洞察和一线实践经验。 日程已100%上线!AICon 深圳站:10大专题+1个动手实验室、近60场重磅议题,集结浙大知名高校教授及阿里、腾讯、华为、快手、Google Cloud 团队等头部企业技术专家,聚焦 Agent 工程化,构建可靠智能的技术路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱