首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

ECCV 2026 Oral|从「一句提示词」到「多镜头成片」:MAVIN让AI开始按剧本讲故事

摘要

刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。 过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。 但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。 前一个镜头里,女主说完一句话;画面随即切到...

MAVIN ECCV 北京大学 可灵团队 https 刘恺骐 北京大学博士生 主要研究方向为可控视频生成 音视频联合生成 世界模型
2026-08-28 1 阅读 约10分钟阅读 机器之心
分享:
字号:
刘恺骐,北京大学博士生,主要研究方向为可控视频生成、音视频联合生成、世界模型、理解生成统一模型及多模态大模型等,相关成果发表于 ECCV、ICCV、CVPR 等国际会议。 过去几年,视频生成模型在清晰度、运动表现和画面质感上不断进步。输入一句文字,模型已经能够生成颇具电影感的视频。 但当任务从「生成一个漂亮片段」,变成「完整拍完一场戏」,问题就不一样了。 前一个镜头里,女主说完一句话;画面随即切到男主,他停顿片刻后作出回应;接着镜头切回女主,而男主在画外继续说话。要完成这段内容,模型不仅需要知道画面中有什么,还要准确执行一系列叙事约束:何时切镜?谁在什么时候开口?对白能否与口型和动作对应?切镜之后,人物的脸和声音还能否保持一致? 即使这些要求已经写进脚本,现有模型仍可能出现切镜错位、对白提前或延后,以及多人场景中的串脸、串音。问题不只在于故事有没有说清楚,更在于模型内部是否具备沿着复杂时间线组织音视频内容的能力。 为此,北京大学、可灵团队、中国科学院自动化研究所和中山大学联合提出 MAVIN,一种支持定制化叙事控制的多镜头音视频联合生成模型 。 目前,该论文已被 ECCV 2026 以 Oral 形式接收。刘恺骐为第一作者,翁书晨、施柏鑫为通讯作者。 论文标题: MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control 作者单位: 北京大学、可灵团队、中国科学院自动化研究所、中山大学 论文地址: https://arxiv.org/abs/2606.29473 项目主页: https://liukqchoco.github.io/MAVIN/ 一、会生成电影感画面, 为什么还「拍不完一场戏」? 多镜头音视频叙事至少面临三类挑战。 首先是时间错位。模型可能知道脚本中有哪些人物和事件,却无法判断它们应该出现在哪个时间段:镜头已经切换,上一名角色的声音仍在继续;人物尚未出现,对白却提前响起。 其次是身份混淆。同一名角色跨镜头出现时,不仅要保持面部、发型和服装一致,也要维持稳定的音色;多名人物交替对话时,还要避免串脸、串音和说话人绑定错误。 此外,用户通常只会输入一段故事梗概,很少完整标注镜头边界、对白区间、角色外貌和声音事件。系统既需要补全一份可执行的剧本,也需要真正按照这份剧本完成生成。 因此,MAVIN 要解决的并不是简单的「多生成几个镜头」,而是让模型学会在一条统一的叙事时间线上,调度画面、对白、动作和角色身份。 二、核心思路: 把「叙事时间线」真正写进生成模型 MAVIN 采用全局、镜头和角色三个层级的结构化脚本,统一描述整体情节与背景音乐,各镜头的起止时间、画面内容与人物动作,对白内容及其时间区间,以及角色的视觉外貌与声音身份。 模型建立在双塔音视频联合生成架构之上,视频和音频分别在各自分支中建模,并通过跨模态注意力交换信息。围绕「何时发生」与「由谁发生」,MAVIN 提出了两项核心机制。 1. 边界感知注意力:让镜头与对白在叙事时间线上精准落位 视频生成模型通常让整段文本影响所有音视频位置。这意味着,模型在生成第一个镜头时,也能读取后续镜头的描述,容易造成后一个人物提前出现、上一段对白串入下一镜等「语义串场」。 MAVIN 根据镜头边界划分视频特征,根据对白区间划分音频特征,再通过动态 token 路由,为不同信息限定明确的作用范围:镜头描述只影响对应片段,角色外貌只在其出场镜头中生效,声音条件也只作用于相应的对白区间。 由此,镜头切换、人物动作和说话时间不再只是提示词中的「软要求」,而成为模型内部能够执行的时间约束。 2. 身份感知传播:镜头可以换,演员不能「掉线」 MAVIN 可以同时接收角色参考图像和参考音频,并通过专门的音色编码器,从参考语音中提取「是谁在说」,而不是复制参考语音「说了什么」。 在此基础上,身份感知掩码进一步限制不同人物之间的信息传播。每个镜头只读取实际出场角色的视觉参考,每段对白只读取当前说话人的声音特征;同一角色的文字、画面和音色相互绑定,不同角色之间则保持隔离。 这相当于为每名角色设置独立的视觉与声音锚点,从而减少多次切镜后的身份漂移,以及多人对话中的串脸、串音。 3. 多智能体脚本流水线:先把故事补成一份「可拍」的剧本 面对自由形式的用户输入,MAVIN 还设计了一套轻量级多智能体流水线。 结构解析智能体负责识别场景、角色和对白,并划分镜头与对白区间;身份对齐智能体匹配人物与参考图像、参考声音;叙事细化智能体则补充动作、镜头语言和环境声音,最终形成全局、镜头和角色三个层级的脚本。 它负责「把拍摄计划写清楚」,边界感知注意力和身份感知传播则负责「按计划真正拍出来」。 三、MAVINSet: 让模型从数据中学会「一场戏该怎么拍」 要让模型学会执行镜头、对白与角色约束,训练数据也必须包含完整的叙事结构。然而,现有音视频数据通常只提供整段内容描述,缺少镜头边界、对白时间以及跨镜头的角色信息。 为此,团队构建了多镜头音视频数据集 MAVINSet ,收录数十万条时长 3 至 15 秒、包含 1 至 6 个镜头的样本。不同于普通视频字幕,MAVINSet 为每段内容提供全局、镜头和角色三级标注,覆盖故事进展、镜头内容、人物动作、对白文本与时间,以及角色的外貌和声音特征。 对于跨越切镜点的对白,数据还会记录其在不同镜头间的延续关系。这样,模型看到的不再只是一段音视频,而是一份包含画面、声音、人物与时间信息的完整「分镜表」。 四、实验结果: 不仅时间更准,角色也不再「串线」 研究团队将 MAVIN 与两类代表性方法进行了比较:一类先生成多镜头视频,再通过视频到音频模型补充声音;另一类则是端到端音视频联合生成模型。 视觉对比 在同一段三镜头雪地对话中,现有方法容易出现角色外貌漂移、镜头顺序错乱或对白与人物对应不准等问题。相比之下,MAVIN 能够更完整地执行镜头切换,并在不同镜头间保持人物身份与场景风格,同时让对白与角色之间的对应更加准确。 定量指标 在涵盖音视频质量、语义一致性、音画同步与多镜头控制的 13 项指标上,MAVIN 取得最佳结果。其中,镜头切换准确率 STA 达到 0.9897,对白时间对齐指标 TAMS 达到 0.8104,表明模型不仅能够生成连贯的音视频内容,也能更准确地执行脚本中的时间和身份约束。 五、从模型能力到创作接口: MAVIN 拓展多镜头叙事的应用边界 当镜头边界、对白区间和角色身份被统一建模后,MAVIN 不再只是按照脚本一次性生成成片。创作者可以直接修改时间安排、角色设定和局部叙事条件,由此衍生出多种面向实际创作的应用。下面介绍其中两个具有代表性的应用场景: 叙事节奏控制(Speed Control) 通过调整镜头边界和对白区间,用户可以改变整段内容的叙事节奏。压缩镜头时长和对白区间,可以让画面推进与人物表达更加紧凑;延长相应区间,则能形成更舒缓的节奏。模型会按照新的时间安排重新组织动作、口型和声音,而不是简单地对已有视频进行机械变速。 角色身份定制(Identity Customization) MAVIN 将角色的视觉外貌与声音身份作为
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱