智能AI
morning
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
摘要
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成 思邈 2026-08-17 15:39:56 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI 太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。 4K、物理一致性,画面越来越真,时长也越来越长。 但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面...
量子位
Google
世界模型进入
有声时代
24FPS画面
48kHz立体声实时生成
2026
凹非寺
公众号QbitAI
太卷了
2026-08-17
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成 思邈 2026-08-17 15:39:56 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号QbitAI 太卷了!过去两年,视频生成模型把画面参数几乎卷了个遍。 4K、物理一致性,画面越来越真,时长也越来越长。 但传统视频生成模型生成的永远是一段固定、预设的成品视频,你无法干预剧情、不能调整视角、更不能改变下一秒画面内容。 世界模型带来的变化,恰恰在这里。 它会 跟随操作实时渲染、动态生成世界 。 按下前进键,前方场景实时延展生成;转身回望,身后的街道即刻演算而出。 你不再是被动的观看者,而是真正的参与者 。 而现在,做这件事的团队多了起来。Google DeepMind的Genie 3、腾讯的WorldPlay、蚂蚁的LingBot-World,以及一批创业公司,都在推进这个方向。 △神仙打架,越来越有「头号玩家」那味儿 放眼当下,世界模型已经初步实现了可自由探索、实时交互的视觉场景。画面质量、帧率、持续生成时间以及稳定性,都有了很大提升。 可当你戴上耳机沉浸式体验时,就会察觉致命短板:这片世界,一片寂静。 你漫步街巷,车辆从身旁驶过,却没有呼啸而过的轰鸣;你推开厚重的木门,门板缓缓转动,却听不到一丝铰链摩擦的声响;你看到野兽就在不远处低吼,身躯清晰映入眼帘,耳边却一片死寂。 有画无声,不成世界。 首发!可交互音视频世界模型HelixWorld 1.0 现在,这块最明显的短板,终于有人补上了。 Noiz AI联合来自香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员,刚刚发布了 实时可交互音视频世界模型HelixWorld 1.0 。 丢进去一张图和一句提示词,眼前就会展开一个持续生成的世界。 接下来就不一样了。 你不再坐着看。往前走、转个身,画面和声音会同时跟上。你走到哪,世界就延伸到哪。 这次补上的,是世界对用户行动 更完整的实时响应 ,远不止一条音轨。 在可交互的世界里,声音承担的远不止BGM。 离多远、踩在什么材质上、从哪个方向来,都会让它不一样;身后的脚步、拐角外的碰撞,往往只有耳朵能先听到。 参数也相当硬核,HelixWorld支持 24 FPS实时生成画面 ,同时输出 48kHz双声道音频 。 真正关键的还在后面。画面和声音由原生Transformer架构统一生成,从一开始就绑在一起,不会等视频做完再另配一条音轨。 声音和画面来自同一个世界,用户的每一次操作,都会同时作用在两个模态上。 声画一起生成,声音跟着场景转,还能实时交互,是HelixWorld和现有方案不同的地方。放进现在可交互世界模型的对照里,会更清楚: △交互式世界模型能力对照 好戏才开始。接下来几周,HelixWorld的模型权重和代码将完全开源。(详见后续章节) 路线:让世界具备原生多模态响应 给视频补一条音轨不难,难的是让不同模态从生成一开始就属于这个世界。 为了达到这个目标,HelixWorld把路径拆成四步。 第一步:构建带空间和动作的音画/世界数据 数据决定上限。世界模型能走多远,很大程度上取决于它训练时见过什么样的世界。 △数据采集与处理流程总览 可交互世界模型既要看见画面,也要知道什么操作引发了下一刻的变化。 视觉侧已有成熟解法,可以用位姿估计模型反推每一帧的相机轨迹,生成动作标签。可一到声音侧, 几乎没有现成数据可用 。 现有技术报告通常会筛分辨率、时长、镜头切换等等,却很少管声音。道理很简单,它们本来就没打算生成有声世界。 但音视频世界模型还得弄清更多事:音轨是不是现场录制,声源在哪,听者转身后声场怎么变,空间会留下多久回响。 麻烦的是,现成数据集给不齐这些答案。 团队干脆两条腿走路,同时从 真实世界 和 游戏世界 取材。 真实世界的数据来自公开网络视频,其中最宝贵的是 第一人称连续行走素材 。 镜头持续移动,环境声同期录制,声画天然对齐。反射、遮挡、材质这些空间信息都来自真实环境,这一批主要用来保真。 游戏世界则补上精确的空间关系。游戏引擎同时模拟视觉和听觉,几何、材质、声源位置和听者朝向都是已知的。距离衰减、墙体遮挡这些也有明确规则,每一声都能对上物理位置。 更省事的是,游戏数据天然带有动作标注,画面、声音与操作可以直接对齐。 原始素材还得再洗一遍。视觉侧按镜头切片,去掉剪得太碎、运动太少、画质太差的,台标、水印、字幕也滤掉。 音频侧没有现成经验,团队就自己搭清洗流程:去掉左右声道完全相同的伪立体声,清掉和画面对不上的后期配乐,再用语义筛选去掉旁白和外加音效,只留现场声。 留下的片段还要做声画对齐校验。系统逐帧计算声像位置和左右声道能量,再和画面里的声源方位、事件时刻逐一比对。 汽车从画面右侧驶向左侧,声像就该同步从右滑到左;碰撞发生在哪一帧,音轨上的能量峰值也得落在那一帧。空间对不上、时间错开的,直接丢掉。 标注也不再只盯着画面。除了带真实尺度的相机位姿和视频描述,每段素材还会加上音频描述与音视频联合描述,把声音和画面里的声源对应起来。画外声则单独记下,免得模型自己编。 走完整条管线后,团队得到百万量级训练片段,音质、立体声和帧级对齐都达标。随后再用人工标注数据训练分类器,按声画配合度与声场空间感打分,筛出高质量微调子集。 到这里,声音侧终于有了能用的训练数据。 数据解决模型见没见过的问题。下一步,是让声音和视觉进入同一套世界建模。 第二步:让画面与声场共同响应动作 团队以音视频生成基座LTX2.3为起点,引入动作控制。 音频和视频保留各自的latent表征,但会进入同一套Transformer联合生成,并持续交换信息。 模型要学的是:根据当前状态和用户动作,预测下一刻的画面与声音。 人往前走一步,透视、遮挡和声源距离都得变;人一转身,整个声场也得跟着转。原来在正前方的声音,转到侧后方,这才算真转过身了。声画有一路没跟上,沉浸感马上就破功了。 这一阶段仍采用全序列可见的双向模型,先不追求实时。团队 先把动作控制和联合生成做准 ,再来攻速度。 具备动作控制后,团队用微调数据集做针对性微调。 关键不只是模型能不能动,还要看脚步有没有踩对材质、混响是否匹配空间大小、声源方位会不会跟着视角转。动起来还不够,得动得像那么回事。 最基础的一关,是事件发生时声音必须同步出现,回响也要符合空间和动作。循环BGM、素材库音效和事后贴轨造成的伪同步,都要排除。 空间关系不能只凭耳朵觉得像。画质有FID、FVD,音质有FAD,音画同步有Desync,声音的方位和距离对不对得上画面,一直缺自动化标尺。听着差不多还不够,位置必须对上。 到这里,HelixWorld已经能让声画一起响应动作,但训练阶段的模型仍依赖“未来信息”,还无法真正实时交互。 第三步:让模型只看过去也能持续生成 因果化、KV Cache、自生成历史训练 传统视频扩散模型采用双向生成。计算第10帧时,它可以参考
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱