智能AI
morning
Meta大牛带清北00后天团!下一代Seedance长这样?
摘要
新智元报道 你想象过,你的行为能如何改变这个世界吗? 过去两年,AI爆发出了惊人的创造力。下一步,我们该如何与所创造的世界交互? 这正是Noiz团队成员们持续想象、持续创造的命题。 新团队,1/100成本 与他们的实时交互模型 2024年以来,AI内容生成迎来了真正的商业爆发。 OpenAI用ChatGPT打开了生成式AI时代;Midjourney、Runway、Pika、Luma、Seedanc...
新智元报道
你想象过
你的行为能如何改变这个世界吗
过去两年
AI爆发出了惊人的创造力
下一步
我们该如何与所创造的世界交互
这正是Noiz团队成员们持续想象
持续创造的命题
新团队
2026-08-08
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 你想象过,你的行为能如何改变这个世界吗? 过去两年,AI爆发出了惊人的创造力。下一步,我们该如何与所创造的世界交互? 这正是Noiz团队成员们持续想象、持续创造的命题。 新团队,1/100成本 与他们的实时交互模型 2024年以来,AI内容生成迎来了真正的商业爆发。 OpenAI用ChatGPT打开了生成式AI时代;Midjourney、Runway、Pika、Luma、Seedance、PixVerse、Minimax H3、Wan3.0等一批生成模型快速崛起,AI视频、AI图片、AI音频相继完成商业验证。 随着 AI 内容生成进入商业化增长的快车道,资本也开始押注下一代AI。 李飞飞创办的World Labs完成10亿美元融资,几乎同时,杨立昆的AMI Labs也完成了10.3亿美元融资。 Google DeepMind、Meta、NVIDIA等科技巨头纷纷布局,行业的焦点,逐渐 从「生成内容」转向「理解世界」。 然而,当这些模型真正进入产品时,AI领域迎来全新的挑战: 今天的大多数多模态模型,依然擅长生成(Generate),却无法实现沉浸式交互(Interact)。 它们可以按照指令生成一段视频、一张图片、一段语音,却无法持续理解环境变化,也无法随着用户行为实时响应。AI更像一个内容生成器,而不是一个能够持续参与世界的智能体。 更重要的是, 交互远比生成昂贵得多。 一次内容生成,只需要完成一次推理;而实时交互意味着模型需要持续感知、持续推理,并在几十毫秒内不断响应。 GPU不再工作几秒,而是持续在线运行,推理成本往往比传统生成高出一个数量级。 这也是为什么,实时可交互多模态至今仍然很少真正进入产品。 就在这块空白里,一家成立数月的神秘团队 Noiz ,选择了一条几乎完全不同的路线—— 他们训练出了新一代实时可交互多模态模型,推理成本仅为当前主流音视频模型百分之一。 技术新挑战 实时交互的AI生成 挑战 从创作到交互,这一步看似是音视频生成探索的自然延伸,在技术上却是 另一个命题 。 传统多模态模型回答的问题是:几到十几秒内,画面应该长什么样?一个任务,模型只需要交付一个结果。 但是, 一旦内容可以被进入和改变,模型就必须同时回答更多问题 : 我刚刚做了什么,当前场景处于什么状态,这次操作改变了哪些条件,下一秒应该如何反馈,以及所有变化怎样以足够低的延迟连续发生? 运行一段可交互内容,模型要在 每一次操作之后重新计算结果 。 用户向前一步、改变方向或碰到一个物体,后续画面声音都不能沿着原来的轨迹继续。系统既要记住此前发生过什么,又要让这次选择真正改变后续内容。 因此,实时交互的难点 不只是速度 。 延迟再低,如果模型不能理解动作、维持状态、组织反馈,用户得到的仍然只是一段更快生成的成片。 Noiz要弥合的,正是 单次生成与实时运行之间的gap 。 解法 他们为此做了三个反常识的操作。 第一, 不把内容看作一串文本的映射,而是看作一组持续更新的状态。 传统音视频在生成完成时,开头和结尾就已经确定。可交互内容则没有预先封闭的终点:人的每一次输入,都会改变接下来的运动、镜头、空间关系和内容分支。 这要求系统在同一条链路上完成动作理解、状态维护、生成调度和低延迟推理。任何一环跟不上,所谓「交互」就会退化成等待下一次生成。 第二, 不再让语言充当所有信息的总翻译。 绝大多数多模态模型仍然先把画面写成Caption,把动作拆成Token,再交给语言中枢处理。这样便于统一训练,却也会压扁材质、距离、力度、方向和时间关系。 Noiz选择 直接围绕事件建立表征 : 谁在移动,处于什么位置,作用于什么对象,又引发了哪些连续变化。 这一步很关键。因为实时内容无法等模型先写出一段解释,再决定怎样反馈。它必须在动作发生的同时,抓住最影响后续结果的关系。 第三, 不与大型实验室正面争夺音视频基座,而是在基础模型之上构建实时交互层。 不同音视频模型负责生成视觉结果,Noiz的模型和工程系统则负责理解用户输入、保持状态连续、调度生成过程,并把一次操作转化为即时、可控制的反馈和空间沉浸感。 这意味着,Noiz不必提前押注哪一家音视频基础模型最终胜出。行业每一次画质提升、推理加速和成本下降,都会成为它的直接红利。 它真正要 建立壁垒 的,是基础模型普遍没有解决的部分: 怎样把一次性生成改造成持续运行,怎样让内容记住此前状态,又怎样在条件改变后给出合理的新分支。 而这层能力还会产生一种互联网上极其稀缺的数据。 传统音视频数据只有「提示词—成片」;交互数据则包含完整过程:人向哪里移动,何时改变方向,在哪个位置停留,听到和看到什么,一次操作之后期待怎样的变化。 这些轨迹记录的不是人喜欢看什么,而是人希望内容如何回应自己。 模型由此学习的,也不再只是怎样生成一个结果,而是 怎样根据连续行为不断修正结果 。 成本控制背后 NOIZ的判断与创新 Noiz这里的判断是:随着Seedance、可灵、海螺等闭源和开源音视频模型继续提高质量、降低价格, 多模态生成会逐渐成为一种标准化能力 。 只做出一段更漂亮的成片,长期很难构成独立壁垒。 所以他们想搭建的,是一层 介于基础模型与最终体验之间的系统。 向下,它可以接入不同的音视频模型和内容资产,不被某一条技术路线锁死;向上,它把复杂的推理、状态和调度能力封装起来,让开发者直接构建可控制、可持续运行的内容。 这套路线可以概括为「感知—生成—交互—推演」。 感知 ,是判断用户做了什么、当前环境发生了什么; 生成 ,是调用合适的模型补全内容; 交互 ,是让每次输入都得到即时且连贯的响应; 推演 ,则是在条件改变后,计算多个可能分支。 前两步解决内容怎样出现,后两步决定内容能否被进入、操控和反复体验。 而要让这套系统不只停留在演示阶段,关键是 对成本的极致控制 。 Noiz从训练数据和推理多端分别拆解成本。 训练数据 上,针对最稀缺的空间音视频数据,团队自建了覆盖空间、材质与距离变量的采集管线,同时将物理仿真数据的成本压到极低。 真实采集负责保真,物理仿真负责穷举,一个锚定现实,一个补齐现实中无法遍历的组合,从数据源头降低专用模型的训练成本。 某种程度上,Noiz对音视频数据采集实现了仿佛取用自来水一般的、唾手可及的低成本。 更亮眼的差距出现在 推理侧 。 目前, Noiz的新一代实时可交互音视频模型推理成本约为当前主流音视频模型的百分之一。 这条路径已经被完整验证过。 上半年,从AudioX到AudioX-Turbo,团队把一个高质量的多模态输入音频基座压成了可实时运行的版本,计算量下降近两个数量级,效果不降反升。 横跨文本、图像、音视频到音频与音乐的十余项公开基准上,AudioX一个模型打满全场,部分基准刷新 SOTA ,领先第二名近一倍 这不是一次边际优化,而是来自技术架构本身的创新。 通过多模态之间的高效对齐、极致的蒸馏加速能力、最新的推理优化技术等等,系统能以更低的计算开销维持连贯、同步的实时生成。 只有成本降到这个量级,实时生成才能被反复调用、持续运行,从技术演示走向规模化产品。 沉浸式交互模型 与真实需求共生 当视觉、空间与声音终于能在同一个模型里共同演化,一个新的沉浸
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱