智能AI
morning
刚刚,中国AI占领全球前四!
摘要
新智元报道 AI视频,已经开始挑战「实时造世界」了! 9月初,Runway公布GWM Worlds 2研究预览,把音视频生成推进到了实时交互。 你让角色往前走,让房间涌进水,让沙尘暴卷过来,模型就接着生成后面的画面与声音。镜头怎么转、场景怎么变,都能继续下指令。 视频里的世界,开始跟着人的操作往下演。 但一个问题也跟着冒了出来:画面接得上,物理就一定说得通吗? 一篇名为PhysWeep的预印本,给...
HiDream
A模型
新智元报道
AI视频
已经开始挑战
实时造世界
9月初
Runway公布GWM
Worlds
2研究预览
2026-09-22
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 AI视频,已经开始挑战「实时造世界」了! 9月初,Runway公布GWM Worlds 2研究预览,把音视频生成推进到了实时交互。 你让角色往前走,让房间涌进水,让沙尘暴卷过来,模型就接着生成后面的画面与声音。镜头怎么转、场景怎么变,都能继续下指令。 视频里的世界,开始跟着人的操作往下演。 但一个问题也跟着冒了出来:画面接得上,物理就一定说得通吗? 一篇名为PhysWeep的预印本,给「视频模型懂物理」泼了盆冷水。 研究人员测了三个开放视频生成模型。其中两个,在能追踪运动的样本里,暴露出一个问题:动作看着自然,物理参数却没按要求变化。生成结果,反倒更受随机种子左右。 画面演得挺像,物理题却做错了。 这道坎,恰恰卡在视频生成继续往前走的路上。 视频模型似乎学会了「马上回应」,却还没有学会「合理回应」:角色看似实时行动,场景随指令变化,但水为什么这样流、物体为什么这样倒、人物为什么此刻作出反应,仍在考验模型。 实时交互解决的是延迟,理解世界最需要的是逻辑。想让模型模拟事情如何发生,光靠几秒惊艳的画面,显然交不了卷。 就在这个节点,智象( HiDream.ai) 发布原生全模态视频模型HiDream-O1-Video-1.0(下文简称HiDream V1)。 这是一款全新的「原生全模态」视频生成模型。它瞄准的,正是物理合理性、叙事规划和音画同步。 说得直白一点,就是让模型更懂创作者想要什么,生成的视频更连贯,也更接近可用素材。 首次参评,就在Artificial Analysis图生视频榜(含音频)杀入全球第四,Arena图生视频盲测榜全球第八。 这一刻,在全球最顶级的多模态视频牌桌上,又挤上来一位狠角色——智象HiDream V1。 此前,MiniMax、字节Seedance、阿里万相,已经在全球AI视频赛道打出了声量。 如今,智象带着双榜前十的成绩,挤上了同一张牌桌。 中国AI视频「四小龙」,凑齐了。 双榜前十 中国视频模型全面占领全球第一梯队 1080P、5—20秒范围内灵活生成、音画一体化,这些是HiDream V1交出的基础配置。 更有意思的,智象给这套能力提出的要求:听懂人想拍什么,让动作按合理的顺序发生,让声音跟着画面里的事件走。 拯救「废片率」:当视频模型真的懂了物理规律 HiDream V1最令行业惊艳的能力,是对物理规律的理解与建模。 物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减——这些物理规律直接被写进了视频模型的叙事之中,成为画面生成的底层逻辑。 对做视频的人来说,这件事只有一个衡量标准:素材可用率。 同一段镜头,过去反复抽卡才能挑出一条能用的,现在第一遍就能用——省下的每次重抽,都是实打实的时间和钱。 来看几组真实的同题对比测试。 场景一,高速赛车从镜头前疾驰而过,引擎声必须表现出逼真的多普勒效应。 A模型生成的画面中,赛车的车尾突然变成了车头。车还在往前跑,朝向却接不上了。 HiDream V1在这组演示中保持了行驶方向,引擎声也随赛车经过镜头,从高音调过渡到低音调。 这个场景要看的是,车的位置、朝向和声音变化,能不能对应同一次运动。车身再漂亮,中途突然掉个头,整段视频也会露馅。 多普勒效应听着专业,它管的是最朴素的一件事:引擎声卡在车经过的那一帧上,不用后期再逐帧对轨。 上:HiDream V1;下:A模型 把场景搬到太空,连喝口水都成了一道物理题。 HiDream V1跑出来的画面,宇航员轻轻一吹,悬浮的水球随之晃动变形,再逐渐恢复圆润、缓缓飘远;她伸出手指拨回来,凑上前一口吸进嘴里。 这段最绝的地方在于,水球怎么变形、往哪边飘,每一步都严丝合缝地对上了人物动作,瞬间就把「太空喝水」那种失重的真实感给立住了。 再把三种材质放进同一道题:抽走托板,让网球、玻璃弹珠和橡皮泥从同一高度落下。 HiDream V1生成的效果,网球落桌后明显弹起,玻璃弹珠的起伏小得多,蓝色橡皮泥则落地变形,留在原处。 同样是落到桌面上,三种材质交出了不同的反应,弹性和软硬的区别,也就有了直观的画面。 下面这个demo,看着简单,但考的其实也是最基础,也最容易翻车的物理规律——自由落体。 一大一小两颗铁球从同一高度同时松手,全程并排、同步加速,最后几乎在同一瞬间砸向地面。 HiDream V1把几个关键的细节,都接住了—— 球没有一前一后乱飘,大小比例也没变,落地时还用一声重响、石板裂纹和扬尘把冲击感做了出来。 再来看农家小院里的压水井,男孩弯腰用力压下长杆,一股水随之涌进搪瓷盆,压杆抬起后,水流逐渐收细、停下。 HiDream V1把反复压水的过程接了起来,男孩身体的起伏、压杆的转动和水流的断续,有了对应的节奏。 还有一个特别能说明问题的案例,一扇几百年历史的古堡老木门,双手极其缓慢地推。 A模型生成的画面中,物体扭曲变形,B模型则出现了用力方向和开门方向相反的荒诞画面。 而HiDream V1将缓慢推门的动作与门轴摩擦声对应了起来。 推门这个动作,藏着好几层约束:手的施力方向要与开门方向对得上,门要围绕门轴转动,摩擦声也得跟着动作走。 只要其中一环错位,再阴森的古堡、再逼真的木纹,都救不回这一幕。 顺便说一句创作自由度的变化:过去这种多层物理约束的镜头,基本没人敢写进提示词——写了也大概率翻车,宁可绕开。现在敢写,本身就是能力边界外扩的信号。 左:HiDream V1;中:A模型;右:B模型 这几组案例,把视频生成的难点摆到了眼前:单帧画面可以很漂亮,但一旦动起来,物体之间的关系就得连续成立。 视频里的下一步,得接得住上一步。 这一步之差,就是一秒视频和一条能用的镜头之间的差距。 AI听懂你在说什么了 当然,生成翻车,有时从第一步就开始了。 除了动作本身,模型还得先弄明白:用户到底想让什么事发生? 通常人们给到的提示,往往口语化、碎片化、模糊化。 比如,拍得紧张一点,就这么一句话,究竟是让人物表情紧张,还是镜头快速推进? 说「突然安静下来」,是关掉背景音乐,还是连环境声也要收住? 人和人沟通时,可以靠语境补齐。模型如果只抓关键词,就很容易把所有元素都画进去了,结果整段视频仍然不对味。 HiDream V1的做法完全不同。它在生成之前前置了多模态意图理解模块,先对视频内容进行结构化规划: 镜头时长、场景地点、画面内容、首帧约束、在场角色、动作表情、台词节奏、光色影调、景别构图、运镜焦段、背景声与音效设计…… 可以把它理解成,把自然语言,转写为可执行的分镜语言。 理解越深,规划越稳;规划越稳,后续联合生成越不容易「跑偏」。 这次,我们连完整句子都没给,只丢过去几个词:「雨、咖啡馆窗、路过的红伞、慢一点、有点想家。」 HiDream V1生成效果如下,一把红伞从窗外缓缓走过,随后离开镜头,窗边的咖啡还冒着热气,整段留出了安静看雨的时间。 隔着雨窗看人来人往,那点「想家」的情绪,有了可以落脚的场景。 接下来,我们还设计了一个自带反转的「拆弹」戏—— 两个人守着倒计时的盒子,为剪红线还是蓝线争得满脸紧张,钳子一合,喷出来的竟是生日彩带。 没想到,HiDream V1接住了这段剧情的转折,从剪线前的慌张到彩带扑脸后的错愕,把「先让人捏把汗,再让人笑出来」的意图演了出来
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱