首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

6毛一秒后,AI视频开始补物理课

摘要

生成视频的单价在跌,拿到可用镜头的成本却未必下降。 AI 短剧让这笔隐性开销变得具体。人物转身后五官变样,连贯的动作中途断裂,台词与口型对不上,几秒钟的画面就足以暴露问题。观众只需一瞬间就会出戏,制作团队却可能为此重做整段镜头。生成费用降了,返工仍然要付钱。 价格竞争因此只能解决视频生产的一部分问题。可灵、MiniMax、字节Seedance和 Google Veo 等模型,让创作者有了更多选择;...

HiDream the world mold 6毛一秒 Video 姚霆说 也就是 Reason attention
2026-09-22 1 阅读 约10分钟阅读 虎嗅
分享:
字号:
生成视频的单价在跌,拿到可用镜头的成本却未必下降。 AI 短剧让这笔隐性开销变得具体。人物转身后五官变样,连贯的动作中途断裂,台词与口型对不上,几秒钟的画面就足以暴露问题。观众只需一瞬间就会出戏,制作团队却可能为此重做整段镜头。生成费用降了,返工仍然要付钱。 价格竞争因此只能解决视频生产的一部分问题。可灵、MiniMax、字节Seedance和 Google Veo 等模型,让创作者有了更多选择;圈内流传的“6毛一秒”,也强化了生成视频越来越便宜的印象。不过,不同报价对应着不同的分辨率、时长、音频能力和套餐条件,很难直接当作同一把尺子。对付费用户,更有意义的比较是:交付一条合格镜头,究竟需要花多少钱、等多久。 越过画质与分辨率的初级门槛,这门生意正悄悄换了“卷法”:意图能不能理解对,动作连不连贯,事情发展合不合常理。 落到AI视频实际创作中,这最终影响的是生成效率:同一段镜头需要尝试多少次,才能得到一条连贯、自然且具备可用潜力的结果,往往比单纯的每秒价格更能反映视频生成的真实成本。 9月16日,智象(HiDream.ai)推出原生全模态视频模型 HiDream-O1-Video-1.0(下文简称HiDream V1),被视为这个行业转折的样本。 其将物理规律和模型智能放在了产品叙述的中心,希望改善的,是模型能否理解要求、保持动作连贯,并让事件按合理的因果关系发生。 在这款最新模型上,智象把篇幅留给了物理规律和模型智能水平。 在一次内部讨论会上,创始人梅涛和团队在白板上用彩笔写下对世界模型的设想。正中间是一行红字:“mold the world”,建模世界,也建构世界。 在智象CTO姚霆眼里,这款视频模型距离真正的理解世界仍有距离。 姚霆说,智象对于原生模全态模型架构的底层思想,仍然是让各个模态都在统一框架下生长,在上面长出图像生成模型、长出视频生成模型、长出世界模型,但其中,他们会对于如何在这个底层框架上长成真正的世界模型,作出新的探索和尝试。这也是这家公司独特的技术风格和基因。 梅涛把世界模型拆成三步:先学各种模态的表达,对现实完整建模;再结合物理法则和因果推演,也就是 Reason the world;最终顺着人的想法把物理世界重建出来,即 mold the world。 这次发布强调的物理规律与模型智能,正卡在推演与建构之间。这也是智象几类模型里最靠近 mold the world 的一次尝试。视频模型补齐,这家公司的世界模型拼图才算齐整。 近半年,头部模型轮番降价,圈内传出“6毛一秒”。尴尬的是,成片流水线上的试错开销一点没省。 具身智能,成了考量视频模型能否理解现实的另一道试题。归根结底,考的都是对物理世界合不合理的推演,正是梅涛所说的“Reason the world”。 从理解到建构世界:最关键的指标是智能水平 视频模型的下一道门槛,是把漂亮画面变成可靠的叙事。 2025年6月北京智源大会上,梅涛曾将尚未解决的问题归为叙事性、稳定性和可控性。梅涛与姚霆对行业“Aha moment”的描述也很具体:用户交出一份剧本,系统生成一部符合标准的长片。这个目标同时要求模型理解故事、安排镜头,并让前后发生的事情彼此说得通。 HiDream V1支持文本、图片、视频多模态输入,直接输出音画一体视频。在 Artificial Analysis 带音频图生视频榜上, 这款模型排名全球第四,和MiniMax H3、字节 Seedance系列、阿里wan 3同处于全球头部视频模型梯队,中国最顶尖的视频模型正在形成集群竞争的态势。 我们选择在此时,和姚霆再次交流。 HiDream-O1-Video-1.0 从立项到发布用了半年左右,姚霆把这一代与此前视频模型的差别归到三处。 其一是理解模型,先用它读图和读文本,再据此规划。也就是,先理解,后生成。把对输入内容的理解前置到生成之前。 其二是原生全模态架构,视频、文本、音频被放进同一个共享空间里交互,注意力机制采用 linear attention 与 full attention 的混合模式,在速度和效果之间换到更好的权衡。 其三是后训练,用强化学习把物理规律合理程度和音画同步程度顶上去。真正拖慢进度的工程难点落在两处:前期多模态数据的采集与对齐,以及训练框架的并行,后者对 infra 的要求很高。 技术架构的创新是这款视频模型的亮点,姚霆说,这套思路的起点是一次针对性评测。 团队把市面上的视频模型摆在一起测,发现制约智能水平的关键正在于物理规律做得差。姚霆的判断是,世界模型与别人的分野在 智能水平 ,把训练数据复刻一遍算不上智能,训练集长什么样就出什么样,那只是复制。 为了提升智能,HiDream V1让前置的理解模型先读懂画面里的物理规律、读懂文本,再做一轮规划:镜头多长、场景在哪、画面里有什么、用哪种景别和构图、台词与背景声怎么设计。 「这组三支视频中,第一支视频为HiDream V1生成,其余两支 为模型A和模型B生成 」 提示词:[0秒-4秒] 黑暗泥泞的战壕里,一位疲惫的士兵面部特写,他正对着无线电轻声耳语。台词:“我们需要支援,动作轻点。” 环境音:微弱的风声。[4秒-10秒] 突然他抬起头,拼尽全力大吼。台词:“小心炮袭!” 音效:巨大、震耳欲聋的爆炸声和刺耳的警报声。 规划清单里权重最高的部分交给物理,物体在重力下怎么落,碰撞怎么反馈,惯性怎么延续,光影怎么衰减,空间怎么保持连续。理解结果作为条件信号灌进原生全模态模型,充当生成条件,物理规律的合理性和音画的同步程度都能明显抬升;再通过强化学习,把物理规律的合理程度往上推。 该视频由HiDream V1生成 把最下面的支撑书突然抽走,中间的书和橡皮随即自然下落。无论是失去支撑后的运动反应,还是物体之间的联动变化,都符合真实世界的物理逻辑,说明模型对重力和受力关系的理解已经比较到位。 类似以上镜头在视频生成实践中往往是抽卡重灾区:支撑物被抽走的瞬间,上面的物体要么定在半空,要么乱飞穿模,生成十几条也未必挑得出一条能用的。物理规律遵循得好的直接收益就体现在素材可用率上——少抽卡、一遍过、能直接剪。 这套设计的原因是语言模型对物理规则的理解本身就够用,它能做物理题,缺的是把这层理解迁移到视觉模型。这个缺口,是否能通过补充数据、堆叠3D仿真合成的样本解决?答案是不能。姚霆当然也承认边界,因为现在还没有模型能百分百解决物理规律,而智象的目标是把视频模型在这块的智能水平往上提一提。 姚霆告诉笔者,所谓的智能水平,从几个角度衡量,首先,是对用户意图的理解;其次是对生成过程的强推演;第三是对物理规律的体现。 梳理下来,这套解法由内向外递进:先借意图前置理顺物理关系,避免主体走样、动作变形;再通过原生联合建模锁定声画同频;最后由内容决定镜头长短,回应梅涛强调的可控性。 第二步是声音与画面一起跑。音画同生指的是声音随画面一起生成,敲击、说话、环境变动与对应的声音天然踩在同一个节拍上,无需等视频做完再贴一段配乐。对做视频后期剪辑来说,这省掉的是一整道对轨工序——爆炸声不用再逐帧手动去卡。 姚霆解释,这条路线的收益与代价是,原生音画联合建模的优势在于对齐,感知上更自然;若走业内常见的两阶段方案,先出画面再贴
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱