智能AI
morning
刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」
摘要
编辑|陈陈 过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。 但仔细观察就会发现,这些进步在本质上属于同一个范式:用户提供提示词,模型输出内容,然后用户观看这段内容。两者之间始终是单向的。 这个范式有一个根本局限,它生产的是内容,不是世界。无论生成的视频多么逼真,用户始终是旁观者,无法真正进入、...
World
HiDream
UiT
Physical
Consistency
过去三年
内容生成行业经历了几轮密集的技术迭代
从文生图到文生视频
从几秒的短片到分钟级的长视频
每一轮升级都让生成内容的质量和时长向前推进一步
2026-08-17
1 阅读
约10分钟阅读
机器之心
字号:
编辑|陈陈 过去三年,AI 内容生成行业经历了几轮密集的技术迭代。从文生图到文生视频,从几秒的短片到分钟级的长视频,每一轮升级都让生成内容的质量和时长向前推进一步。 但仔细观察就会发现,这些进步在本质上属于同一个范式:用户提供提示词,模型输出内容,然后用户观看这段内容。两者之间始终是单向的。 这个范式有一个根本局限,它生产的是内容,不是世界。无论生成的视频多么逼真,用户始终是旁观者,无法真正进入、改变、或持续影响那个画面里的空间。 业界也意识到了这一点,世界模型的概念开始频繁出现在各大 AI 实验室的技术报告和产品发布中,谷歌、World Labs 等都在这一方向上投入了大量资源。但热闹背后,争议同样激烈:目前市面上的产品,究竟是在构造世界,还是只是在渲染画面? 就在刚刚,智象未来 HiDream.ai 给出了自己的答案:发布 全球首款原生全模态交互式世界模型 HiDream-O1-World 。 该模型基于 自研原生全模态 UiT 架构,支持文本、图像、交互等多模态输入 ,可生成具备长时空一致性和物理一致性的动态世界。用户既能以第一、第三人称视角自由漫游,也能实时编辑角色和场景变化;从写实城市、自然地貌到二次元、幻想世界、3A 游戏风格,从人类、动物到虚构角色,都可以在同一套模型中生成和持续推演,让世界生成进一步走向 可探索、可交互 。 更值得注意的一项成绩来自第三方评测。 在美团 LongCat 与复旦大学联合推出的交互式世界模型评测基准 WBench 中,HiDream-O1-World 首次参评便登顶 Navi 分榜,超过腾讯混元 1.5、阿里 Happy Oyster 等模型。 HiDream-O1-World 在 物理维度(Physical )得分 73.3 ,排名第一, 一致性维度(Consistency) 得分 88.0 , 综合排名第一。 Physical 维度主要衡量生成结果的视觉物理合理性与因果正确性,例如物体碰撞、表面交互发生后,结果是否符合基本物理逻辑;Consistency 则考察场景记忆、空间结构和跨帧逻辑能否在持续生成中保持稳定。两项关键指标同时取得高分说明, HiDream-O1-World 在物理一致性与长时空一致性上已经建立起较强优势。 一个能逛、能控、还能持续生成的 AI 世界 而把这些分数放回真实生成效果里,感受会更加直观。 首先是 漫游模式 。 在该模式下,用户就像置身真实世界,在模型生成的场景中自由漫游。通过屏幕左下角的移动控件,即可驱动角色前进、转向或停留,并支持第一、第三人称视角自由切换,获得更沉浸的探索体验。 如下是 HiDream-O1-World 生成的雪山攀登视频。用户可以操控 移动控件控制主体前进方向,并且 随着人物不断向前,前方路径和周围环境会随位置变化实时更新;当人物沿原路返回时,此前生成的地形和场景仍能保持一致。整个过程更接近真实登山中的连续探索,视角切换自然,画面整体稳定,几乎没有明显卡顿或漂移。 更进一步,是 编辑模式 。 在这个模式下,用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。每一次动作转换、场景交互,都建立在真实的物理模拟之上,且都保持全局统一,音视频同步。 在下面这个骑行的场景中,输入提示词 “天气变化为雷雨天”,原本得晴天瞬间雷声大作,天色骤沉,雨点砸落,地面溅起水花。再输入提示词 “天气变化为太阳雨”,阴云渐次透亮,湿润的路面开始反射阳光。场景的变换不仅流畅,而且整个画面都在统一变化。 接下来是 多风格、多主体、多场景 。 在视觉风格上,HiDream-O1-World 支持高度写实的城市街景、自然地貌和室内空间,光影与材质的表现精细逼真;也支持幻想世界、二次元卡通、3A 游戏渲染等多元艺术风格。在角色类型上,人类、动物、虚构生物都在支持范围之内,每种角色的形态与运动节奏都能精准适配。 比如这座由 HiDream-O1-World 生成的教堂内部,石砌拱顶、立柱、木质书架与成排古籍共同构成了完整的空间结构,随着用户移动和视角变化,画面内容会实时更新,整体呈现出很强的材质质感和空间真实感。 当我们把这些示例放在一起看,HiDream-O1-World 展示出的核心能力已经比较清楚,具有较强的时空一致性以及物理一致性。 而要同时处理视觉、空间、动作、时间乃至物理关系,仅靠在传统视频生成模型上继续叠加控制模块,很难从根本上解决问题。智象未来选择把答案往更底层推进。 UiT:一个统一的架构 智象未来判断真正的智能,必须建立在对整个物理世界的统一理解之上,不是把多种模态拼接在一起,而是从一开始就将世界的规则内化到模型架构之中。 用智象未来创始人兼 CEO 梅涛的话来说,业内常说 model the world,但真正的世界模型更应该是 mold the world 。表达世界、推演世界、构造世界,三者缺一不可。 这个判断,催生了智象未来核心技术路线: 自研原生全模态 UiT (Unified Transformer)架构 。 传统的多模态系统,哪怕是目前能力很强的大模型,本质上依然是拼接逻辑:文本有文本编码器,图像有图像编码器(通常是 VAE),视频有视频处理模块,它们各自独立工作,再通过某种翻译层进行信息交换。这种设计的弊端在于模态之间的理解是间接的,跨模态的因果逻辑往往在翻译过程中丢失。 UiT 的做法完全不同, 它摒弃了独立文本编码器 ,把图像像素、文本 Token、视频体素、音频、动作指令、空间坐标等所有原始信号,统一映射到同一个共享 Token 空间,让它们在同一套 Transformer 网络里交互、理解、生成。 这意味着,在 UiT 的视角下,看到一个苹果从树上落下和理解重力导致物体下落,不再是两个独立的认知过程,而是在同一个表征空间中完成的统一推理。模型不再只是在像素层面拟合苹果向下运动的画面,而是真正理解了这个运动背后的物理因果。 这一架构创新,是 HiDream-O1-World 能够在物理一致性和时空一致性上超越同类产品的根本原因。 两大行业难题:时空一致性、物理一致性被攻破 现有 交互式世界模型 大多依赖隐式时空表征,根据初始图像和相机轨迹直接生成新视角视频,一旦视角变化较大,就容易出现几何结构不合理、物体形变以及跨视角空间不一致等问题。 智象未来 被 ECCV 2026 录用 的相关研究,将原本隐含在视频生成过程中的几何结构单独提取出来,采用 Geometry-then-Appearance 两阶段框架, 把几何生成和外观生成分开建模 。 项目主页: https://yanghb22-fdu.github.io/DreamWorld DreamWorld 采用 Geometry-then-Appearance 的两阶段生成方式 第一阶段 负责生成目标视角下的几何结构:模型先根据输入图像和用户指定的相机轨迹,将初始场景投影到新的观察视角,得到一组不完整的观测结果。由于新视角会暴露原图中从未出现过的区域,这些观测天然存在遮挡、空洞和结构缺失。团队随后借助预训练 3D Foundation Model 提取多尺度几何特征,再由
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱