首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Runway把代码干掉了!首个界面世界模型,UI自己长出来

摘要

新智元报道 就在刚刚,Runway正式发布首个「界面世界模型」——Solaris! Solaris是一种「全新操作系统」,不用一行代码,实时、逐帧地生成交互式界面。 只需点一下、拖一下,它便根据当前画面和操作,生成了下一帧。 而且,它还非常能打,盲测中,生成的UI效果直接碾压Claude Opus 5。 Runway联创Cristóbal Valenzuela第一时间,为「界面世界模型」下了定义—...

界面世界模型 Solaris JavaScript 新智元报道 就在刚刚 Runway正式发布首个 Solaris是一种 全新操作系统 不用一行代码 逐帧地生成交互式界面
2026-09-02 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 就在刚刚,Runway正式发布首个「界面世界模型」——Solaris! Solaris是一种「全新操作系统」,不用一行代码,实时、逐帧地生成交互式界面。 只需点一下、拖一下,它便根据当前画面和操作,生成了下一帧。 而且,它还非常能打,盲测中,生成的UI效果直接碾压Claude Opus 5。 Runway联创Cristóbal Valenzuela第一时间,为「界面世界模型」下了定义—— 未来,视频是通用界面。 最终,所有UI都将变成聊天和手势输入,聊天和视频输出。 Solaris,只是迈向这一愿景的第一步。 最重要的是,它还为训练Agent提供了一种全新途径,轻轻松松就能生成动态环境。 今天起,软件界面,正在迎来一次底层改写。 淘汰代码 让UI自己「长」出来 过去的几十年里,从早期的终端到Linux再到macOS,每个OS都在遵循同一个底层逻辑: 设计出一个界面,把它翻译成代码(HTML/CSS/JavaScript),然后才能运行。 但这种「代码翻译」,是有损压缩的。在这个翻译过程中,交互的丰富度被迫做出了妥协: 视觉保真度下降: 为了让界面响应迅速,复杂的光影和物理动态往往被简化。 交互空间被锁死: 软件在发布前,其交互行为(点击哪里、触发什么)就已经被硬编码固定。 也就是说,一旦设计被简化为代码,界面虽然响应变快了,却失去了原始设计的丰富细节。 每一次交互、每一个按钮的反馈,都提前写好了代码。 软件在交到用户手里的那一刻,它的可能性就被「冻结」了。 为此,Runway提出一个大胆的设想:把视频模型,直接塞进操作系统。 「界面世界模型」首发之作Solaris,去掉了中间代码层,把「渲染画面」和「响应操作」合成一件事。 三大核心能力 有了Solaris,软件交互不再是死板的菜单和按钮,直接带来了三大前所未有的革命性体验。 完全视觉化(Entirely Visual):所见即所得的终极形态 传统的界面下隐藏着复杂的代码逻辑,但Solaris的界面是一层纯粹的图像。 想象一下,你正在逛一个虚拟服装店,试衣间本身就是「交互界面」: 上传一张照片作为参考,从衣架上拿下一件衬衫,直接拖到自己身上试穿即可。一切自然得,就像在现实世界中一样。 活的界面(It is Alive):跟随个人意图实时演进 界面是连续实时渲染的,它时刻都在「进化」。 它的光影和倒影会随着环境自然变化,物体也会对一个人的操作做出符合物理规律的响应。 「把桌子挪开让我看看效果」或者「把沙发换个颜色」,一句话就能实现。 即使是同一个起始画面:一只手的X光片,Solaris对同样的拖拽操作也可能产生两种完全不同的响应 无边界(Open-ended):告别下拉菜单 传统的界面,只能完成程序员「预设」好的动作。 而Solaris打破了这种工作流,它由底层的「世界模型」驱动,能根据操作在实时场景中给出全新反应。 做一份沙拉?不需要在菜单里疯狂打钩,直接把食材拖进屏幕里的碗中,AI就会自然响应。 幕后揭秘 实时交互,如何做到的? 数字UI界面,一直靠两套系统撑着。 一套「知道东西」,搜索引擎、AI 助手,懂你的问题,却只给静态答案;另一套「实时响应」,网页里的 JavaScript、游戏引擎,画面会动、能交互。 界面世界模型要求二者合一:既懂你的意图,又能围着这个意图连续画出一个能交互的世界。 但想要同时做到这两点,需要攻克以下三大工程难题: 一是速度。交互一旦有超过半秒的延迟,人就感觉不到「交互」了。视频扩散模型生成一小段要几秒甚至几分钟,做内容够用,做界面太慢。 二是连贯,生成视频历来最难稳住的,就是一致性。三是成本,每一帧都需现生成,对运行成本提出了高要求。 为了做到实时交互,官博揭秘了Solaris背后的技术原理—— 它建立在Runway的Gen-4.5视频模型之上,并延续了GWM-1世界模型的路线。 Solaris将用户的输入(点击、拖拽、打字)作为生成下一帧的「条件」。 在训练过程中,模型观察并学习了海量的「交互-视觉结果」因果关系。 因此,即使没有预先编程,AI也知道当一个元素被点击或拖拽时,它的物理形态和视觉反馈应该发生怎样的变化。 Runway还将Solaris改造为极速实时引擎,一共有层—— 第一层是「 自回归生成 」。Solaris根据已经出现的帧逐帧向后生成,只依赖历史状态,新动作可以及时进入生成链路。 第二层是「 蒸馏 」。把扩散模型原本数十步的去噪过程压缩到少量步骤,让更快的学生模型逼近原模型输出,把速度推到可交互区间。 第三层是「 用模型自身的输出继续训练 」。 自回归系统运行越久,细小误差越容易累积,导致物体变形或布局漂移。让快速模型适应自己的生成分布,可以减轻这种偏移,提升长序列稳定性。 而且,Solaris是一个「双脑系统」。 LLM负责推理——理解用户请求,决定场景该如何演进;Solaris负责渲染。生成这个行为在视觉上应该如何呈现。 两者结合,完美分离了「推理」和「渲染」。 碾压Claude,降维打击传统UI 把界面翻译成代码,到底会丢失多少信息? 为此,Runway做了一系列硬核测试,第一组测试要求多模态大模型根据截图重建网页,覆盖30种界面。 重建保真度随视觉复杂度的提升而变化。即使多模态语言模型持续改进,重建质量仍会随着视觉复杂度的增加而持续下降,这揭示了界面经由语言转译时所 损失 的信息。 结果发现,随着视觉复杂度的增加,即便大模型再强(包括Fable 5),重建质量也会断崖式下降。 自然图像中的丰富视觉细节,根本无法用语言和代码精准表达。 而在真正的动态交互盲测中,Solaris更是上演了「降维打击」。 第二组测试,直接比较Solaris与Claude Opus 5生成的代码界面。在250名参与者、近7500次两两对比的盲测中: 指令遵循率:Solaris以61%的胜率,绝对碾压了代码界面的24%。 自然流畅度:Solaris更是以71%对21%取得压倒性优势。 给到的两组横评中,可以看到Solaris生成交互效果的丝滑度。 当然,官方也承认了,Solaris还是有短板,包括生成清晰文字、幻觉、长程连贯性等。 APP消失?全新交互界面诞生 Solaris首秀,展示了一个极其清晰的未来:App这个概念,可能要消失了。 如今,我们做一件事,针对不同的任务需下载不同的App。 但在「界面世界模型」的框架下,软件不再是静态的预设目录,一个新型交互界面就此诞生。 不论是电商购物、阅读新闻还是预定餐厅,系统将直接根据你的上下文和意图,实时「长」出一个最适合你当下需求的操作界面。 不仅如此,所有人获取信息、知识的方式,也将发生颠覆性的变革。 想要了解不同物质的化学燃烧反应,LLM只会给一段几乎让人「无感」的文字/图片/视频。 Solaris直接可以实时交互,直观对比铜、钢丝棉、镁的燃烧现象。 正如Runway所言,界面生成将会沿着图像和视频生成的轨迹发展:变得更快、更连贯、更有能力。 Solaris只是第一步。 当代码彻底消失,界面自己「长」出来的那一天,人机交互规则将被彻底重写。 参考资料: https://runwayml.com/news/research/introducing-s
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱