首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Runway把世界模型做成了操作系统!不用代码直接生成界面

2026-09-01 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编辑部 过去,AI 改写软件开发的方式,大体遵循着同一条路径。人说一句话,模型写代码;代码跑起来,再变成网页、App 和各种可以点击的界面。从 Copilot 到 Cursor,再到越来越多 Coding Agent,模型已经接手了相当一部分编程工作。但有一件事没变:代码仍然夹在人的想法和最终界面之间。 现在,Runway 想把这一层直接拿掉。 今天凌晨, Runway 公布了一项新研究 Solaris,并将其定义为首个 Interface World Model,界面世界模型 。 它提出的问题很直接:如果操作系统里的 App 和网站,不再提前写好,而是在你使用的过程中实时生成,会发生什么?Solaris 给出的答案是,界面可以像视频一样生成。 你点一下、拖一下,或者输入一句话,模型便根据当前状态继续生成下一帧。按钮、物体、场景以及随之发生的变化,都不必由开发者提前逐项写进代码里。 换句话说,在 Solaris 的设想里,你眼前看到的画面,本身就可以成为软件。这也是 Runway 从视频生成走到世界模型之后,又一次明显的方向扩张。 有人感叹道,「太猛了,你们还是一如既往地领跑。已经迫不及待想看看未来半年世界模型会进化到什么程度。」 当一张图真的可以「运行」 今天的 AI 已经很会画界面了。给模型一句 Prompt,它可以生成一张完成度很高的电商页面、产品官网,甚至一整套 App 设计稿。问题在于,这些图只能看,不能真正运行。 想让图片里的衣服可以被拖动,让购物车能够计算价格,让页面根据点击发生变化,设计最终还是要经过 HTML、CSS、JavaScript 或其他程序语言,转换成计算机能够执行的结构。 Runway 对这件事的看法相当激进。在它看来,这次转换本身就是一种信息损失。 一张复杂的视觉设计里,可能包含材质、光影、空间关系、细微的物体状态。但当它被重新表达成组件、布局和代码后,程序保留下来的,只是开发者提前决定要实现的那一部分行为。软件最终能够发生什么,也因此在上线之前就基本确定了。 Solaris 试图换一条路: 不再先把画面翻译成代码,再让代码驱动画面;模型直接在视觉空间里处理界面和交互 。 例如,在 Runway 展示的一个虚拟服装店场景里,整个店面本身就是界面。用户可以从衣架上拿起一件衣服,把它拖到自己身上试穿,也可以直接移动店里的陈设。 传统网页需要开发者预先定义:这个区域可以点击,那个物体允许拖拽,拖到这里之后触发什么事件。到了 Solaris,这些变化由模型根据当前画面和用户动作继续生成。 界面的边界因此变得模糊了。它可以是一排按钮,也可以是一间店、一张桌子、一幅画,甚至一个完整的三维场景。 Runway 是怎么把视频模型变成「软件」的? Solaris 并不是从零训练出来的一套新系统。它建立在 Runway 的视频生成模型 Gen-4.5 之上,并沿用了此前 GWM-1 世界模型的技术路线。 第一步,是让视频模型真正理解「交互」。 Solaris 在生成下一帧时,会把点击、拖拽等用户输入也作为条件。模型看到的不只是连续的画面,同时还看到画面发生变化之前,人做了什么。看过足够多这样的对应关系后,它能够学习某个动作和视觉结果之间的联系。 因此,当用户拖动一个物体时,系统不一定需要一段事先写好的程序告诉它「拖拽之后将 X 坐标增加多少」,模型可以直接预测这个动作之后的视觉状态应该是什么。 但仅仅理解动作还不够。一个界面如果点一下之后等几秒钟才动起来,基本没法用。传统视频扩散模型往往需要经过几十步去噪,生成一段视频可能需要数秒甚至更长时间。对于看视频,这个速度还能接受;换成鼠标交互,就完全是另一回事。 Runway 给 Solaris 做了三步改造。先把生成过程变成逐帧自回归,让当前帧只依赖已经出现的内容;再把原本多步的去噪过程蒸馏到少数几步;最后,让加速后的模型继续用自己的生成结果训练,以减少长时间连续运行后的画面漂移。 Runway 称,这套方法最终让 Solaris 达到了能够进行实时交互的生成速度,同时维持 Gen-4.5 教师模型的视觉质量。官方给 Solaris 设定的目标之一,是在 720p 下保持长时间交互中的视觉质量。 Solaris 还有一处设计很值得注意。真正驱动这套系统的,并不是单独一个视频模型。接下来, Runway 把整个过程拆成了两个部分:语言模型负责推理,世界模型负责渲染 。 语言模型先理解用户想完成什么,判断当前场景应该发生局部变化,还是应该切换到一个新的状态,再生成用于指导 Solaris 的提示。Solaris 随后负责把这个变化真正画出来,并持续生成后续画面。一个决定应用下一步应该做什么,另一个决定这件事应该怎样出现在屏幕上。 这让 Solaris 和单纯的「AI 生成网页」拉开了距离。 最后一个重要的能力是 持续生成 。 你只需要提供一个初始状态,比如一个品牌场景或产品展示场景,模型就会实时持续生成画面帧。当用户点击、拖拽或输入内容时,这些交互会被纳入后续画面的生成过程,场景也会随之在原地实时响应。 整个过程中,没有预先定义好的页面,也没有固定模板可以调用。取而代之的是,通过文本提示来定义在特定场景中,点击、拖拽以及其他交互分别意味着什么。 和前沿大模型比,Solaris 表现怎么样? Runway 也专门设计了一组实验,验证这种路线到底有没有意义。 第一组测试针对的是「翻译损失」 。Runway 选取了 30 个不同复杂度的界面,包括普通网页、图片密集型网页以及自然图像,让包括 Claude Fable 5 在内的多模态模型根据单张截图重建界面。 评估采用了两类指标。一个是 SSIM,即结构相似度,用来衡量重建结果与原始画面在位置和视觉结构上的相似程度。另一个使用 DINOv3 特征,把原始画面的不同区域与重建结果中的对应内容进行比较,用于观察即使布局发生变化,原始视觉信息究竟保留了多少。 Runway 公布的结果显示,随着画面复杂度增加,经由语言和代码重新构建界面时,信息损失会越来越明显。自然图像受到的影响尤其大。 第二组实验更直观。 Runway 让 Solaris 和使用 Claude Opus 5 生成的代码界面从同一张图片开始,接受相同的交互要求,再让真人判断哪一种结果更好 。实验覆盖 30 个交互案例,共邀请 250 名参与者,最终收集了接近 7500 次两两比较。 在「是否更好地遵循交互指令」这一项上,Solaris 获得 61% 的偏好,代码方案为 24%;在「行为是否更自然」这一项上,Solaris 的偏好比例达到 71%,代码方案为 21%。 至少在 Runway 设计的这批任务中,直接生成整个视觉状态,更容易让一次操作和周围环境保持连贯,而不是只修改被要求变化的那个 UI 元素。 更大的用途,可能还不是给人用 如果 Solaris 只是让网页变得更漂亮,它还不足以让 Runway 单独创造一个「Interface World Model」的概念。另一个更值得关注的用途,是 训练 Agent。 当前 Computer Use Agent 面临一个很现实的问题。互联网是为人设计的,而 Agent 需要学
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱