首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招

摘要

实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招 林, 方舟 2026-09-16 10:58:34 来源: 量子位 诺亚 发自 凹非寺 量子位 | 公众号QbitAI 有没有人跟我一样,天天对着AI小猫小狗短视频傻笑?谁说观众不喜欢看AI啊,这AI可太好了!(战术后仰.jpg) 今天,家人们有福了!生数科技发布了Vidu S2模型,不仅能让你和虚拟数字形象实时互动,还能对着正在...

Vidu Editing Avatar 量子位 换背景 老规矩 实时互动 实时改视频 探索空间视频 S2一次放了三个大招
2026-09-16 1 阅读 约9分钟阅读 林, 方舟
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招 林, 方舟 2026-09-16 10:58:34 来源: 量子位 诺亚 发自 凹非寺 量子位 | 公众号QbitAI 有没有人跟我一样,天天对着AI小猫小狗短视频傻笑?谁说观众不喜欢看AI啊,这AI可太好了!(战术后仰.jpg) 今天,家人们有福了!生数科技发布了Vidu S2模型,不仅能让你和虚拟数字形象实时互动,还能对着正在播放的视频,现场换装、换人、换背景、换画风。 不管你是想给屏幕里的小奶狗男友换套西装,还是想让二次元小偶像一秒切到赛博朋克风,甚至想把老板变成一只“尖叫鸡”……它都能丝滑搞定。 数字人这边,也开始接“新活儿”了:跳舞、转身,动动嘴就能安排;聊到一半再递张参考图,还能让它换上同款衣服、拿起指定物品。你负责出主意,它负责加戏。 好家伙,这哪里是AI视频生成模型,这分明是“某迹暖暖Pro Max之导演剪辑版”啊! 这项神奇的能力来自生数科技最新发布的Vidu S2 , 不仅让数字人更加能说会动,也能像P图一样P视频,边播边改。 要知道,就在短短两个月前,上个版本的Vidu S1才刚让大家见识了什么叫“数字人成精”。数字人从依赖“音频驱动口型+预设动作库”的传统模式,进化到能通过语音控制数字人的行为,还能实现无限时长连续互动。 Vidu S1一经推出,便被网友玩出了花。有的把自己猫的照片喂给模型,让它开口讲话;有的把Coding界面传给模型,让它扮演“程序员鼓励师”小姐姐;还有的让自己去世的亲人“复活”,互相倾诉思念… 这次Vidu S2带来了全方位升级,一口气放出三个大招: S2-Editing :正在输入的视频,可以实时换装、换角色、换背景、换风格。这是本次最值得先上手的升级,堪称视频版“某图秀秀”; S2-Avatar :实时互动角色升级到720P,还能接住中途递来的物品参考图,按指令拿起、展示,完成更丰富的肢体表演。 实时空间视频探索 :进一步把生成或编辑的视频转换成左右眼画面,送进VR头显,探索与角色更有纵深感的互动。 而且Vidu S2发布当天就全量开放,不搞内测、不限名额,这波操作属实是把“技术自信”写在脑门上了! 实测模型,这AI是不是偷偷学了魔术? 老规矩,先来测试一波这次更新的Vidu S2。 Vidu S2包含两个细分模型: Vidu S2-Avatar :实时交互模型,支持语音对话、语音控制数字人做动作、实时交互中输入参考图 Vidu S2-Editing :实时视频编辑模型,可以改变服装、人物、背景和视频风格 老规矩,先上实测。先看 Vidu S2-Avatar ,除了能在互动过程中接收新的参考图,它执行动作指令的能力也升级了。 到底进步了多少?把上一代请出来,同屏比一比就知道了。 同样让数字人跳舞、转圈和跺脚,左边的S1没能完成要求,右边的S2则跟着指令动起来了。 以前S1主要是聊天互动,现在S2将大幅度的身体动作也安排上。“嘴上答应”和“身体力行”的区别,这下终于有画面了。 不仅动作更听指挥,画面也更清楚了。 Vidu S2-Avatar将实时输出分辨率从上一代的540p提升到了720p,数字角色面部和衣服上的细节等变得更加丰富。 这种提升放在持续互动里很直观:人物在动、对话在继续,清晰度也得跟上。 接下来,轮到参考图发挥作用。 你可以在互动过程中随时递给数字人一张新图片,让它拿起图里的物品、换上指定的衣服,或者进入新的场景。既能听指令做动作,又能照着参考图调整内容,这位数字搭档能接的“活儿”,明显更多了。 再来看看Vidu S2-Editing ,它带来的实时视频编辑能力,是这次最大的更新之一。 画面对准一位正在接受采访的女士,秒切不同款式的服装,它们都非常合体,好像本来就穿在她身上似的。 人物动作连贯,脸部一致性很好,服装随着动作产生的形变也非常真实。尤其是最后一套驼色大衣,袖口半遮住了女士佩戴的首饰,处理得非常真实。 非要挑刺的话,第二套衣服在呈现色块时仍有一点涂抹感;人物佩戴帽子时,头发仍然有一点穿模。 不仅能换装,还可以更换背景。看看这个视频,小姐姐在各个场景丝滑地跳着女团舞,我感觉自己在看一个制作精良的MV。 不换背景只换人?听说《牛来2》要来了?在办公室的我变成了牛来跟大伙say hi…… 嚯!我感觉自己好像加班加出幻觉了。 最离谱的是,我变成的这些奇怪东西居然完美融入了办公室环境,透视、遮挡都挑不出毛病。建议各位打工人收藏此功能,开会时把自己替换成财神爷,说不定老板看你都顺眼了。 再来看看视频风格转换的表现。 小哥哥切换不同的风格,视频全程的画面一致性以及风格的迁移能力表现得相当不错! 小小总结一下,Vidu S2-Editing,对正在进行的画面提供四类实时编辑能力: 实时人物换装 :淘宝店家、穿搭博主狂喜 实时更换背景 :足不出户环游世界 实时更换主体角色 :万物皆可打工,包括财神爷 实时风格渲染 :审美疲劳?换个滤镜继续嗨 这意味着,直播间的视觉效果、虚拟角色的演出、创意视频的玩法,都有了更多临场发挥的空间。 观众弹幕发个“想看主播穿恐龙服”,下一秒可能就真穿上了。观众聊着聊着就当上了导演,主播演着演着就成了NPC。 69天完成版本更迭 只用了69天,Vidu S2就完成了一次大版本跃迁,视频模型赛道现在真的是卷麻了! 两个月前,Vidu S1的亮相同样惊艳,有必要来回顾一下这位“前辈”。Vidu S1、Vidu S2的全链路研发均由清华大学朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。 之前绝大多数数字人,都是“音频驱动口型+预设动作库”的传统模式,本质上跟一个会动的PPT没太大区别。 而Vidu S让AI视频从“离线生成”跨越到“实时交互”。只需要上传一张照片,模型就能生成一个可以和你实时互动的AI角色。 这里要划个重点:实时交互视频,和传统视频生成模型走的是不同的路。 实时交互视频的每一帧,都是根据用户输入现场算出来的。这意味着模型的生成速度必须跑赢播放速度,不然用户看到的就是PPT式的卡顿。 这可不是简单地“把生成速度拉高”就完事了,而是要重塑整条生成链路。团队用SageAttention等技术给计算提速,再通过多GPU协同调度减少模块间的等待,让显卡少闲着、整条生成链路跑得更顺。 到了S2,这种交互又向前迈了一步:画面从540p提升到720p,数字人能执行更复杂的动作,还能在互动中接收新的参考图;新增的Editing模型,则把换装、换人、换背景和换画风带进了实时视频流。 此外,还有一件事值得单独唠唠。 最近“实时空间视频”成为了视频模型行业的竞争前沿,业内有公司刚开始布局,而生数已经把空间视频做成了可体验的产品。 所谓的空间视频,是一种能够呈现三维立体深度和沉浸感的立体视频格式。它基于人类的双目立体视觉原理,利用两个不同视角(例如主摄和超广角摄像头)同时录制影像,记录下景物的立体深度信息。 空间视频需
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱