首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

实时视频版「Nano Banana」来了!160亿参数重磅开源

摘要

新智元报道 这个 8 月,AI 视频赛道的军备竞赛又升级了。 字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。 整个赛道争的还是同一个指标: 谁能一口气生成得更长、更连贯、更便宜。 但这场比赛有一个所有人都默认的前提: 你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。...

Video JoyAI Edit VAE Seedance MiniMax Hugging Face GitHub https
2026-08-07 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 这个 8 月,AI 视频赛道的军备竞赛又升级了。 字节跳动发布 Seedance 2.5,把单次视频生成时长从 15 秒翻倍到 30 秒。同一天 MiniMax H3 开源,价格只要闭源旗舰的三分之一。 整个赛道争的还是同一个指标: 谁能一口气生成得更长、更连贯、更便宜。 但这场比赛有一个所有人都默认的前提: 你得先等视频生成完,看一下,才知道自己想不想改。如果想改,对不起,重新排队。 有意思的是,隔壁语音赛道已经把这个前提拆掉了。就在几周前,OpenAI 发布 GPT-Live,语音交互从「说一句等一句」的回合制进化成全双工—— AI 能边听边说,不用等你把话讲完。 语音对话率先证明了一件事: 「实时」本身就是一种新范式。 8 月 5 日,京东把同样的事情搬到了视频编辑上。 京东开源的 JoyAI-Video-Edit,是这个赛道里第一个同时做到「流式架构 + 实时速度 + 可用质量」的模型。 部署代码、技术报告、在线 Demo 和模型权重同天在 Hugging Face 和 GitHub 上放出。 开源地址: GitHub:https://github.com/jd-opensource/JoyAI-Video-Edit Hugging Face:https://huggingface.co/jdopensource/JoyAI-Video-Edit 实时视频版的Nano Banana 先说一下JoyAI-Video-Edit的效果—— 720P 分辨率下模型推理速度达到每秒 30 帧,系统端到端稳定在 24FPS,而且支持任意时长的稳定流式编辑。视频可以一直播、一直改,没有时间上限。 换句话说,对着视频你可以不断动动嘴实现各种视觉特效。 变老、变年轻、变成乐高小人,甚至是拉布拉多,一句话的事,就能实时渲染出来。 太好玩了。 下面这视频,你能想象是实时测试出来的效果吗? 比如说,直播间里,家装视频播到卧室,枕头、床单、画和灯光当场换一遍,室内装修直接上一个档次。 这事可不简单。 Seedance 2.5、MiniMax H3这些是 视频生成模型 :从文字或图片出发,造一段视频。 Runway Aleph、VACE做的是 视频编辑 :拿到一段已有视频,按指令改人物、换背景、调风格。 但不管生成还是编辑,这些模型都有一个共同特点——它们是 离线 的。把整段视频吃进去、整段处理完、整段吐出来。 流式视频编辑是第三件事。 它可以实时处理任何一条「活的」视频流上:直播、视频通话、摄像头画面、游戏画面。 JoyAI-Video-Edit不仅是「流式」视频编辑模型,还能实现「实时」视频编辑。 简单说,「流式」决定了模型能不能挂到一条活的视频流上边来边改,「实时」决定了改的速度跟不跟得上播放。两个都得有,缺一个都不行。但在 JoyAI-Video-Edit 之前,这个赛道没有一个够到 24 帧,也就是视频流畅播放的最低门槛。 要「边播边改」,先过两道硬坎 让视频在播放中实时编辑,听起来很炫酷,但技术上得跨过两道门槛。 第一道门槛是速度。 视频这东西,本质就是一帧帧画面按固定节奏刷过去,一般是每秒 24 到 30 帧。模型处理得比播放慢,画面就卡。 JoyAI-Video-Edit 的做法是,画面来一帧就改一帧,改完立刻往外送,不用等后面的画面到齐,也不用提前知道这段视频到底有多长。打个比方,这就像同声传译——听一句翻一句,不用等演讲者把整段讲完。 它的底层架构是一个 MLLM 条件编码器、一个因果视频 VAE,再加上一个 16B 参数的多模态扩散 Transformer,整套系统按自回归扩散编辑器来训练和部署。 160 亿参数的模型,按正常流程跑一帧要反复迭代很多步,离实时差得远。 团队的做法是把这个过程「蒸馏」掉,用一种叫 SA-DMD 的训练方法,让模型从原来的十几步迭代压缩到只走两步就能出图。相当于一个老教授本来每道题都要在草稿纸上演算半天,现在被训练成了看一眼就能报答案的老手。 在单张 Nvidia B200 GPU 上,VAE 编码 22 毫秒、DiT 去噪 185 毫秒、VAE 解码 19 毫秒,整个流程的请求到响应延迟只有 226 毫秒,端到端吞吐量达到 30.1 FPS。 这里有一个值得注意的细节:之前所有流式编辑器都为了跑得快,把模型做小。StreamDiffusionV2 和 LiveEdit 都是 1.3B 参数,SANA-Streaming 是 2B,分辨率也压到 480P。结果是快而废,画面质量拉不上来。 JoyAI-Video-Edit 使用16B 参数,720P 分辨率速度快 1.4 到 2 倍。 第二道门槛是时长。 此前的流式编辑模型基本只能处理几秒钟到一两分钟的片段,越往后画面越容易「漂」。 颜色变了、物体变形了、风格跑偏了。根本原因在于,自回归模型在推理时不断消费自己之前的输出,一点误差经过多轮累积,最后就变成了肉眼可见的崩坏。 而且流式编辑比流式生成更难。流式生成只需要跟自己的历史保持一致,没有标准答案,画歪了也叫创作。流式编辑要同时满足三个互相打架的约束:前面改过的画面不能跟后面打架,改完的结果不能跟原视频长得面目全非,而且同一条编辑指令从头到尾得改得一样。 JoyAI-Video-Edit 技术报告给出的解法叫「有界 KV 状态推理」。说白了就是限制模型的记忆量:让它只记住最近处理过的几段画面,再加上视频开头的第一帧当参照,其他的全部扔掉。这样不管视频播了一分钟还是一小时,模型的计算量和内存占用始终是固定的,不会越跑越慢。 但光限制记忆还不够——记得少就容易忘,忘了就容易画飘。团队在训练阶段专门针对这个问题做了优化:让模型反复练习在「只记一点点」的条件下编辑长视频,直到它学会在有限记忆里也能把画面稳住。 结果就是: 视频可以一直播下去,编辑效果始终稳定。 流式赛道断层领先,追平离线主流 喊「领先」容易,但终究要拿数据说话。研究团队做了两轮对比测试。 短视频评测(OpenVE-Bench): 在这个业界权威的通用视频编辑基准测试中,JoyAI-Video-Edit 的总分达到 3.60,对比流式编辑模型 SANA-Streaming(2.62)、LiveEdit(2.00)、XMax-X2.0(1.87)和 StreamDiffusionV2(1.23),在五个子任务中有四个拿下流式模型第一。 全局风格转换、局部替换、局部删除这几类任务上优势尤其突出,其中局部删除的 4.06 分甚至超过了所有离线模型。 把这组分数放到整个赛道里看会更清楚。此前流式编辑模型的分数区间是 1.23 到 2.62(满分 5),这个区间的含义不是「稍差」,是基本不可用。对比之下,商业闭源的 Runway Aleph 是 3.45,PixVerse V6 是 3.05。 JoyAI-Video-Edit 的 3.60 已经站进了离线商业模型的区间。 一个实时跑的模型,画面质量追上了那些慢慢离线处理的前辈。 长视频评测(LongV2VBench): 团队还专门构建了一个视频编辑任务的基准测试,覆盖背景更换、全局风格、局部添加、局部修改和局部删除五大类场景。 JoyAI-Vid
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱