首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

摘要

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 田, 晏林 2026-09-22 23:59:35 来源: 量子位 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 5天。 不用搭景,不用等演员,导演陆川和团队,直接用AI把一场发生在400年前的明代灾难现场,搓出来了! 宫廷、火药库,还有史料中烟云如...

Qwen3 Happy Qwen Image Audio 量子位 Omni Qwen4 Shrimp HappyOyster
2026-09-23 1 阅读 约9分钟阅读 田, 晏林
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 田, 晏林 2026-09-22 23:59:35 来源: 量子位 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 5天。 不用搭景,不用等演员,导演陆川和团队,直接用AI把一场发生在400年前的明代灾难现场,搓出来了! 宫廷、火药库,还有史料中烟云如黑灵芝的大爆炸。按照传统影视工业的做法,这样的场景复原往往需要数月时间和千万级投入。 但这次,他们 只用了5天! 来,话不多说,先看短片。 「链接」 怎么样?够猛吧? 人物的脸、皮肤、神态已经相当逼真,几个明代人物也不再是过去那种一眼AI的塑料感。 再看爆炸。烟尘、碎片、火光一起往外冲,这种最容易穿帮的复杂场面,也都稳稳接住了。 要按传统影视工业的路子来, 过去光是一场爆炸戏,就要耗费19天。 这次,陆川团队把史料里的文字一点点翻译成现代视觉概念,前后大约做了四轮提示词优化,再参考真实爆炸影像去校准。 最后,阿里视频生成模型对烟尘、碎片这些复杂画面的还原 ,准确度已经达到团队预期的95%以上。 现在的AI已经进化到不只是给导演吐几段素材而已了。 从史料搜集、画面制作到主题讨论,它开始进入完整创作链路;单在视频生成环节,阿里模型的贡献度就超过了一半。 9月22日,在 云栖大会 上,阿里云又来了一波大的,直接把模型家底都端了上来。 先看千问基座模型,架构、自我进化、全模态、参数规模,几乎每一层都在往前推: Qwen3.8-Max 开始自己训练自己, Qwen3.8-Flash 提前放出下一代架构, Qwen3.8-Omni 为大模型开辟全新的思考分区, Qwen4 已经开练, Qwen4.5、Qwen5 也在路上。 而且,参数规模更是直接瞄准 5万亿~10万亿 。 另外,图像生成模型 Qwen-Image-3.1 、音乐生成模型 Happy Shrimp 1.1 、世界模型 HappyOyster 2.0 Preview 、语音模型家族 Qwen-Audio-3.1 、同声传译模型 Qwen3.8-LiveTranslate 也集体亮相。 下一代视频生成模型则预告将于11月发布。 单拎哪个模型出来,都能讲半天。但结合陆川的短片,放在一起看,味道就不一样了。 阿里这一轮全模态升级,已经不太像是在补单项能力。它更在意的, 是这些模型能不能更快进入场景,变成真正的生产力。 阿里的全模态拼图,基本铺齐了 把这次云栖大会的模型更新全部摊开,一张相当完整的全模态地图已经摆在眼前。 文字和通用智能这边,有Qwen3.8,以及已经投入训练的Qwen4。 往外看,图像生成与编辑有Qwen-Image-3.1;视频生成有Wan、Happy Horse系列,以及计划11月发布的下一代视频模型;声音这边是Qwen-Audio-3.1,音乐则交给Happy Shrimp 1.1。 再往真实世界延伸,HappyOyster 2.0 Preview开始处理世界模型和交互环境;Qwen3.8-Omni-Flash把文字、图片、音频、视频放进统一理解框架;Qwen Intelligence继续把Agent能力推向手机终端。 这一串名字看下来,很容易有种新品发布会开到停不下来的感觉。 可把它们塞进一项具体任务里,关系就清楚多了。 拍一条广告,脚本、商品图、人物、口播、音乐,本来就混在一起;做一部电影也一样。 导演给模型的可能是一段文字、一张参考图、一首音乐,最后交付的是一套完整的视听内容。 现实任务天然就是混合模态的。 文字、图像、视频、声音、空间信息往往同时出现,模型最终要处理的,也很少是一种单独的信息。 现实任务不分模态,模型也很难再一项一项地做。 云栖大会现场,阿里巴巴ATH事业群副总裁、淘天集团首席科学家郑波提到: 文本、图像、视频、声音、空间的能力正在加速协同,AI也从生成一张图、一段视频、一首音乐,继续走向理解人的意图,创造完整沉浸式视听体验。 阿里方面判断: 如果语言模型是机器的大脑,多模态模型正在成为机器感知世界、创造内容并与物理世界互动的中枢。 这时候再回头看阿里这一整套模型布局,关系就更清楚了。 Qwen负责语言、知识和推理;Image、Wan、Happy Horse、Audio、Happy Shrimp把能力往视觉、影像、声音和音乐延伸;HappyOyster再往三维空间和交互环境里走。 Omni继续处理不同模态之间的统一理解,Agent则把这些能力接进实际任务。 当这些能力开始被放进同一条任务链里,评价标准也跟着变了。 一张图生成得多漂亮,一段视频有多炸裂,依然重要。到了生产环境里,还会多出一长串更现实的考题。 能不能稳定交付,能不能连续工作,能不能理解同一个任务? 从Demo走进生产线,多模态开始接受真考验 这些问题,只有进了真实工作流才会彻底暴露出来。 第一层:内容生产 这是最成熟的一层,也是视频模型最先撞上的考题。 Wan3.0已经支持单次30秒生成,还能接受文档、表格、网页等结构化输入。 据阿里披露,它曾经在Artificial Analysis的文生视频和视频编辑两项榜单上位列第一。 但到了商业场景,榜单只能算入场券。 比如广告,一条片子里的商品外观、Logo、人物和口播只要有一个漂掉,前面生成得再炫也很难直接交付。 这套更苛刻的指标,同样落在了图像、语音、音乐等其他模态上。 「能不能稳定生产」,已经成为多模态进入生产环境后的核心考题。 不过, Wan3.0已经拿到正向反馈了。 据使用者介绍,Wan3.0已接近真实广告拍摄水平。 第二层:进入专业创作 陆川的《历史·现场》就是一个很典型的样本。 5天重建一场400年前的历史现场很惊艳,但这次尝试更有意思的地方,其实是它把AI带到了创作者真正难啃的位置。 通用模型很容易生成大家熟悉的古装剧质感,真正的历史现场反而需要陌生感,需要更严谨的史料,也需要模型理解导演到底想表达什么。 对此,阿里巴巴视频生成模型技术负责人表示, 未来将与更多导演、行业专家及历史学者合作,为模型引入更全面、更严谨的专业信息。 到了这里,模型面对的已经不只是画面质量,还要开始理解专业知识和创作意图。 音乐创作遇到的则是另一套难题。 9月22日下午,在2026云栖大会的视听分论坛上,太合音乐集团总裁余灏坦言,AI给音乐行业带来的焦虑并不新鲜。 电子合成器、MIDI(乐器数字接口)、DAW(数字音频工作站)都曾经引发过类似担忧,但最后都变成了新的生产工具。 而现在,AI又把音乐创作成本往下压了一大截,普通用户和专业艺人都开始把它当生产力工具。 但音乐一旦进入产业,问题马上变得比「能不能生成一首歌」复杂得多。 训练素材怎么获得,版权怎么算,AI翻唱该不该授权,收益怎么分,这些都绕不过去。 太合和阿里Happy Shrimp的合作,也开始往音乐人共创、产业生态、版权
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱