智能AI
morning
阿里视频大模型Wan3.0开启公测:文档、ppt也能变视频
2026-08-07
1 阅读
约3分钟阅读
量子位的朋友们
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里视频大模型Wan3.0开启公测:文档、ppt也能变视频 量子位的朋友们 2026-08-07 11:23:54 来源: 量子位 8月6日,阿里巴巴视频生成大模型Wan 3.0开启公测 8月6日,阿里巴巴视频生成大模型Wan 3.0开启公测,在生成时长、万能创作、全能参考以及真实世界还原等维度全面升级:单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入;力求准确还原真实世界——人物千人千面,每一帧画面既真实、又可信。 生成时长的延展是Wan3.0最直观的升级。单段30秒生成让叙事节奏更游刃有余,连续运镜、一镜到底等复杂镜头语言得以充分表达,AI视频从“生成一个镜头”走向“讲述一段完整的故事”。Wan3.0还有智能时长功能,可根据提示词自动推荐合适时长。 Wan3.0正从视频生成模型跃迁为信息的表达载体,不仅能以文本、图片、音频、视频作为全能参考,还能读取文档、ppt等结构化信息,搭配提示词即可生成教学课件、产品演示、业务汇报等内容。支持格式覆盖doc、xls、ppt、pdf、md等,单个文件或链接不超过100MB、50页。比如上传一个智能眼镜产品的ppt,配上提示词,就能得到一个完整的形象片。 这背后,是模型强大的提示词工程与指令遵循能力,将提示词转化为调度输入、控制表达的中枢。 视频生成模型正从内容生成升级为生产力工具,用户对画面的要求不止于清晰,更要真实。无论是现实场景还是数字化信息,Wan3.0都力求精准地复刻与呈现。生成视频中的人像力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动。全能参考任务中,角色、道具、声音、空间关系、风格等细粒度维度均可稳定保持。数字化信息的画面审美也同步提升,让图表、数据与界面内容同样拥有质感。 此外,Wan3.0的视频编辑能力也有大幅提升,支持修改画面、剧情与台词。Wan3.0在声音质感与文字准确度方面仍有进步空间。 即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网、千问创作PC端、IF STUDIO和堆友开启公测,在千问APP灰度开放。480P/720P/1080P的API价格分别为0.3/0.6/1.2 元/秒,API接口将于近期全量开放。 本文由阿里云提供,量子位获授权转载,观点归原作者所有。 版权所有,未经授权不得以任何形式转载及使用,违者必究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱