首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」

2026-09-01 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|Panda 8 月 24 日,阿里的 Wan 3.0 视频生成模型在千问创作 PC 端和千问 App 正式上线。同期出现在千问创作里的还有 Ag ent Teams 创作模式:用户提一个想法,一组分别扮演编剧、导演、美术、分镜师、配乐师的 Agent 自动组队,接力把它做成影视作品。 承载这两者的「 千问创作 」是千问近期上线的 AI 创作平台。它的定位是面向专业创作者的创意平台: Wan 3.0 及其满血的 Prime 版 在这里全网首发,Prime 版生成更快、效果也更进一步;视频模型外,平台还汇集了 Qwen-Image-3.0 等阿里顶尖模型,视听两端的素材都能就地解决。产品侧则提供画布工作流与多种专业 Agent,AI 短剧、漫剧、营销广告、图像设计可以在同一个工作台里一站式完成。 是的,千问创作把模型、素材和流程装进同一个工作台。单看 Wan 3.0,这是一次模型升级,单段直出 30 秒、多模态参考、更低的单秒价格。单看多 Agent 协作,这是 Agent 范式在又一个场景里的延伸。两者相加,意义却非同寻常。 因为对专业内容生产来说,眼下卡住效率的环节,已经不是单条视频的质量了。卡脖子的是 搬运 。 做过 AI 短剧的人大概都熟悉这套流程:一部三分钟的短剧拆成三四十个镜头,剧本在聊天窗口里写,角色四视图在生图工具里抽卡,分镜表落在表格里,再逐条把镜头描述翻译成提示词喂进视频模型;回来发现某个镜头中角色换了张脸,就得回上游改参考图,把下游重跑一遍。配音配乐在另外两个软件里,最后还要进剪辑软件对时间线。AI 在这里承担的是一个个孤立的工位,把工位串起来的人干的其实是 制片主任 的活。生成不难, 难的是让几十次生成之间保持连续性 。 AI 短剧制作流程 这几年视频模型的能力提升很快,时长、画质、音画同步、角色一致性几乎每个季度都在刷新,但能力上限的提高并没有等比例地转化成生产效率。要完成一部短剧,还需要剧本结构、角色设定、分镜规划、跨集统筹和后期剪辑,这些工作量不随模型变强而消失,反而因为生成变便宜、可选项变多,管理成本还上升了。 行业已经意识到了这一点,昆仑万维和字节跳动都在做这方面的平台。整体来看,竞争的重心正在转向,目标正转向「把一次完整的内容生产组织起来」。千问创作这次 把自研视频模型、自研图像模型和 Agent 编排装进同一个产品 ,是这条路线的一个最新样本。 千问创作手机 App 端入口及演示 demo Wan 3.0:先把单镜头的上限抬高 要实现有效的多 Agent 协作,前提是每个工位的产出质量足够高。否则再精巧的分工,也只是把废片的产生速度提高了。 视频生成方面,千问创作接入了 Wan 3.0 视频生成模型及其 Prime 版 ,而 Wan 3.0 这一代的升级方向,目标就是要让生成结果可以直接使用。 上下滑动查看 首先是 时长 。单段最长 30 秒,意味着一次人物出场、一轮完整冲突或一段产品演示可以放在同一个镜头序列里生成,而不必用多个 10 秒片段来回拼接。须知,拼接是一致性问题的主要来源之一:换脸、道具漂移、环境音断裂、情绪重启,大多发生在接缝处。因此,时长的一大核心价值就是把接缝的数量降下来。 其次是 参考的丰富度 。除文本、图片、音频、视频四种基础模态外, 还支持 doc、xls、ppt、pdf、md 等文档格式输入,也支持网页链接。这一条在专业场景里的意义很大:广告片有品牌视觉规范文档,科普片有原始论文或 PDF,企业宣传片有产品手册。能直接读这些材料,等于把「人工把需求写成提示词」这一步省掉了一部分。 第三是 一致性与镜头语言 。Wan 3.0 在角色长相、场景布局、服装道具、声音和画面风格等维度支持像素级控制,可复刻参考资产,并能驾驭推、拉、摇、移等镜头运动,通过镜头切换和蒙太奇推进剧情。在第三方创作者的公开测试里,20 至 30 秒的短剧片段确实能在特写、全景、肩后镜头之间切换而不崩人物,暗场和大幅运动下的服装、站位也基本稳定。 Wan 3.0 的价格也极具竞争力。Wan 3.0 的 API 标价为 480P/720P/1080P 分别 0.3/0.6/1.2 元每秒;据千问方面提供的信息, 会员限时 4 折起,720P 单秒低至 0.26 元 。对需要靠量取胜的短剧、漫剧和信息流广告来说,单秒成本直接决定了废片可以承受多少次。 关于 Wan 3.0 的更多介绍可以观看我们之前制作的实测视频: 图像侧的搭档是 7 月 21 日发布的 Qwen-Image-3.0 ,支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂 UI 界面,并支持 12 国语言和 20 多款字体原生渲染。其提示词长度较前代提升了 4.5 倍,其一大重要应用场景正是影视短剧分镜:创作者可以像写需求文档一样完整描述画面结构、文字内容和排版细节。 当然,你也可以选择满血版 Qwen-Image 3.0 Pro ,生成效果更佳。 对视频流程来说,这一条很关键。角色视图、场景参考图、道具图、分镜草图,这些都是视频生成之前必须先固定下来的资产。图片模型的可控性越高,视频阶段的抽卡次数就越少。 Agent Teams:从「写提示词」到「派活」 Agent Teams 要解决的是前面那个搬运问题。 它的交互起点只需一句自然语言。用户提出创作想法,系统自主拆解任务,把不同环节分派给承担导演、编剧、视觉设计、分镜师等角色的子 Agent,围绕剧情、人物、视觉风格和镜头表达展开协作。 上下滑动查看,千问创作的「人才市场」已经预置了 59 个 Agent,包含不同风格的导演、美术、编剧、歌手等,用户也可以根据需求自行创建新的 Agent 千问创作把这称为「 自 动 组队 」。后续的创意策划、脚本撰写、角色设定、分镜设计、画面生成、配音配乐直到成片制作,由这组 Agent 接力完成,用户可以在对话框里介入,修改创作方向。 网页链接和文档可以直接作为参考进入项目,当前附件支持 PDF、Word、TXT、Markdown 和 Excel 等。产品形态上,千问 PC 端和移动 App 端均提供了直达入口,Web 端也可通过 c.qianwen.com 直达。各端创作资产和项目互通,可以中途换设备继续。 实测:我们做了一部「JoJo 的奇幻买瓜」 我们给出的需求非常简单:一段「华强买瓜」的文字剧本,外加一句提示词:「将这个剧本做成视频,视频风格参考《JoJo 的奇妙冒险》」。没有分镜,没有角色设定,没有画幅要求,就是一个普通用户提需求的样子。 千问创作 Agent Teams 接手后的第一件事是派出创作助手,而这个助手先做了一轮任务分析,然后抛出了一个问题:视频要什么画幅比例?这恰好是我们在提示词里疏忽的参数。把「需求补全」放在任务拆解之前,比拿着残缺的需求一路跑到底要省事得多。 确认之后,创作助手把任务做了更细一层的拆解,并给出一份组队方案。这部片子需要四个工位:导演、插画师、视频师、剪辑师。 再次确认后,四个 Agent 正式加入项目。到这一步为止,我们输入的全部内容,仍然只有最开始那段剧本和一句话。 接下来是各司其职的接力。第一棒
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱