游戏
morning
决战视频AI:字节快手玩生态,独立厂商拼差异
2026-08-05
1 阅读
约10分钟阅读
财经故事荟
字号:
文 | 财经故事荟 行业独家30s视频原生直出,至高同时参考50个素材/白模和绿幕素材参考能力,误差控制在1s内,这是字节Seedance2.5视频模型的核心能力。 另一边,MiniMax发布的H3模型,将剪辑逻辑、排版、转场、配乐、特效全部端到端集成,成为其首个开源视频模型。 美国那边也很热闹,马斯克与导演诺兰撕起来了!马斯克先挑事儿宣战将在年底前依托自家Grok AI,打造一部历史严谨、忠于原著的AI版长片《奥德赛》,正面踢馆诺兰。 面对马斯克的“跨圈挑衅”,诺兰霸气回怼道,马斯克纯属“无稽之谈。” 隔空互撕背后,暴露出视频AI行业的技术瓶颈与商业化困境。 在海外,Sora、Haiper、Stability AI等一众独立视频AI模型,纷纷陷入业务收缩、产品下线的困境;而国内独立视频AI工具,在真实剧情场景的落地中,还在艰难探路。 当下赛道格局清晰分化: 即梦、可灵等大厂系视频AI工具,背靠字节、快手的海量内容场、资金储备与完整生态闭环,能够依托生态优势摊薄试错成本、放大产品价值。而以海螺AI为代表的一众独立玩家,在巨头强势围剿之下,究竟该如何破局突围? 价值很可观,短板很明显 降低制作门槛、压缩制作周期、拓宽创意上限,是视频AI工具带给创作者最直观的价值。 英国生成式 AI 媒体公司 Synthesia CEO Victor Riparbelli提到:“和传统实拍相比,AI做视频所需成本极低,不用再依赖真人演员、专业拍摄器材、实体影棚,大幅拉低内容制作门槛,让批量产出视频成为可能。” 另据Fortune Business Insights数据显示, 全球视频AI生成工具市场规模将从2025年的7.168亿美元,攀升至2034年的33.5亿美元。 但现阶段,视频AI工具仍存在明显缺陷。我们采用统一宫斗剧情提示词,横向实测三款主流积分制模型:Mini Max旗下海螺AI H3新版、Flova1.0、可灵King3.0。 Flova无法拍出“眼神戏”:贵妃的妒意、嫔位的隐忍不甘以及皇后不动声色的威慑。也就是说,优化工作流能拉高视频基础完成度,但无法补足模型对人物心理、人与人社会关系的深层理解。 海螺AI角色人设错乱:大臣“变”太监;皇后全程双眼紧闭“沦为”背景板,贵妃挑衅、嫔妃对峙时的眼神转动僵硬机械,缺乏真实表演的情绪张力。作为对比,可灵生成的视频能明显区分皇后、贵妃、嫔侍、宫女之间的层级差异。 针对生成能力的差距,来自杭州的AI算法工程师张扬(化名)解释“文本大模型玩的是‘猜字游戏’,不断推算下一个输出Token。而视频则需同时兼顾连续画面帧、人物互动及服化道、剧情因果链,承载的信息量、不确定因素大幅高于文本,生成过程更容易失控。这也是AI漫剧行业催生‘抽卡师’岗位的原因:从反复生成的素材中,挑选最优镜头与人物。可灵、即梦背靠字节和快手的内容优势,在针对中文内容、古装题材和人物关系,能进行更充分的训练与产品调优,这也是可灵表现相对更好的原因。” 张扬也指出,短剧、广告、影视剧题材覆盖范围极广,进一步放大了视频AI生成的不可控问题。写实类剧情对模型要求更高,不能仅追求画面“好看”,还需遵循人物礼制、道具常识、动作逻辑与大众认知。AI虽具备自由创作空间,但商用成片需要贴合现实规则。 张扬所说的问题,在小众专业场景表现得尤其突出,且独立和大厂视频AI工具均面临类似问题。 我们以盗墓题材为例,要求生成二十四山专业罗盘。然而,海螺AI、Flova、可灵AI均未正确还原罗盘样貌。就算反复调整提示词继续重试,海螺AI甚至出现离谱画面:罗盘“变”盾牌。 当然,大厂能凭借资金、算力、内容优势,未来或许可以通过收录实拍视频、专业器物资料、标准操作流程数据,持续缩小“数据幻觉”;然而,“见过样本”不等于“真正理解原理”。 腾讯视频上线的AI精品短剧《北派笔记》,其创作团队针对AI把“洛阳铲”生成普通铁锹,通过提供给AI准确的“洛阳铲”参考图,但一旦人物做出挖掘动作,画面里铲下去的是洛阳铲,拔出来时却变成普通铁锹。 这意味着模型不仅要保证真实还原,更要保证连续画面不变形、人物操作符合常识。想要实现这一点,仍需要专业垂直数据集、结构性约束、生成后人工质检等多重手段配合。《北派笔记》创作团队为了让AI理解“洛阳铲”,团队单独采风、搜集资料、建立标准,并进行针对性的模型训练和资产制作。 相比头部平台,独立厂商面临的短板不止于资金,更缺少完整的真实数据反馈闭环。用户使用即梦、可灵创造的视频AI、AI漫剧,字节、快手能够追踪整条链路数据:用户最终选用哪一段视频、如何剪辑、是否正式发布、成片完播率、转化效果等指标全部可追溯。这种真实数据反映,有助于持续优化模型;同时,其内容、广告和生态业务也能分摊反复生成带来的试错成本。 作为对比,大多数独立AI工具,只能看到用户输入了什么、生成了多少次,无从判断到底是人物崩坏、道具出错、剧情违和、审美问题导致成片作废,且如何衡量用户生成的视频真实播放量到底是多少。这意味着独立厂商既要追赶模型效果,又要承担失败生成造成的算力消耗和用户流失。 避开大厂锋芒,同向不同路 面对与大厂竞争的劣势,当前国内独立视频AI模型厂商走出五条差异化突围路线。 一是以海螺AI为代表的路线:打造通用多模态基座,面向全球市场推出订阅服务,同时开放API对外合作。 其中,海螺AI持续布局海外生态,先后接入VEED、Envato Video Gen等海外创作平台。 在张扬看来,海螺AI模式为典型的“发动机模式”:搭载自家C端产品“卖整车”,对外输出API能力“卖配件。”想要摊平高昂的研发、算力成本,就要扩大模型调用规模,分摊前期硬件与训练投入,积累真实场景数据迭代优化,构筑性价比优势。但过硬的底层模型,不等于稳定交付成片。一旦出现人物关系错乱、道具失真、剧情衔接断裂等问题,都会转化为合作方的返工成本。 Mini Max招股书显示,截至2025年9月30日,海螺AI累计用户4234.8万,创造收入1746.4万美元。 二是以Flova为代表,搭建项目资产体系、多模型调度能力与一体化AI创作工作台。 张扬解释,制作视频通常需要联动文生图、视频生成、配音等多种模型,而Flovsa相当于一名“AI总导演”,聚合工具到统一工作台,项目内角色、造型素材一次设定、持续复用。这套方案运行成本更低、素材复用效率更高,但短板突出:某个模型输出不稳定,即便有“总导演”统筹,也难以保障镜头准确率。 今年7月,Flova母公司雨舟科技获得红杉中国、IDG资本、云九资本合计超8000万美元融资。 三是以Vidu为代表,聚焦人物与场景一致性、连续化内容生产,配套完整创作工作流。 漫剧、系列长视频创作中,角色形象前后不一、频繁“变脸”是致命缺陷。而Vidu的核心价值是,角色、场景设定一次完成后可以反复调用,不用每段素材都从头反复“抽卡”。 Vidu母公司生数科技披露,2025年实现用户和收入超10倍增长,印证市场对连续内容生产工具的旺盛需求。但我们实测Vidu Q3模型发现,视频画面观感精致,却存在明显漏洞:片段前半段女主没有围巾,后半段凭空多出一条厚重黑色围巾;人物相互靠近时生硬平移,观感近似统一角色设定的静态剧照拼接。这暴露出Vidu产品的
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱