智能AI
morning
100%纯血国产AI反超Suno!一个下午做出百万预算主题曲
摘要
新智元报道 日产7.5万首,播放却不到3%。 这是流媒体平台Deezer最新披露的一组数据。AI歌曲每天涌入平台的速度,从2025年初的1万首飙升到如今的7.5万首,占当日新增上传的44%。但实际播放占比,只有1%-3%。 产能炸了,产品却过不了人耳这一关。 尤其是在中文世界,这个矛盾更加尖锐。全球最顶级的AI音乐公司Suno,估值54亿美元,做英文歌确实能打。 但做中文歌?也很抱歉。 咬字发飘、...
共创未来
5万首
咬字发飘
2025年
For
Good
音潮大模型V4
指令理解
情绪落地
新智元报道
2026-08-17
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 日产7.5万首,播放却不到3%。 这是流媒体平台Deezer最新披露的一组数据。AI歌曲每天涌入平台的速度,从2025年初的1万首飙升到如今的7.5万首,占当日新增上传的44%。但实际播放占比,只有1%-3%。 产能炸了,产品却过不了人耳这一关。 尤其是在中文世界,这个矛盾更加尖锐。全球最顶级的AI音乐公司Suno,估值54亿美元,做英文歌确实能打。 但做中文歌?也很抱歉。 咬字发飘、情绪悬浮、转音别扭,用户甚至总结出了一套绕路技巧,把复杂中文字换成拼音,才能让模型生成出勉强准确的发音。 我们的母语,反而成了AI音乐最不擅长的语言。 这背后不是模型「调得不够好」,而是一道架构题。 为什么中文歌这么难? 英语是重音节奏语言。一个单词的重音往哪砸,节奏就跟着走。Be-YOU-ti-ful,重音在第二个音节,整句话的韵律就围绕这个重心展开。 中文是声调语言。一个「妈」和一个「马」,音高走势完全不同。字音对齐、音节边界、声调在连续语流里的变化,跟英语根本不是一套系统。 当前绝大多数通用音乐模型,底座都建立在英语语料体系之上。它们理解不了中文里那些微妙的声调变化、气声控制和语感节奏。这不是多加几轮微调就能补齐的表层问题,而是从训练数据到模型架构到优化目标,整个链路都需要重新设计。 于是,一条路摆在面前: 要么在英语底座上继续打补丁,永远差着那种味道。要么从底层重新训练,把中文语境的「味道」写进模型骨子里。 音潮团队选了后者。 连续两年WAIC主题曲,不是运气 在拆解音潮大模型之前,先说件更能说明问题的事。 2025年和2026年,WAIC世界人工智能大会的官方主题曲,都出自它之手。2025年《AI For Good》,2026年《共创未来》,全程靠自研的音潮大模型独立完成词曲、编曲、演唱全流程创作。 WAIC的官方主题曲筛选相当严格,每年竞标团队卧虎藏龙。能中选一次已经是实力证明,连续两年卫冕,含金量不必多说。 2025年《AI For Good》刚出来的时候,就打破了不少人的刻板印象。以往科技向配乐,大多逃不开厚重宏大、迷幻电子的套路,冰冷、严肃、距离感十足。但这首纯AI制作的曲子,走的是清爽青春路线,温柔又有力量,也让业内第一次注意到:国产AI音乐,也能兼顾科技感和人情味。 时隔一年,迭代升级后的音潮大模型带来的《共创未来》,进步更是肉眼可见。曲风上刻意避开了科技展会的流水线配乐风格,选择了阳光朝气的科技流行摇滚。最加分的是它的双语设计,中文侧重温情、坚守与陪伴,细腻接地气。 英文聚焦探索、突破、全球连接,格局拉得很开。 两种语言衔接自然,又不割裂,既悄悄秀了把自家模型的能力,又藏着「科技无国界」的内核,适配WAIC的全球舞台,细节处理相当成熟。 但真正让圈内人坐直的,不是歌曲本身,而是它背后的制作方式。 传统模式,顶级行业盛会的官方主题曲,整套流程走下来至少两三个月,百万级预算是常态。一旦甲方不满意需要推翻调整,返工成本高到离谱,容错率极低。 音潮团队用模型能力,直接把这套传统流程压缩到了一个下午。依托音潮大模型的批量创作能力,团队根据WAIC的大会主题、风格调性和核心诉求,批量生成上百首高质量原创备选曲目,然后优中选优、逐句精雕细琢,最终敲定《共创未来》。 周期、成本、创意上限,三重维度全面突破。 音潮大模型V4.0,从底层开始重构 8月14日,音潮大模型V4.0正式发布。 先说结论: 这不是一次版本微调,而是底层架构的全方位重构。V3.5到V4.0的跨越,不是在旧模型上打补丁,而是从底座重新训练。 核心变化集中在三个维度,指令理解、情绪落地、曲风细分。 这三个词听起来像产品功能,实际上是三个完全不同层级的技术挑战。 第一层:指令理解,从「猜你想要」到「懂你所想」 日常创作中,人们输入的提示词大多是碎片化、口语化、带情绪的,「想写一首深夜emo的歌」「要那种慵懒的调调」「来点治愈的」。旧版模型很容易机械套用参数,无法结合上下文融会贯通,最终成品自然偏离预期。 V4.0做的,是把这种「模糊的、感性的」输入,翻译成模型能精准执行的内部表征。不再机械执行你的文字,而是真正读懂文字背后的画面与情绪。 实测对比最直观。用中文提示词测试:「一首深夜emo的中文歌,慵懒女声,带点爵士味道,想那种雨夜一个人走在街上的感觉」。 V3.5勉强识别出「伤感」的基调,但人声生硬、咬字发飘,慵懒和爵士几乎没体现,情绪和曲风完全脱节。也就是大家常吐槽的「差一口气」。 V4.0精准锁定了「深夜、emo、慵懒、爵士」四个核心关键词,女声气息绵长、咬字细腻,爵士钢琴的即兴感自然铺开,「雨夜独走」的画面感被完整翻译成了声音。 两代模型之间的差距不是「好一点」,而是跨越式的。 第二层:情绪落地,伤感不是一种参数 同一句歌词,伤感和热血,气息、力度、音色完全不同。 想要区分开来,模型就得真正理解「情绪」在音乐里怎么运作。这不是一个参数够不够大的问题,是模型能不能理解一种文化里的情绪逻辑、能不能对齐一群人的审美偏好的问题。 这恰恰是海外模型的结构性盲区。Suno的英文歌情绪表达可以做到细腻,但中文歌的「味道」只能说一言难尽,它理解不了那种细腻的咬字、绵长的气声、情绪在字里行间的流转。说白了,因为它的训练数据里没有足够多的中文语境。 音潮从第一天就把中文语境作为核心优化目标,V4.0的底层重构让这种优化不再是「修修补补」,而是从模型架构层面就针对中文的声调、语感、气声做了专门设计。 实测对比更能说明问题。同一个中文提示词,V3.5生成的歌声咬字僵硬、气声断续,情绪像是贴上去的;V4.0的咬字和气息自然流畅,情绪在字里行间流转,听着像「从里面长出来的」。区别不在音质,在活人感。 第三层:曲风细分,不只「蓝调」这么简单 「蓝调」这个词,在AI音乐里其实有着非常具体的含义差异。 V3.5输出的蓝调偏向大众化流水线风格,没有凸显曲风特色。V4.0精准还原了经典十二小节正统布鲁斯结构,完美适配慵懒松弛的人声质感,风格纯度和细节把控远超旧版。 当提示中出现多种乐器时,差距更明显。「一首忧郁、感性、温暖的韩国流行歌曲,融合原声吉他、电钢琴与大提琴」,V3.5中,原声吉他、大提琴这些核心配器被严重弱化,乐器层次模糊。V4.0精准拿捏每一种乐器的音色特质,吉他的温润、大提琴的深情清晰突出,多乐器融合自然和谐。 三层跃迁叠加,V4.0不再是一个更好的AI音乐工具,而是一个懂音乐的AI。 算力国产化,走通了一条无人经过的路 技术实力和落地成果是硬通货。 但音潮团队有一条更深层的差异化路线,算法和算力的双重国产化。 音潮大模型全程依托壁仞国产GPU完成训练与迭代,彻底摆脱了对海外算力的依赖。 这件事的意义,远不止于情怀。 当前,算力供应链的稳定性已经成为所有AI公司必须面对的现实问题。一家AI公司如果从训练到推理都依赖海外GPU,那它的技术路线、迭代节奏甚至产品定价,都存在风险。 音潮团队从第一天起就选择了国产算力,这意味着它对技术路线的掌控力更强,迭代节奏不受制于人,长期成本也更可控。 更重要的是,在国产GPU上训练出能够对标Suno的模型,本身就是对国产算力可用性的一次验证。放眼整个AI音乐赛道,能做到算法+算力双重国产化的,目前只有音潮大
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱