关于ZAKER Skills GEO服务 合作
传媒1号 08-26

AI 音频四大战场,谁在赚钱?

作者|葛缦

不知道你有没有听过下面这句 BGM:

「啊 ~ 啊 ~ 啊 ~

Oh my god 你吓到我啦~」

前段时间,这句魔性洗脑的旋律在各大社交平台刷屏。

它出自博主 Papi 酱发布的短视频《生气了》,从作曲到演唱,全部是由 AI 完成的。

不知不觉间,用 AI 写歌,正在变得像码字一样简单。

但如果我们把视野稍微拉远,就会发现,这种「音乐生成」其实只是 AI 音频赛道里的冰山一角。

具体来说,今天的 AI 音频产业大致可以划分为下面四层:

目前不同环节都已经跑出了各自的头部玩家,也开始摸索不同的商业化路径——

内容生产层

告别「玩具时代」,创作入口开始成为生意

最先被大众看见、也是目前最热闹的,无疑是内容生产层。

两三年前,AI 音乐还多少带着一点「科技玩具」的意味。输入一句提示词,听听 AI 能写出什么歌,新鲜感大于实用性。但现在,行业的追求早已从「生成一首完整的歌」,变成了能不能持续地留住内容创作者。

海外的 Suno 和 Udio 最早把这场竞争推向大众市场。其中,Suno 在今年 6 月完成超 4 亿美元 D 轮融资,估值达到 54 亿美元。截至今年 2 月,其累计用户已突破 1 亿、付费用户达到 200 万,ARR 达到 3 亿美元。

国内玩家也在快速跟进。比较有代表性的,包括趣丸科技旗下的天谱乐和 Tunee、昆仑万维推出的 Mureka 以及 MiniMax 旗下的 Music 系列模型。

趣丸科技走的是一条相对完整的「模型 + 产品」路线。

2024 年,它推出天谱乐音乐大模型。2025 年,又上线了对话式音乐创作智能体 Tunee。与早期需要用户反复填写提示词的 AI 作曲工具不同,Tunee 希望把写歌变得更像「聊天」。用户只需要告诉 AI 自己想要什么主题、什么情绪、什么风格,它就可以进一步完成歌词、旋律、编曲和演唱。截至 2026 年 5 月,天谱乐官网及 Tunee 累计全球用户已经超过 6200 万,AI 歌曲创作量突破 3500 万首。

随着用户规模不断起量,趣丸又开始往更专业的创作环节深入。今年 7 月推出的天谱乐 V4.7,不再满足于「一键生成一首歌」,而是加入 Remix、Cover 等修改能力,同时通过 OpenAPI 向企业和开发者开放。

昆仑万维则押注了另一种可能:AI 音乐不只要成为创作工具,还要成为内容平台。

它旗下的 Mureka,同样可以理解成一个 AI 音乐创作平台。普通人只要输入歌词、主题或者音乐风格,就能生成完整歌曲。但昆仑万维并不想让 Mureka 只停留在「写完一首歌」的工具阶段,而是希望把它做成「AI 版 Spotify」。因此,它增加了流式听歌和个性化推荐,希望让用户既能「做歌」,也能「听歌」,最终形成一个从生成、发布到消费的 UGC 闭环。

至于 MiniMax,它的切入方式更偏底层。

MiniMax 本身是一家通用大模型公司,音乐并不是它唯一的业务。旗下的Music 系列模型,更像是它提供的一项 AI 能力。除了普通用户可以拿来生成歌曲之外,开发者、游戏公司、广告公司等也可以通过 API,把音乐生成能力接进自己的产品里。

今年 8 月推出的Music 3.0,把这条路线又往前推了一步。新模型不仅能一次生成最长 5 分钟的完整歌曲,在长歌曲结构、人声和乐器表现上进一步提升,还直接开放了模型权重。

声音资产层:

「人声」本身开始成为生产资料

相比 AI 音乐的「先声夺人」,声音资产层更像是在「闷声发大财」。

它很少以爆款应用的姿态出现在大众面前,但在短视频配音、有声书、游戏、影视出海、AI Agent 等场景里,AI 生成的声音早已悄悄成为一项高频调用的基础能力。

更重要的是,这一层的付费逻辑也更加直接:有人需要声音,就有人愿意为声音付钱。

海外最典型的玩家是ElevenLabs。这家成立于 2022 年的 AI 语音公司,最初因为逼真的文本转语音和声音克隆走红,后来迅速把业务扩展到影视配音、有声内容、游戏以及企业 Voice Agent 等场景。2025 年底,ElevenLabs 的年度经常性收入(ARR)已经超过 3.3 亿美元;今年 2 月又完成 5 亿美元 D 轮融资,估值达到 110 亿美元。

而在中国创业者主导的玩家中,最近最受资本关注的一个名字,是Fish Audio。

Fish Audio 最早其实只是一个个人项目。联合创始人廖世佳此前曾在英伟达从事研究工作,因为觉得当时的合成语音「太像机器」,便用一张 RTX 4090 训练出了自己的语音生成模型,并将 Fish Speech 开源。随后,这个项目逐渐从开发者社区走向商业化,最终变成一家专门做 AI 语音的平台。

普通用户在 Fish Audio 上,可以输入一段文字让 AI 用不同声音读出来,也可以上传自己的声音进行克隆。而对于企业来说,它提供的则是另一套生意——通过 API,把这些语音能力直接接进数字人、游戏角色、客服、销售电话乃至 AI Agent 之中。

这条商业路径已经表现出了相当惊人的效率。上线一年左右,Fish Audio 的开源及平台用户已经超过 800 万,ARR 达到 2100 万美元。今年 7 月,公司又完成了 5200 万美元种子轮融资。

Fish Audio 证明了一件事:当「声音」可以像云计算一样按需调用,它本身就可以成为一项基础设施。个人创作者按月订阅,开发者按调用量付费,大企业再为稳定性、低延迟和定制能力支付更高价格,一套相对清晰的商业模式也就此形成。

与之相比,另一家中国 AI 音频创业公司 Noiz AI,走的则是一条更偏「创作工具」的路线。

Noiz AI 背后的深圳声音动力成立于 2025 年。最早,它同样从语音克隆和语音生成切入,但后来逐渐发现,创作者真正需要的并不只是「把这句话念出来」,而是要让声音符合具体人物、情绪和场景。因此,Noiz 不断加入情绪控制、多语言配音、音效和编辑等能力,希望把一个简单的 AI 配音工具,变成完整的 AI 音频工作台。

这家公司也是今年资本市场上增长较快的新玩家之一。今年 8 月,Noiz AI 又完成了数千万元的新一轮融资。公开报道显示,其全球用户已经突破 200 万,ARR 达到百万美元级。

除此之外,还有一批玩家选择继续向更专业的声音场景深挖。比如北京时域科技推出的 ACE Studio,主要面向音乐制作人。创作者给出歌词和旋律,AI 就可以直接生成接近真人演唱的人声。目前 ACE Studio 已经从单一的歌声合成工具,扩展成包含声音克隆、AI 歌手、AI 乐器等能力的一站式音乐工作站。

交互体验层:

从「生成一段声音」到「用声音完成服务」

交互体验层做的事,其实更智能,也更有意思。

AI 音乐、AI 配音,本质上还是「你给它一个任务,它生成一段内容」。但到了交互这一层,AI 开始真正和人「聊起来」了。

而且这种「聊」明显区别于传统意义的语音交互。

过去我们熟悉的 Siri、智能音箱,本质上更像一个「语音版搜索框」。你说一句,它识别成文字,找到答案,再把文字转换成声音念给你。整个过程不仅有明显的等待感,对话也很机械,更谈不上察言观色。

而这一轮 AI 语音模型想做的,是把这种「一问一答」变成真正的实时对话。AI 不仅能听懂你说了什么,还要听懂你的语气、情绪和停顿。你可以随时插话、打断,它也能接着聊下去。

这种「实时对话」的名头看似花样繁多,但无论是陪伴、翻译、客服、智能座舱,甚至未来各种 Voice Agent,背后争夺的其实都是同一个东西:谁能成为人与 AI 最自然的沟通入口。

这个层面,海外已经打得相当热闹。OpenAI 把实时语音能力放进 ChatGPT,Google 则用 Gemini Live 持续推进自然语音交互,法国 AI 实验室 Kyutai 也曾凭借 Moshi 这样的实时语音模型引发关注。

国内同样跑出了一批有代表性的玩家,而且每个玩家的切入点都不太一样。

MiniMax 最早押中的,是 AI 陪伴。

很多普通用户第一次接触 MiniMax,可能并不是通过它的大模型,而是通过海外产品Talkie和国内的星野。这类产品让用户创造或者选择一个虚拟角色,然后和它聊天、培养关系。而声音,正是让这种「关系感」更真实的重要一环。

目前这条路线已经展现出了相当可观的用户规模。MiniMax 招股书显示,2025 年前 9 个月,Talkie 和星野的平均月活跃用户达到约 2005 万。2025 年,MiniMax 整体营收达到 7900 万美元,同比增长 158.9%,其中 AI 原生产品收入达到 5310 万美元;其主要变现方式包括订阅、应用内付费和广告。虽然公司并未单独披露 Talkie 的收入,但 AI 陪伴显然已经证明:只要用户愿意长期和 AI「聊下去」,语音交互就有机会变成一门持续付费的生意。

阶跃星辰则更偏向另一条路线:先把「会聊天」的能力做成底层模型,再把它装进更多产品。

它推出的Step-Audio 2,直接把听懂声音、理解内容、思考和语音生成放进了同一个模型里。比如用户直接开口询问,它可以一边理解语气和声音中的信息,一边完成推理,再直接用语音回答,还可以处理实时翻译和工具调用等任务。

今年 1 月,阶跃星辰完成了超过 50 亿元人民币的 B+ 轮融资,资金将继续用于基础模型研发和「AI+ 终端」战略。更值得注意的是,它的模型已经进入荣耀、OPPO、中兴等厂商的终端产品。换句话说,阶跃星辰想做的并不只是一个语音 App,而是让自己的语音交互能力成为手机、汽车乃至更多智能设备背后的技术底座。

字节跳动则依靠豆包,把实时语音直接推到了大众用户面前。

2025 年,豆包上线端到端实时语音模型,让用户可以直接「开口聊」。到了今年 4 月,字节又发布全双工语音模型 Seeduplex。所谓「全双工」,就是 AI 终于可以像人一样,一边说、一边听。过去你往往得等 AI 把一句话讲完才能接话,现在它可以判断什么时候该继续说、什么时候该停下来听你,也能更好地区分真正的用户插话和周围的环境噪音。

这一切,看起来只是交互体验上的一点变化,背后的商业空间却很大。因为当 AI 真正拥有一张能自然交流的「嘴」,它可以进入的就不只是聊天软件。AI 陪伴需要它,客服和销售需要它,实时翻译需要它,智能座舱需要它,未来越来越多的 AI Agent 同样需要它。

相应地,这一层也逐渐形成了两条清晰的赚钱路径:C 端通过会员订阅、应用内付费等方式,为「更好的陪伴和交互体验」买单;B 端则通过 API 和企业解决方案,为客服、营销、翻译以及各种 Voice Agent 提供语音能力。

终端载体层:

走出 App 后,下一战是「谁将占据耳朵」

终端载体层做的事更直接——就是把前面那些 AI 音频能力,真正装进我们每天会用到的设备里。

过去,AI 音乐也好、语音助手也好,大多还停留在手机和电脑里的一个 App。但现在,耳机、眼镜、汽车、音箱,甚至乐器本身,都开始直接承载 AI 能力。

海外已经有不少成熟样本。比如Ray-Ban Meta 智能眼镜,用户可以直接通过语音唤醒 Meta AI,听音乐、接打电话、识别歌曲、实时翻译,甚至连续追问。

国内也在沿着类似方向推进。

字节跳动推出的 Ola Friend,就是一个比较典型的例子。它相当于把 AI 助手豆包塞进了耳机,用户可以直接通过语音获取信息、聊天、使用 AI 能力。

而在 AI 音乐这个更垂直的方向上,趣丸科技更大胆,也更有意思。

它推出的TemPolor Melo-D,被定义为「生成式 AI 吉他」。它和传统智能乐器不太一样,不只是把琴谱、课程或者伴奏搬到屏幕上,更是把 AI 创作能力直接放进了乐器里。用户可以从一段哼唱、一个情绪甚至一首已有歌曲出发,由 AI 生成可以继续演奏的内容。与此同时,它还支持 AI Jam、Hum-to-Solo 等功能,让不会专业作曲的人,也可以直接参与到音乐创作和演奏里。

1 号结语

综合来看,四个板块目前已经走出了各自不同的节奏——

内容生产层最热,也最拥挤。AI 写歌已经率先完成用户教育,Suno 这样的头部产品也证明了订阅模式可以跑通。但门槛下降得越快,产品之间也越容易趋同。接下来真正稀缺的,是谁能留住创作者、做出平台和生态。

声音资产层,是目前变现路径最清晰的一层。 ElevenLabs、Fish Audio 已经跑出了相当清晰的收入模型。配音、游戏、有声书、出海内容、Agent,都需要持续调用声音,这让 API 和企业服务天然具备更直接的付费基础。

交互体验层的想象空间最大,也是最明显的兵家必争之地。因为一旦语音真正成为人和 AI 交流的主要方式,它背后连接的就不只是一个产品,而是陪伴、客服、汽车、智能终端乃至整个 Agent 生态。今天巨头争的「实时语音」,本质上是在争下一代人机交互入口。

至于终端载体层,现在还远没有到分胜负的时候。AI 耳机、眼镜、汽车、乐器都还在寻找真正的爆款,但它的重要性恰恰在于:对消费级 AI 来说,前面的模型和服务,最终还是要落到一个具体的用户入口上。

所以再回头看下面这张版图,会发现 AI 音频真正的竞争才刚刚开始。

参考资料:

https://suno.com/blog/series-d-announcement

https://www.tmtpost.com/agent/ai-article/19161

https://quwangroup.com/about

https://www.tmtpost.com/8070478.html

https://m.cyzone.cn/article/823438

https://www.minimax.io/news/minimax-music-25

https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model

https://www.youtube.com/watch?v=6s4Ab_8SCaQ

https://deepseek.club/topic/3698

https://feinterview.poetries.top/ai-monitor/news/fish-audio-raises-52m-seed-to-build-ai-voice-models-for-creators-and-enterprises

https://techcrunch.com/2026/07/28/fish-audio-raises-50m-seed-to-build-ai-voice-models-for-creators-and-enterprises

https://noiz.ai/lp/zh/blog/noiz-sound-layer-vision

https://m.pedaily.cn/news/567481

https://saranormous.github.io/filing-websites/minimax

https://www.cls.cn/detail/2300002

https://m.thepaper.cn/newsDetail_forwrd_33585167

https://chat.stepfun.com/docs/zh/step-audio2?studio_code=model-step-audio2&studio_type

https://seed.bytedance.com/zh/seeduplex

https://companies.caixin.com/2026-01-26/102407918.html

https://www.olafriend.com/product

https://www.meta.com/tw/ai-glasses/meta-ray-ban-display/?srsltid=AfmBOoqxG4MYMoMC-g1swyl2Nxbb-r1N_cUoQgzNwKO_6qL2wg5QilWg

https://tempolorguitar.com/products/melo-

相关阅读

最新评论

没有更多评论了
传媒1号

传媒1号

中国传媒业产学研先锋新媒体

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容