AI音频赛道又出新招。当地时间10月1日,AI音乐制作平台Suno正式推出Speech功能的公开测试版,官方称这是业界首个能将语音与音乐作为单一连贯音轨共同生成的音频模型。过去一个月里,Suno先与小范围用户做了内测,现在已面向所有人开放,手机端和网页端都能直接使用。
一次生成,不再拼接
传统做法是什么样的?配音用TTS(文本转语音)先生成旁白,配乐再单独找素材或另用模型生成,最后进剪辑软件做混音、对齐、调音量。三个环节、两三款工具,一旦旁白改一个字,整条流水线都得重跑。
Suno Speech把这条路压缩成了一步。它不是先做TTS再拼BGM,而是端到端一体化生成,模型单次输出就包含语音朗读和原创背景音乐,两者在同一音轨里天然对齐。你在输入框里丢进一个灵感、一首诗或一段文字,再描述想要的人声音色与音乐风格,剩下的交给模型。
官方在发布说明里举了几个很有画面感的例子:配上柔和钢琴的睡前故事、用体育场鼓点烘托的激情演讲,甚至还有”ASMR风格的购物清单”。Suno CEO团队的想法很清晰——语音和配乐本就属于同一个情感场景,拆开做是对创作流程的人为切割。
有声书市场先闻到味道
这个功能瞄准的场景相当具体。有声书、播客、短视频旁白、广告配音,都是语音加音乐的组合需求。行业机构Grand View Research的口径显示,全球有声书市场规模已突破80亿美元,年复合增长率保持在26%左右;中文市场上,喜马拉雅、懒人听书等平台的用户规模合计超过8亿。
对内容团队来说,Speech这类工具改变的是成本结构。一条带BGM的口播视频,传统外包配音加版权音乐的行情在200到500元之间,周期以天计。Suno目前的定价体系下,Pro会员每月10美元,Premier每月30美元,可批量产出大量音频素材,单条内容的边际成本几乎可以忽略。Midjourney在图像领域走过的路,正在音频领域重演。
竞争格局也在快速成型。ElevenLabs凭借高质量TTS和声音克隆在专业市场站稳脚跟,2026年初估值已超过60亿美元;国内的海螺语音、Fish Audio在中文语感上各有优势;微软、谷歌则把语音生成能力塞进了自家云服务。Suno Speech的差异化在于”语音加音乐”这个组合拳,把战场从”谁的声音更真实”切换到了”谁能一次给出完整音轨”。
公测版的三个短板
当然,Beta版的问题官方自己也不遮掩。实测反馈里比较集中的有三点:
- 口音漂移。英式口音可能中途变成澳式,然后又漂回来。对播客这种长音频来说,稳定的人设音色是底线,这个缺陷暂时是硬伤。
- 语调过于戏剧化。情感停顿有时用力过猛,断句节奏被拖慢。旁白类内容要求”平”的播讲感,模型目前更擅长”演”。
- 中文表现未知。官方示例以英文为主,中文的韵律、多音字处理还没有大规模验证,国内用户建议先拿短文本试水。
谁该现在上车
短视频创作者和广告从业者可以立刻用起来。30秒到2分钟的短内容对口音稳定性要求低,单次生成的效率优势最明显,配乐情绪与语音节奏天然同步,省掉的正是最磨人的混音环节。
做长篇有声书的团队建议再观望一两个月,等口音稳定性和中文能力迭代到位。播客主播则可以把它当背景音乐生成器用,旁白照旧用专业TTS工具,BGM交给Speech,两条腿走路。
Suno上一轮融资后估值已到21亿美元,C轮由Lightspeed领投, Music领域它已经验证过一次增长曲线。Speech如果能把语音场景跑通,音频内容的生产门槛会再降一档。工具已经摆在那里,公测免费,花十分钟试一条,比看十篇评测都有用。
(数据来源:Suno官方发布说明、IT之家报道,市场数据引自Grand View Research公开报告)
苏公网安备32010502011527号
发表回复