跳到主要内容
Vantaige
Stable Audio screenshot
Stable Audio logo

Stable Audio

免费增值

Stable Audio 通过文本提示生成 44.1kHz 立体声音质、免版税的器乐和音效。该工具由 Stability AI 基于完全授权的数据集开发,擅长制作背景音乐、环境音效和声音设计——但不包含人声歌曲。

使用场景:音频与音乐
功能:APIOpen Source

Stable Audio 是 Stability AI 推出的音频和音乐生成平台,专门基于授权数据集构建,而非抓取受版权保护的录音。该工具支持文本提示输入,在其付费版本中还支持上传音频文件,并能生成 44.1kHz 音质的立体声音轨。它并不是 Suno 那种意义上的歌曲生成器:没有主唱人声,没有歌词,也没有主歌-副歌的结构。但它所生成的——器乐、环境音效和独立的声音效果——不仅速度快、合法合规,而且质量足以满足商业视频和游戏项目的需求。

该产品以两种并行形式存在。位于 stableaudio.com 的消费者 Web 应用程序提供了一个直观的生成界面,设有四个订阅层级(从 Free 到 Max),每次生成的输出上限为 3 分钟。企业级版本 Stable Audio 2.5 于 2025 年 9 月发布,增加了音频修复(audio inpainting)、多部分结构生成功能,并在 H100 GPU 上实现了不到两秒的生成速度——可通过 Stability AI API、Replicate、ComfyUI 和 Fal 访问。此外,还有一个独立的开源变体 Stable Audio Open 1.0,提供可免费下载的模型权重,这些权重基于来自 Freesound 和 Free Music Archive 的 CC 授权录音进行训练,不过其输出上限为 47 秒,且更偏向于音效而非音乐。

Stable Audio 在 2026 年 4 月的生成能力

商业 Web 应用程序每次最多可生成 3 分钟的 44.1kHz 立体声音频。用户输入描述流派、情绪、节奏、乐器和预期段落结构(前奏、铺垫、高潮、尾奏)的文本提示。对于大多数提示,生成过程在 60 秒内即可完成。所有付费层级均提供音频到音频(Audio-to-audio)模式,允许用户上传参考文件来引导输出的节奏和声音特征,同时版权检测系统会自动扫描上传内容并标记第三方素材。

Stable Audio 2.5 增加了音频修复功能:上传一段音频,选择一个区域或起点,模型就会生成在音乐上连贯的延续部分。这对于品牌音频工作和后期制作意义重大,因为这些场景的目标通常是扩展或改编现有作品,而不是从头开始生成。2.5 版本背后的 ARC(Adversarial Relativistic-Contrastive)训练方法不仅实现了其宣称的生成速度,而且与 2.0 版本相比,能在前奏、过渡和尾奏部分产生更复杂的音乐发展。

Hugging Face 上的 Stable Audio Open 1.0 模型采用了基于 Transformer 的 DiT 扩散架构,结合基于 T5 的文本条件和压缩自编码器。它在 486,492 段录音上进行了训练:其中 472,618 段来自 Freesound,13,874 段来自 Free Music Archive,所有录音均采用 CC0、CC BY 或 CC Sampling+ 许可。较小的配套模型 Stable Audio Open Small(2025 年 5 月发布)则针对设备端推理和移动部署。这两种开源变体的输出上限均为 47 秒,并且在音效和现场录音方面的表现优于结构化音乐。

Stable Audio 与 Suno 和 Udio 的定位对比

这三者的比较通常被描绘成一场赛马,但更准确的做法是将它们视为针对不同输出的不同工具。Suno v5.5 首先是一个人声歌曲生成器。其以 LLM 为先的架构在一次生成中整合了歌词和人声合成,能够制作出具有自然乐句、颤音和情感动态的完整结构化歌曲。它在大约 30 秒内生成原生的 4 分钟音轨,并通过其 Extend 功能扩展至 10 分钟。它不支持音频到音频的输入条件控制。其训练数据的情况目前正处于活跃的版权诉讼中。

“在即时歌曲生成方面,Suno 似乎仍处于领先地位。”——Audiocipher 评论,2024 年 4 月,2025 年 4 月更新

Udio 1.5(2025 年 10 月之前)是抒情音乐领域以质量为先的竞争者,它使用基于扩散的模型和 LLM 引导的歌词,原生生成 32 秒的片段,可拼接至 15 分钟。在扩展的抒情音轨上,其音频保真度被广泛认为在原始质量上略胜 Suno 一筹,尽管生成速度较慢,每次大约需要 90 秒。2025 年 10 月,Udio 通过禁用用户下载并转向“仅限授权(Licensed-Only)”的受限模式,与各大唱片公司达成了诉讼和解。社区对此反应强烈——花费数月时间完善声音的创作者们发现,他们再也无法导出自己生成的作品了。

“许多 Reddit 用户强调了 Udio 是如何变成一个封闭系统的,因为创作者无法再下载他们的歌曲,这一功能被悄无声息地取消了。”——AI Tool Discovery,Suno AI Reddit 评论 2026

Stable Audio 则占据了一条独立的赛道。它是器乐和声音设计工具。当 Suno 和 Udio 在竞争谁能生成更好的流行歌曲时,Stable Audio 生成的是那首歌曲下的环境底音、游戏中的 UI 点击声,以及电影场景背后的氛围嗡鸣声。其 3 分钟的上限对音乐制作人来说是个限制,但对于以 30-60 秒循环为标准的声音设计用例来说,这基本上无关紧要。它的分轨(stem)导出功能被多个制作人社区视为对 DAW 友好的差异化优势,而这正是 Suno 和 Udio 的消费者输出中所缺乏的。

授权与版权的现实

Stable Audio 最站得住脚的声明是其训练数据的出处。商业模型完全基于从 AudioSparx 库获得授权的音乐进行训练,并采用收益分享安排:如果该模型在商业上表现良好,AudioSparx——以及通过它提供作品的艺术家们——将分享这一成功。这是时任 Stability AI 音频副总裁的 Ed Newton-Rex 在构建该产品时做出的基础设计决策。

2023 年 11 月,Newton-Rex 公开辞去 Stability AI 的职务,理由是不同意母公司的立场,即在受版权保护的作品上训练 AI 模型构成“合理使用(fair use)”。这次辞职广受关注,并凸显了一个特定的讽刺意味:他构建 Stable Audio 正是为了避免他所抗议的问题。更广泛的 Stability AI 公司通过其图像模型坚持合理使用的立场;而 Stable Audio 的音频训练则是独立且干净的。Newton-Rex 随后创立了认证组织 Fairly Trained,并入选了 TIME 2025 年 AI 领域最具影响力的 100 人名单。

对于商业用户来说,其结果是具有实际意义的。在 Stable Audio 付费层级上生成的音轨附带 Creator 许可证,授予个人使用的商业权利,涵盖社交媒体、商业发行、低于特定收入阈值的影视植入,以及月活跃用户不超过 100,000 的应用和游戏。超过这些阈值的组织,或需要自托管的组织,则需升级到 Enterprise 层级。生成的输出可能会被 Stability AI 用于未来的模型改进,但用户上传的文件不会被纳入训练数据集。

Stable Audio Open 在 Stability AI Community License 下发布,允许研究和非商业用途;商业用途需要通过 stability.ai/license 签订单独的协议。

Stable Audio 的明显短板

人声生成在结构上是缺失的。该模型在任何层级都无法产生连贯的人类歌唱、歌词演唱或可理解的语音。这不是一个错误;这是一个深思熟虑的范围决策。但这意味任何希望生成一首带有歌手的完整歌曲的人都会立刻碰壁。

音频到音频(Audio-to-audio)模式未能兑现其隐含的承诺。该功能将参考文件中的音色和表面层次的声音特征应用到生成的输出中;它不会重新排列、重构或智能地将输入作为音乐模板使用。Audiocipher 评论员的测试发现,在音频到音频模式下提示特定乐器(鼓、贝斯)通常会产生完全缺少这些乐器的输出——模型应用的是一种声音风味,而不是构建所请求的编曲。一项将手风琴录音转换为吉普赛爵士乐的测试生成了木琴,而不是提示中要求的贝斯和鼓。

“风格迁移效果不是很好……尽管提示要求了鼓和贝斯,但结果缺乏完整的乐器编排。”——Audiocipher,测试 Stable Audio 2.0 音频到音频功能,2024 年 4 月

每次生成 3 分钟的硬性上限对于想要完整音轨的音乐制作人来说是一个持续的摩擦点。通过音频修复(在 2.5 版本中可用)进行拼接需要额外的工作流开销。Pro 计划的上传限制——每月 30 分钟——在活跃的声音设计会话中很容易耗尽,而且未使用的生成次数不会结转。开源变体的 47 秒上限更是让那些以为开源模型能媲美商业应用功能的开发者感到雪上加霜。

用于结构控制的提示词工程需要真正的反复试验。用户必须直接在文本中编码段落结构(“两分钟的铺垫,1:40 处高潮,尾奏淡出”),而复杂的提示有时会产生幻觉般的音频伪影或突兀的过渡,需要重新生成。该模型不支持像 Suno 这样由 LLM 支持的工具所使用的那种灵活的自然语言输入。

Stable Audio 适合哪些人

需要免版税背景器乐的视频制作人和内容创作者是最明确的匹配对象。完全授权的训练数据、44.1kHz 的输出音质以及不到 60 秒的生成时间,使其非常适合高产量的视频制作,在这些制作中,每首曲目都需要通过 Content ID 检查。

构建环境音效、UI 音频和环境声音设计的游戏开发者能从中获得真正的价值,尤其是在 Pro 层级,音频到音频模式允许从参考素材进行迭代。Enterprise 层级解锁了在专有声音库上进行微调的功能,这对于在不同游戏作品中构建一致音频标识的工作室来说意义重大。

希望对短格式资产进行本地、开放推理的声音设计师和音频工程师,应该通过 Hugging Face 和 ComfyUI 探索 Stable Audio Open 1.0 或 Open Small。47 秒的上限对于脚步声、UI 点击声、拟音(Foley)元素或简短的氛围循环来说并不是限制。

需要音频标识工作(声音 Logo、跨接触点的一致音频品牌)的品牌和机构是企业级 2.5 API 的目标受众。与 2.5 版本发布同时宣布的 WPP Amp 声音品牌合作伙伴关系,标志着这是该产品的主要增长方向。

如果您需要任何形式的人声,如果您想生成具有主歌-副歌结构的完整歌曲,如果您的工作流依赖于超过 3 分钟且无需手动拼接的音轨,或者如果您需要从音频参考中进行深度的结构风格迁移而不是表面的音色转换,请跳过 Stable Audio。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Stable Audio 的精选合集。

相关文章

与 Stable Audio 相关的指南和文章。