

AudioCraft 是 Meta 的开源音频 AI 框架,集成了用于文本生成纯音乐的 MusicGen、用于生成音效的 AudioGen 以及用于神经音频压缩的 EnCodec。支持免费自托管,代码采用 MIT 许可,是研究人员和开发人员构建自定义音频模型的理想之选。
AudioCraft 是 Meta AI 于 2023 年 8 月 2 日发布的一款基于 PyTorch 的研究库。它不是托管产品或消费者应用,而是一个自托管框架,集成了三种不同的生成式音频模型:MusicGen(根据文本提示或旋律参考生成纯音乐)、AudioGen(根据文本生成环境声音和音效)以及 EnCodec(作为高保真压缩器和分词器支撑前两者的神经音频编解码器)。其代码采用 MIT 许可,预训练模型权重则在 CC-BY-NC 4.0 许可下发布,这意味着除非与 Meta 达成单独的商业协议,否则仅限非商业用途。
MusicGen 提供 small(约 300M 参数)、medium(约 1.5B 参数)和 large(约 3.3B 参数)三种变体。它的旋律条件(melodic conditioning)功能可接收参考音频文件,使用 Meta 的 HT-Demucs 音源分离技术提取色谱图(chromagram)表示,并利用该和声指纹来引导编曲,让制作人能够将哼唱的旋律或钢琴草稿转化为完整的器乐曲目。AudioGen 可处理 16kHz 的环境音底和拟音风格的声音设计。框架中还新增了两个模型:2024 年 5 月加入的非自回归模型 MAGNeT(提供更快的推理速度),以及 2025 年 1 月加入的 JASCO(通过 Flow Matching 引入细粒度的和弦与节拍控制)。这四款模型均可在本地 GPU 硬件上运行。
AudioCraft 在 2026 年 4 月的生成表现
核心的 MusicGen 模型每次生成最多 30 秒的 32kHz 单声道纯音乐,或使用 2024 年 1 月发布的立体声变体生成立体声音频。medium 和 large 模型生成的音乐结构明显比 small 模型更连贯,但两者都需要至少 16GB 的 GPU 显存才能流畅推理。small 模型可在 8GB 显卡上运行,但会在质量上有所妥协。AudioGen 可生成单声道 16kHz 音效,其输出在短促的环境音片段上比在需要精确时值的拟音上更可靠。
最新模型 JASCO 提供 400M 和 1B 参数变体,具有两种条件模式:文本加和弦与鼓点,或文本加和弦、鼓点与旋律。具备完整条件控制的 1B 变体是该框架中最具可控性的音乐生成模型。它也是文档最少的模型,并且与所有 AudioCraft 权重一样,仅限非商业用途。metademolab.com 演示页面提供了 Gradio 界面,无需本地安装即可测试 MusicGen 和 AudioGen,不过公开演示将生成时长限制在 12 秒以内。
独立于生成模型的 EnCodec 是一款完全实时的神经编解码器,支持多种比特率的单声道和立体声音频。它在 AudioCraft 之外也得到了广泛应用,包括语音应用和语音研究,对于需要高质量音频压缩的生产工程师来说,它可以说是该库中最具实用价值的组件。
AudioCraft 与 Stable Audio Open 及 Suno 的对比定位
最相关的两个对比对象是 Stable Audio Open(开放权重,积极开发中)和 Suno(闭源,商业化,支持人声)。
Stable Audio Open(Stability AI,2024 年 7 月)使用的是潜在扩散(latent diffusion)架构,而非自回归 Transformer。其核心模型是一个 1.057B 参数的扩散 Transformer(DiT),由 109M 参数的 T5 文本编码器提供条件,外加一个 156M 参数的自编码器,将立体声 44.1kHz 波形压缩到潜在空间。输出最高可达 47 秒的 44.1kHz 立体声音频,而 AudioCraft 的上限是 32kHz 单声道。Stable Audio Open 在 7,300 小时的知识共享(Creative Commons)音频上进行了训练,这使其在环境音和打击乐声音方面具有更好的覆盖率。AudioCraft 的 MusicGen 则在 20,000 小时的授权音乐和 Meta 自有音乐上进行了训练,这使其在旋律和和声音乐结构上具有优势。实际上:Stable Audio Open 在声音设计和短促环境音片段方面表现更好;MusicGen 在具有音乐连贯性的较长器乐创作方面表现更好。Stable Audio Open 在 2024-2025 年也得到了更积极的维护,包括与 Arm 合作发布的 341M 参数移动端变体。
Suno(商业化,闭源)采取了完全不同的方法。其混合架构结合了处理逼真人声合成和歌词生成的 Bark,以及处理器乐的 Chirp。输出的是一首包含主唱、和声和音乐底座的完整制作歌曲,每个片段长达 4 分钟。AudioCraft 完全无法生成人声。Meta 故意使用 HT-Demucs 音源分离技术从 MusicGen 的训练数据中剥离了人声,正是为了避免与演唱相关的版权问题。Suno v5(2025 年)在独立的音频质量评估中获得了 1,293 的 ELO 分数,领先于所有公开测试的竞争对手。然而,在 2024 年 7 月,RIAA 对 Suno 和 Udio 提起了诉讼,指控其在训练中使用了未经授权的受版权保护的音乐,鉴于 Meta 使用的是授权数据,AudioCraft 并没有这种法律阴影。Suno 通过订阅层级收费,起价约为 8 美元/月;AudioCraft 则是免费的。
“连免费的手机点击游戏都不会买这种输出音频”,Hacker News 匿名评论者,2023 年 8 月,讨论 AudioCraft 的发布演示音频
这种反应虽然苛刻,但说明了 AudioCraft 的本质和局限。在发布时,其输出是研究级别的,而非生产级别的。自 2023 年以来,随着 Suno 和 Udio 的积极迭代,而 Meta 的核心 MusicGen 模型基本保持停滞,AudioCraft 与商业音乐生成器之间的差距已经拉大。
许可与版权现状
AudioCraft 的代码采用 MIT 许可,听起来极其开放。然而,模型权重采用的是知识共享署名-非商业性使用 4.0 国际许可(CC-BY-NC 4.0)。这种区别非常重要。您可以自由阅读、修改和重新分发训练及推理代码。但在权重许可下,未经与 Meta 达成单独的商业协议(该协议未公开提供),您不能在任何商业产品、服务或变现工作流中使用生成的音频或模型。
在 2023 年 8 月 Hacker News 的发布讨论中,多位开发者指出了这种框架设定的问题:一位开发者直言不讳地指出,由于非商业限制,“你无法以此建立业务”。“开源”(代码)与“开放权重”(非商业)之间的差距也是 Meta 的 Llama 发布中出现的一种模式,这给任何希望在 AudioCraft 输出基础上构建商业产品的人带来了真正的阻力。
在训练数据方面,Meta 表示 MusicGen 在大约 400,000 份录音(总计 20,000 小时)上进行了训练,使用的是 Meta 内部自有音乐以及来自 Shutterstock 和 Pond5 的专门授权素材。这使得 AudioCraft 在防御性上优于 Suno 或 Udio,后两者在 2024 年 7 月都面临了 RIAA 的诉讼。截至 2026 年 4 月,AudioCraft 的训练数据声明尚未受到法律挑战。
JASCO 的权重带有与 MusicGen 和 AudioGen 相同的 CC-BY-NC 4.0 限制。EnCodec 的权重和代码均采用 MIT 许可,使其成为该库中唯一完全开放的组件。
AudioCraft 的明显短板
最明显的限制是人声。MusicGen 无法在其输出中生成演唱、语音或任何可懂的人声。这是一个深思熟虑的设计选择,而非暂时的缺陷。训练管道在分词之前,将所有音频通过 HT-Demucs 运行,以分离并移除人声干音。需要从 AudioCraft 家族中获得人声合成的研究人员,应将 EnCodec 作为其他声码器系统的编解码层,而不是使用 MusicGen 本身。
硬件要求构成了第二个障碍。作为生成连贯音乐输出的最低配置,medium 模型需要 16GB 的显存。拥有 8GB 显卡的用户只能使用 small 模型,其生成的音乐结构明显更简单。一位用户在 2024 年 3 月的 GitHub issue #435 中报告称,其配备 16GB 显存的 NVIDIA 笔记本电脑在 MusicGen 推理期间仅显示 5-10% 的 GPU 利用率,而 CPU 核心却满负荷运行,这表明推理管道并未在所有硬件配置上始终如一地利用 GPU 加速。
在自定义数据集上进行微调在技术上是支持的,但在实践中却很困难。一位用户试图在 GTX 1060 上使用 133 小时的音乐微调一个 33M 参数的自定义模型,在训练 20 小时后报告称,生成的样本“听起来几乎没有任何效果”,与在同等硬件上 20 分钟内就能显示出连贯进展的其他 Transformer 架构相比,表现不佳。训练需要大量的 GPU 资源,这使得大多数没有云端计算访问权限的个人研究人员无法进行深度的微调。
开发速度也明显放缓。上一次实质性发布是 2025 年 1 月的 JASCO。在此之前是 2024 年 5 月的 MAGNeT。核心的 MusicGen 和 AudioGen 模型实际上冻结在了 2023-2024 年的参数量上,而 Suno 和 Stable Audio 等竞争对手则继续发布带有质量改进的主要版本更新。由于有 362 个未解决的 GitHub issue,且 Meta 的研究注意力明显转向了其他项目,AudioCraft 目前处于维护状态,而非积极开发状态。
“模型进展慢得离谱,我已经训练了 20 个小时,生成的样本听起来几乎没有任何效果”。CDandRW,GitHub issue #388,2024 年 1 月 15 日
AudioCraft 适合哪些人
对于希望研究或在 Meta 的生成式音频架构之上进行构建的机器学习研究人员和音频工程师来说,AudioCraft 是合适的工具。如果您正在撰写关于文本条件音乐生成的论文,需要一个基线模型进行比较,或者想在小众数据集(民族乐器、工业声音设计、游戏音频包)上训练自定义模型,AudioCraft 的训练代码和 EnCodec 主干网络都有着详尽的文档,且非常实用。对于需要在本地进行非商业生成式音频推理、无使用上限、无 API 成本且对模型有完全控制权的开发人员来说,它也是合适的工具。
如果您想生成带有歌词和人声的完整歌曲,AudioCraft 是错误的选择,这需要 Suno 或 Udio。如果您需要快速、维护良好的开源音频生成来进行非音乐声音设计,它也是错误的选择,在这方面 Stable Audio Open 提供了更积极的开发和 44.1kHz 下更好的立体声质量。如果您需要商业许可,请跳过 AudioCraft,因为 CC-BY-NC 权重限制阻碍了任何变现部署。如果您缺乏至少 8GB 显存的 GPU,或者不习惯手动安装 Python 依赖项和管理 PyTorch 环境,也请跳过它。
对于习惯运行本地 Python 代码并拥有中端 NVIDIA GPU 的独立游戏开发者、学生电影制作人和学术音频研究人员来说,AudioCraft 仍然是一个功能强大且免费的选项,可用于生成非商业纯音乐和音效。作为先于其他一切的基础开源音频 AI 框架,即使较新的工具在原始输出质量上超越了它,它在研究文献中仍具有持续的引用价值。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 AudioCraft 的精选合集。
相关文章
与 AudioCraft 相关的指南和文章。

Run Open Source AI Models Locally: Battle-Tested Guide

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
