

AssemblyAI 是一款专为开发者打造的语音转文本及音频智能 API。它使用 Universal-2 和 Universal-3 Pro 模型转录音频,并通过 LeMUR 提供说话人分离、情感分析和基于 LLM 的摘要功能,价格低至每音频小时 $0.15。
AssemblyAI 是一款由 AssemblyAI, Inc.(2017 年成立于旧金山)开发的云托管语音转文本 API。它专为需要在应用中集成语音处理功能,但又不想管理 GPU 基础设施、模型更新或扩展管道的软件开发者而设计。该平台每天处理超过 40 TB 的音频,每月处理 8.4 亿次 API 调用,是目前使用最广泛的托管转录服务之一。与面向消费者的转录工具不同,AssemblyAI 没有点击式用户界面:您只需发送音频,API 就会返回结构化文本和元数据。
目前的模型阵容包括:适用于成本敏感型批处理工作负载的 Universal-2($0.15/小时),适用于最高精度预录制转录的 Universal-3 Pro($0.21/小时),以及适用于实时语音代理应用的 Universal-3 Pro Streaming($0.45/小时)。在核心转录功能之上,该平台还提供说话人分离、情感分析、实体检测、PII 脱敏、内容审核和 Auto-Chapters。2023 年 7 月推出的 LeMUR 框架通过单次 API 调用即可将 Claude 或 GPT-4 应用于转录文本,可处理长达 10 小时的音频(约 15 万个 token),实现摘要、问答和 AI 辅导,开发者无需自行构建 LLM 管道。
2026 年 4 月 AssemblyAI 的实际功能
根据工作负载是预录制还是实时,AssemblyAI 的模型栈现在涵盖五个不同的选项。Universal-3 Pro 是旗舰批处理模型,词错误率(WER)为 5.93%,支持 99 种语言,包括自动语码转换。2024 年 10 月发布并取代 Universal-1 的 Universal-2 提供 93.32% 的单词准确率,在专有名词(比 Universal-1 提升 24%)、字母数字(提升 21%)和文本格式(提升 15%)方面取得了显著进步。这些才是实际生产环境中真正重要的数字:呼叫中心软件的失败往往是因为电话号码和保险代码错误,而不是因为 WER 在基准数据集上差了 0.5%。
对于实时工作负载,Universal-Streaming 和 Universal-3 Pro Streaming 使用 WebSocket 连接,端到端延迟低于 200 毫秒。一个关键的工程决策是:AssemblyAI 的流式处理提供不可变的转录文本,这意味着一旦返回一个词,就不会再被修改。竞争对手的流式 API 通常会发送“部分结果”,随着上下文的积累再进行纠正,这给语音代理应用带来了状态管理问题。不可变的方法让代理能够在用户继续说话的同时,处理并响应已转录的语音。
智能技术栈构建在转录功能之上。LeMUR 封装了一个结合智能分段、向量数据库和思维链提示的管道,只需单次 API 调用即可对数小时的音频进行问答或生成摘要。说话人分离功能可区分文件中的多个说话人。Medical Mode 附加组件符合 HIPAA 标准,并针对临床词汇进行了优化。PII 脱敏功能涵盖 50 多种语言中的 15 种敏感数据类型。
"LeMUR 开箱即用的效果令人惊叹。它让我们能够专注于产品,而不是基础设施。" -- Alexander Kvamme,Pathlight 联合创始人兼 CEO,2023 年 7 月
AssemblyAI 与 Deepgram 和 Whisper 的对比定位
两个有意义的竞争对手是 Deepgram(类似的托管 API)和 OpenAI Whisper(开源、自托管)。它们在成本模型、功能深度和操作复杂性方面存在差异,而这些差异对购买决策至关重要。
AssemblyAI vs. Deepgram Nova-3: 两者都是面向开发者的托管 API。准确率数据很接近,但存在争议。AssemblyAI 自己的基准测试显示 Universal-3 Pro 的 WER 为 5.93%,而 Deepgram Nova-3 为 7.9%;Deepgram 自己的基准测试则声称结果相反。更清晰的是延迟:在 2025 年 6 月 Universal-Streaming 发布的基准测试中,AssemblyAI 报告的中位数延迟为 307 毫秒,而 Deepgram Nova-3 为 516 毫秒,且错误噪声输出减少了 73%。定价模型是一个真正的差异点:Deepgram 通常要求生产账户有合同承诺和最低消费额,而 AssemblyAI 则完全按需付费,没有最低消费限制。在音频智能方面,差距更大:AssemblyAI 的 LeMUR 在转录文本上提供了内置的 LLM 管道;Deepgram 则需要开发者自行构建。AssemblyAI 提供可提示转录(通过自然语言上下文指令提高特定领域音频的准确率);截至 2026 年,Deepgram 尚未提供此功能。
AssemblyAI vs. OpenAI Whisper: Whisper 是 OpenAI 在 MIT 许可下发布的开源编码器-解码器 Transformer 模型。其核心价值主张是成本:在您自己的 GPU 上自托管 Whisper,除了基础设施外,每音频小时的成本为零。OpenAI 托管的 Whisper API 收费为 $0.36/小时。AssemblyAI 的 Universal-2 收费为 $0.15/小时,Universal-3 Pro 为 $0.21/小时,比托管的 Whisper 便宜,但不如自托管便宜。架构上的差距对功能有影响:Whisper 本身没有说话人分离、没有流式处理、没有 PII 脱敏、没有音频智能功能,而且在生产音频上的幻觉率比 Universal 模型高出约 30%(根据 AssemblyAI 的基准测试)。Whisper 无法很好地满足实时用例的需求,因为它以块为单位处理音频,而不是真正的流式处理。实际问题在于工程成本:自托管 Whisper 需要 GPU 管理、队列系统和持续的模型更新。希望在一个冲刺周期(sprint)而不是一个季度内发布语音功能的团队,通常会选择支付 AssemblyAI 的小时费率。而每月处理数百万小时音频的团队通常会发现,一旦基础设施成本摊销,自托管 Whisper 会更便宜。
"他们的转录和说话人分离功能处于另一个层次。我几乎不需要编辑转录文本,这在同类工具中非常罕见。" -- G2 评论者,2025 年
API 工作流的实际情况
对于异步(预录制)转录,工作流分为三步:将音频上传到 AssemblyAI 或传递 URL,轮询转录 ID,然后检索包含转录文本、词级时间戳、说话人标签和任何智能输出的结构化 JSON 响应。提供适用于 Python、Node.js、Go、Java 和 Ruby 的 SDK。文档非常全面,并配有交互式游乐场(playgrounds),这也是 AssemblyAI 在 2025 年秋季 G2 语音识别网格报告中获得“领导者”徽章的原因。
对于实时流式处理,开发者打开 WebSocket 连接并流式传输音频块。API 会在最终转录 token 到达时将其返回。2025 年 10 月的产品更新增加了“智能模型回退(Intelligent Model Fallback)”功能,允许开发者按优先级指定多个模型:API 会使用支持检测到语言的最高精度模型,并自动回退。这对于多语言产品非常重要,因为一个音频文件可能会在对话中途切换语言。
值得注意的一个具体事件是:当 AssemblyAI 在 2024 年 10 月下旬推出 Universal-2 时,它同时将基础转录价格削减了 43%,新模型的价格从 $0.37/小时降至 $0.15/小时。2024 年 10 月 31 日的博客文章《超越词错误率:Universal-2 在关键之处提供准确性》将此次发布围绕生产关键的准确性类别,而不是总体的 WER,这是一个显著的定位转变:传达的信息是,对于呼叫中心来说,正确识别专有名词和电话号码比在整体 WER 上提高半个百分点更重要。这种定位引起了 Calabrio 和 Siro 等企业客户的共鸣,这两家公司都报告称在部署 Universal-2 后取得了显著的业务成果。
AssemblyAI 为谁而建
最明确的受众是为 SaaS 产品构建语音功能的开发者团队:呼叫中心对话智能、播客平台、医疗文档、会议摘要,以及越来越多使用 LiveKit 和 Pipecat 等框架的语音代理应用。LeMUR 层对于希望跳过自行构建转录到 LLM 管道的团队来说尤其有价值。SOC2 Type II 和 HIPAA 合规性涵盖了医疗保健和金融服务用例,在这些用例中,数据处理要求通常需要大量定制基础设施。
初创公司可获得 $50 的免费额度,无需信用卡即可进行原型设计。按需付费模式可随需求扩展,没有最低承诺限制,这对于不确定使用量的早期团队来说非常有意义。一旦使用量达到与销售团队洽谈的程度,企业客户可以获得定制化定价、更高的并发限制和专属的 SLA。
2025 年 10 月的更新还引入了 LLM Gateway,将语音转文本、语音理解和 LLM 推理整合到一个统一计费的平台中,目标受众是希望减少 API 供应商数量并简化数据管道的团队。
AssemblyAI 不是什么
AssemblyAI 不是一款面向消费者的产品。它没有供非技术用户上传音频文件并下载转录文本的 Web 界面。这种用例属于 Otter.ai、Rev 或 Descript 等工具。任何自称“不是开发者”的人都应该寻找其他选择。
在大规模应用时,它不是最便宜的选项。当每月音频量达到 100,000 小时以上时,在专用 GPU 硬件上自托管 Whisper 通常比按小时付费更便宜。达到这种体量的团队应该算一笔账:基础设施维护的工程成本很容易超过 API 节省的成本,但一旦平台团队就位,情况也可能反转。
它目前还不是一个全功能的多语言智能平台。支持 99 种语言的转录是真实的,但 LeMUR、Auto-Chapters、情感分析、实体检测和大多数智能功能都以英语为主。用西班牙语或葡萄牙语构建呼叫中心 AI 会很快遇到这些短板。
它不是一个微调平台。拥有高度特定领域词汇(罕见医学术语、专有产品名称、行业术语)的团队可以使用 Keyterms Prompting 来提高识别率,但不支持自定义模型训练。Deepgram 为某些垂直领域提供经过领域微调的引擎;而 AssemblyAI 则依赖其 Universal 模型的开箱即用能力。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 AssemblyAI 相关的指南和文章。
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Amazon Translate Review (2026): Pricing, Accuracy, and When to Pick an Alternative
