
Speechmatics 是一款源自剑桥的企业级语音转文本 API,基于 Ursa 2 模型运行,支持 55 种以上语言的实时转录,提供本地部署选项,全面符合 HIPAA 和 SOC 2 合规标准,并具备无视口音的高准确率,专为广播公司、联络中心和受监管行业打造。
Speechmatics 是一款企业级语音转文本 API,由一家位于英国剑桥的公司开发。该公司由神经网络语音识别研究员 Tony Robinson 博士于 2006 年创立,他在剑桥大学完成了其奠基性研究。公司最初注册为 Cantab Research Ltd.,近二十年来一直致力于打造一项核心能力:在不牺牲速度的前提下,实现跨越各种口音、方言和语言的精准转录。该 API 为实时广播字幕、联络中心分析、医疗文档和国防情报应用提供支持,在这些领域,准确性和数据主权绝非可有可无的附加项。
该平台当前的模型 Ursa 2(自 2024 年 10 月起全面上市)在实时流式处理和批处理模式下支持 55 种以上语言,在合理配置下可实现低于 1 秒的流式延迟,并将说话人分离作为核心功能而非付费附加项。Speechmatics 提供三种部署模式:云端 API、通过 Docker 容器或预配置虚拟设备进行的本地部署,以及设备端边缘推理。该公司在其部署堆栈中拥有 ISO/IEC 27001:2022、SOC 2 Type II、GDPR 和 HIPAA 认证。2025 年 9 月推出的专业 Medical Model 在临床音频上实现了 93% 的真实世界通用准确率和 96% 的医疗关键词召回率(与竞争对手的同类系统进行了基准测试对比)。对于需要 Deepgram 或 AssemblyAI 开发者体验且没有合规要求的团队,可以考虑这些替代方案;但对于“勉强够用”远远不够的受监管企业和全球广播公司而言,Speechmatics 是值得信赖的首选。
Speechmatics 在 2026 年 4 月的产品表现
Speechmatics Speech API 接收音频输入(通过 WebSocket 流式传输或上传批处理文件),并返回带时间戳的转录文本、说话人标签、标点符号以及可选的置信度分数。Ursa 2 模型于 2024 年 10 月成为所有 Speechmatics 服务的默认模型,在实时流式模式下支持 55 种语言,并在发布时新增了爱尔兰语和马耳他语,从而全面覆盖了 24 种主要的欧洲语言。在 FLEURS 数据集的准确率基准测试中,Ursa 2 在 62% 的受测语言中排名第一,在 92% 的语言中位列前三。
批处理转录费率分为 Standard 和 Enhanced 两个层级(Enhanced 使用更大的模型通道,以提高在复杂音频上的准确率)。实时流式处理使用 max_delay 参数,范围从 0.7 到 4 秒;默认的 4 秒可实现最高准确率,而 1.5 秒则是语音代理应用的推荐起点。该平台还将 STT、LLM 轮流对话和 TTS 整合为一个名为 Flow 的单一产品,这是一款对话式语音代理 API,提供云端和本地两种配置。
2025 年 9 月推出的 Medical Model 值得特别提及。它为英语临床音频树立了行业基准,实现了 93% 的真实世界通用准确率(7% WER)、96% 的医疗关键词召回率,以及在药物名称、诊断和手术代码上仅 4% 的关键词错误率。在 Speechmatics 自己的基准测试中,这代表着医疗术语错误比最接近的竞争对手少 50%。该模型部署在具有 CUDA 加速功能的 NVIDIA Triton Inference Server 上,目前支持英语、西班牙语、法语、荷兰语和芬兰语,其余语言将在其 55 种语言组合中陆续推出。
2026 年 3 月,Speechmatics 发布了其称之为全球首款双语阿拉伯语-英语生产级 STT 模型,该单一模型可同时处理多种阿拉伯语方言和英语。这填补了中东地区企业评论中长期指出的空白。
“我们很高兴能与 Speechmatics 合作,推动我们的实时和批处理字幕业务。在所有关键质量指标上,他们始终保持领先地位。” - Tom Wootton,Red Bee Media 产品负责人,2024 年
Speechmatics 与 Deepgram 和 AssemblyAI 的对比定位
2026 年的 STT API 市场在企业级层面有三个主要竞争者:Speechmatics、Deepgram 和 AssemblyAI。它们在机制上的差异非常显著,如果为您的用例选择了错误的工具,将会带来实质性的后果。
Speechmatics 对比 Deepgram Nova-3:Deepgram 是一家总部位于美国的初创公司,采用延迟优先的架构。Nova-3 在 9 个领域的 2,703 个文件中公布了 5.26% 的 WER 基准,在综合速度与准确率的排名中,Deepgram 经常胜出。其 Flux 流式模型针对语音代理应用,目标是实现低于 100 毫秒的延迟,且配置开销低于 Speechmatics 的 `max_delay` 调优。Deepgram 的 Keyterm Prompting 允许在推理时注入多达 100 个自定义词汇,而 Speechmatics 的 Custom Dictionary 采用基于 JSON 的方法,每个条目限制为 6 个词,并提供发音“sounds_like”替代方案。关键区别在于:Deepgram 没有本地部署选项。对于构建语音代理的美国 SaaS 初创公司来说,Deepgram 的定价(按分钟计费加上 $4.50/小时的捆绑 Voice Agent API)在小用量下更为清晰。但对于无法将患者音频路由通过美国云提供商的欧洲广播公司或医院而言,Speechmatics 是该层级中唯一的选择。
Speechmatics 对比 AssemblyAI Universal-3 Pro:AssemblyAI 以开发者为先,功能丰富。其 LeMUR 产品将 LLM 直接叠加在音频之上,只需一次 API 调用即可实现摘要、情感分析、问答提取和实体检测,无需单独的 LLM 管道。AssemblyAI 的 Universal-3 Pro Streaming 声称在多语言准确率排名中位列第一(基于其自身基准测试),并支持自然语言提示和流中动态关键词注入。机制上的上限在于:AssemblyAI 的流式处理支持 6 种语言(英语、西班牙语、法语、德语、意大利语、葡萄牙语)。而 Speechmatics 在流式模式下支持 55 种以上语言。如果您的应用需要处理来自 20 个国家/地区用户的通话,AssemblyAI 的流式语言上限将成为阻碍。AssemblyAI 同样没有本地部署选项,且说话人分离、医疗模式和 LeMUR 的附加组件会大幅增加基础成本。一项学术研究发现,Deepgram 在朗读语音准确率上以统计学上显著的差距落后于 Speechmatics 和 AssemblyAI,但整体情况依然是:请在您自己的音频上进行测试,因为供应商的基准测试在不同的测试集上无法始终如一地复现。
“与 Speechmatics 合作使我们能够无缝地为客户提供高质量的自动化语音分析,作为我们解决方案的一部分。” - Mariano Tan,Prosodica 总裁兼首席执行官,2024 年
简而言之:Deepgram 在语音代理延迟和美国开发者人体工程学方面胜出。AssemblyAI 在内置 LLM 功能和开发者入门体验方面胜出。Speechmatics 则在语言覆盖率、本地部署和合规认证深度方面胜出。它还自然地与 OpenAI Whisper 基准测试形成参照:Whisper 是开源的,在准确率上表现强劲,但没有企业级 SLA,没有说话人分离,也不支持流式处理,这使得 Speechmatics 成为那些已经超越自托管 Whisper 阶段的团队的结构化替代方案。
合规性与部署的现实考量
Speechmatics 与 Deepgram 和 AssemblyAI 最明显的区别在于其部署的灵活性,以及支撑这种灵活性的合规认证体系。本地部署选项绝非仅仅是营销噱头。2024 年发布的 Flow On-Premise 通过 Docker 容器或预配置的虚拟设备,在客户自身的基础设施内部署完整的对话式 AI 堆栈(STT、LLM 轮流对话和 TTS)。这意味着音频永远不会离开客户的防火墙,这在医疗保健(HIPAA)、欧洲政府(具有更严格国家数据驻留规则的 GDPR)、国防(机密音频)和金融服务(MiFID II 通话录音要求)领域至关重要。
截至 2026 年 4 月持有的认证包括:ISO/IEC 27001:2022、SOC 2 Type II、GDPR 合规、HIPAA 合规。数据在静态时使用 AES-256 加密,在传输过程中最低使用 TLS 1.2 加密。基础设施运行在受 Kubernetes 控制的容器上,并配有 SIEM 监控。企业客户还可以选择多区域云配置,以满足国家数据驻留要求,而无需完全采用本地部署。
对于在结合 STT 和 TTS 工作流方面评估 Speechmatics 与 ElevenLabs 的团队:ElevenLabs 主要是一款 TTS 产品,近期才加入了 STT 功能;而 Speechmatics 拥有 20 年的 STT 专业经验,TTS 是较近期才添加的(免费层级包含每月 100 万字符的英语 TTS)。两者的产品定位是相反的。对于需要一流 STT 并可选择接入专业 TTS 层的语音代理,Speechmatics 通过 Flow API 架构与 ElevenLabs 或 Coqui TTS 完美配合,而非直接竞争。在没有合规限制的情况下构建全托管语音管道的团队,可能会发现 Coqui TTS 或 ElevenLabs 在语音合成方面功能更全面。
Speechmatics 的明显不足之处
在 G2、Capterra 和 Gartner Peer Insights 上反复出现的挫败感主要集中在四个方面:
规模化定价不透明。Pro 层级公布了费率和每月 6,000 小时的上限,但超过该限制的任何需求都需要进行 Enterprise 级别的洽谈,且没有公开定价。评论区中的用户特别指出,在扩大规模时,定价结构会变得复杂。批量折扣(超过 500 小时/月可享受 20% 折扣,24,000 小时/年以上有额外优惠)有所帮助,但在不与销售人员沟通的情况下,您无法为大规模生产建立可靠的成本模型。
Custom Dictionary 限制。基于 JSON 的 Custom Dictionary 对特定领域的术语很有用,但每个条目限制为 6 个词。需要指定长复合临床术语或多词法律短语的医疗保健和法律用户会觉得这很受限。AssemblyAI 通过自然语言提示来处理此问题,没有字数限制。
流式延迟配置开销。`max_delay` 参数默认为 4 秒,这对于后处理用例来说没问题,但给构建实时语音代理的开发者带来了阻力。0.7 秒的最小值是可以实现的,但这需要阅读文档和进行测试,而 Deepgram 的语音代理产品在设计上就避免了这些麻烦。
内置后处理功能有限。Speechmatics 返回准确的转录文本。但它不提供开箱即用的摘要、情感标签、实体提取或结构化通话分析。原始转录之外的每一项功能都需要单独的管道和集成。期望获得类似 AssemblyAI LeMUR 那种交钥匙分析功能的团队,将需要自行构建该层。
Speechmatics 适合哪些用户
在以下情况下选择 Speechmatics 进行构建:您需要本地或私有云部署,且无法接受音频离开您的基础设施;您的音频在流式模式下跨越 6 种以上语言;您服务于受监管行业(医疗保健、金融、国防、政府),其中 HIPAA/SOC 2/ISO 27001 认证是采购要求;您需要包含强大的说话人分离功能且无需额外付费;您的实时字幕或广播用例需要同时在数十种语言中实现亚秒级延迟。
在以下情况下跳过 Speechmatics:您是首次探索 STT 的独立开发者或小型初创公司(Deepgram 的开发者体验和定价在小用量下更易于接受);您需要在一次 API 调用中内置 LLM 摘要、情感分析或实体提取(AssemblyAI LeMUR 无需单独管道即可处理此问题);您正在构建基于美国的语音代理,其中延迟是主要变量,而合规性不是限制因素(Deepgram Flux 专为此构建);或者您的预算要求在承诺基于使用量的定价之前拥有真正无限制的免费层级(每月 8 小时的免费层级只是一个起点,而非生产环境)。
Limecraft 的基准测试案例很有启发性。该媒体协作平台在对其广播公司客户标准化使用 Speechmatics 之前,对多家 ASR 供应商进行了正面评估。Limecraft 的首席营收官 Maarten Verwaest 报告称:“在词错误率和标点符号方面,他们始终优于其他供应商,在我们的工作空间开发中发挥了关键作用。”这正是 Speechmatics 为之打造的买家类型:那些已经运行过基准测试、比较过合规文档,并发现准确率加上部署灵活性胜过高昂成本的企业团队。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Speechmatics 相关的指南和文章。
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Amazon Translate Review (2026): Pricing, Accuracy, and When to Pick an Alternative

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

SOAP Notes to Patient Summary With ChatGPT: A HIPAA-Safe Pattern (2026)
