

OpenAI Whisper 是一款免费且基于 MIT 协议开源的语音识别模型,支持 99 种语言的音频转录。深受开发者青睐,常用于播客处理流水线、会议记录和视频字幕生成。支持零成本自托管部署;也可通过 OpenAI API 调用,价格为每分钟 $0.006。
Whisper 是由 OpenAI 于 2022 年 9 月构建并发布的开源自动语音识别 (ASR) 系统。它使用从互联网抓取的 680,000 小时多语言音频进行训练,涵盖 99 种语言,能够处理各种口音、录音环境和特定领域的词汇。模型权重和推理代码在 GitHub 上以 MIT 协议发布,这意味着任何人都可以免费下载、修改和使用 Whisper,无需支付许可费。对于希望使用托管推理服务而无需管理自有 GPU 基础设施的团队,OpenAI 也通过其 API 提供了 Whisper 的访问权限。
截至 2026 年 4 月,推荐的生产版本是 2024 年 10 月发布的 Whisper large-v3-turbo,其运行速度约为 large-v3 的八倍,且在高资源语言上的准确率几乎相同。社区项目进一步扩展了 Whisper 的功能:faster-whisper 使用 CTranslate2 重新打包了模型以获得额外的速度提升;WhisperX 增加了词级时间戳和说话人日志(speaker diarization)功能;distil-whisper 是一个在 Hugging Face 上训练的蒸馏变体,参数减少了 49%,速度提升了六倍。开发者将 Whisper 广泛应用于播客制作、会议转录、视频字幕生成、语音数据流水线构建以及无障碍工具开发中。
Whisper 在 2026 年 4 月的输出能力
Whisper 可输出带有可选时间戳的纯文本转录内容,支持纯文本、SRT、VTT、TSV 或 JSON 格式。该模型系列包含五种原始尺寸:tiny(39M 参数)、base、small、medium 和 large(1.5B 参数)。目前推荐用于生产环境的权重是 large-v3-turbo,这是 large-v3 的蒸馏变体,针对吞吐量进行了优化,且无需占用与其父模型同等规模的内存。
处理过程基于分块机制:Whisper 以 30 秒为片段分析音频。这种架构在处理录制音频时能提供极高的准确率,但也意味着模型无法实时流式传输转录结果。对于访谈后期处理、讲座或录音通话等批处理工作流而言,这并非限制。但对于需要亚秒级响应的实时字幕或语音代理来说,这是一个硬性制约。
支持多达 99 种语言,但各语言的转录质量并不统一。在清晰的音频下,英语、西班牙语、法语、德语、日语和葡萄牙语的表现接近人类水平。对于低资源语言,覆盖质量则显著下降。转录约鲁巴语、旁遮普语地方方言或海地克里奥尔语的用户反馈,其错误率较高,需要大量人工校对。翻译功能可将任何受支持语言的音频直接转换为英文文本,这对于多语言内容索引非常实用。
2024 年 10 月 large-v3-turbo 的发布恰逢另一则新闻热点:Associated Press 在同月发布的一项调查记录显示,Whisper 在医疗转录场景中系统性地出现了文本幻觉,在静音音频片段或环境噪音中生成了听起来很合理的句子。OpenAI 自己的文档中已经包含了一项警告,即该模型“可能会生成未被说出的文本”,但 Associated Press 的报告引起了更广泛的关注,并对医疗保健和法律环境中的生产部署提出了质疑。这种幻觉行为是架构性的,与模型大小无关,并且在包括 turbo 在内的所有 Whisper 变体中都持续存在。
“我在静音音频片段上运行 Whisper 进行测试,它生成了听起来很合理的填充文本。不仅仅是噪音,而是从未被说出的连贯句子。这是一种已知的故障模式,对于医疗用途来说令人担忧。” - u/quietcompute,r/MachineLearning,2025 年 1 月
Whisper 与 AssemblyAI Universal-3 和 Deepgram Nova-3 的对比定位
这里最客观的比较是开源与闭源、批处理与实时处理之间的较量。在这些选项中,Whisper 是唯一可以离线运行、微调并进行全面检查的模型。AssemblyAI 和 Deepgram 则是闭源的商业 API。
AssemblyAI Universal-3(2024 年 3 月发布)是一个专有的编码器-解码器模型,在获得许可的音频数据集上进行训练,AssemblyAI 声称这些数据集比 Whisper 从互联网抓取的训练语料库更干净。实际差异在于:Universal-3 支持通过 WebSocket 进行实时流式转录,端到端延迟低于 300 毫秒,这是 Whisper 的架构无法企及的。Universal-3 还内置了说话人日志功能,无需组装单独的流水线。在英语对话方面,独立的基准测试广泛支持 AssemblyAI 关于其词错误率低于 Whisper large-v3 的说法。定价从免费层(每月 5 小时)开始,然后是每小时 $0.37。Whisper 在语言广度(99 种对较少语种)、零自托管成本、代码透明度和无供应商依赖性方面胜出。
Deepgram Nova-3(2025 年 1 月发布)采用非自回归流式架构,在架构上与 Whisper 的自回归编码器-解码器设计截然相反。这使得 Nova-3 能够提供延迟低于 200 毫秒的流式转录和实时的词级置信度分数,使其成为语音代理和实时字幕部署的基准选择。Nova-3 原生支持 36 种语言,虽然少于 Whisper,但在这些语言中的表现更加一致。API 定价为每分钟 $0.0043,比 OpenAI 的 Whisper API(每分钟 $0.006)更便宜。Whisper 再次在开放性、自托管和完整的 99 种语言范围上胜出。
实际选择通常归结为一个问题:您需要实时输出吗?如果需要,除非使用复杂的、仍会引入延迟的分块变通方法,否则 Whisper 是不可行的。如果您正在批量处理录制的音频,Whisper(自托管)在大规模应用时能以零分钟成本提供极具竞争力甚至更好的准确率。
“whisper-large-v3-turbo 确实令人印象深刻。我正在转录 4 小时的采访录音,其词错误率(WER)与我之前以 $0.25/分钟 支付给 Rev.com 的服务相当。与 v3 相比,速度的提升是巨大的。” - u/mlpraktiker,r/MachineLearning,2024 年 11 月
许可与版权现状
Whisper 的 MIT 协议是 AI 领域最宽松的许可之一:您可以将其用于商业用途、重新分发、修改并在其基础上构建产品,而无需支付版税或获得额外许可。该许可涵盖了模型权重和推理代码。它没有某些开源模型所包含的“商业用途需企业协议”条款。
自托管路径是完全免费的。您可以从 Hugging Face Hub 下载权重,安装 Python 包,并在本地运行转录。GPU 基础设施成本由您承担,而非 OpenAI。开发者通过云提供商在租用的 A10G GPU 上运行 large-v3-turbo,只需支付 GPU 费用,而无需支付单次转录费。在大规模应用时,其经济效益非常显著:一家每月处理 1,000 小时音频的播客制作公司,如果按 OpenAI API 费率计算,大约需要支付 $360,而如果在本地运行 faster-whisper,GPU 计算成本仅为该金额的一小部分。
OpenAI API 路径的收费标准为每分钟处理音频 $0.006。这是标准的现收现付费率,无需订阅。希望使用托管基础设施而无需拥有 GPU 硬件的团队通常会选择这条路径。没有月度订阅或席位定价。API 端点 (`api.openai.com/v1/audio/transcriptions`) 接受最大 25MB 的音频文件,并以请求的格式返回转录结果。
像 faster-whisper 和 distil-whisper 这样的社区分支同样采用 MIT 协议。WhisperX 使用 pyannote.audio 进行说话人日志记录,而 pyannote 在 Hugging Face 上有自己的访问模型,在下载某些模型之前需要进行账户验证。这给试图自动化其流水线设置的团队带来了一些阻碍,因为这种验证机制需要手动请求令牌的步骤。
Whisper 的明显短板
在静音和低信号音频中产生幻觉。 这是记录中最严重的局限性。Whisper 会在没有语音、只有环境噪音或听不清的音频片段中生成听起来很自信的文本。`no_speech_threshold` 和 `logprob_threshold` 参数可以减少这种行为,但无法完全消除。对于要求逐字准确的场景(医疗、法律、官方会议记录),每个输出片段都需要进行验证。这并非理论上的担忧:2024 年 10 月的 Associated Press 调查记录了 Whisper 在医疗转录输出中插入从未说过的词语的具体事件。
没有内置流式传输。 Whisper 的 30 秒分块架构是模型训练方式的固定属性。它无法在音频到达时生成部分转录。社区的变通方法包括使用语音活动检测 (VAD) 将音频分割成句子级别的块,但这会增加延迟和复杂性。对于语音代理、实时会议字幕或任何要求输出必须在语音发出后 500 毫秒内出现的用例,Whisper 需要围绕其核心限制进行大量的工程设计。
说话人日志需要第三方组装。 Whisper 的输出是没有说话人标签的纯文本转录。添加日志功能需要 WhisperX 加上 pyannote.audio,这涉及单独的安装、具有受限模型访问权限的 Hugging Face 帐户以及额外的 GPU 内存。对于习惯了将日志功能作为单一开关的商业 API 的团队来说,这种集成工作量是巨大的。
large-v3 的 GPU 要求。 以实用速度运行 large-v3 在 fp16 下至少需要 10GB 显存。像 RTX 3060 (12GB) 这样的消费级 GPU 在默认设置下会遇到内存不足的错误。large-v3-turbo 在这方面有了实质性的改进,但希望在 large-v3 上获得最高准确率的开发者仍然需要强大的硬件。Small 和 medium 模型在 CPU 上运行尚可接受,但在处理具有挑战性的音频时,输出质量明显较差。
语言质量差异。 Whisper 支持 99 种语言,但质量分布差异很大。该模型在英语和主要欧洲语言上的表现接近人类水平;而在低资源语言上的表现则极不稳定,以至于处理约鲁巴语、阿拉伯语地方方言或较少见的亚洲语言的用户经常表示,其输出结果需要进行全面的人工审查。
Whisper 适合哪些人
Whisper 是专为开发者打造的。OpenAI 没有提供官方的 Web UI、拖拽界面或托管仪表板。入门需要 Python、pip,以及支持 CUDA 的 GPU,或者有耐心在 CPU 上运行较小的模型。如果这符合您的配置,那么 Whisper 是目前可用于任何规模转录的最强大的免费工具之一。
最强大的用例是对成本敏感的批处理:播客制作、视频字幕生成、录制讲座存档、研究访谈音频转录、呼叫中心录音处理。每月处理 1,000 小时音频,自托管的 faster-whisper 设置仅需 GPU 计算成本。而通过商业 API 处理相同数量的音频则需要 $360 或更多。两者的经济性完全不在一个量级。
Whisper 也非常适合离线和物理隔离的部署。无法将音频发送到外部 API 的医疗保健 IT 团队、政府承包商和律师事务所可以完全在自己的基础设施内运行 Whisper,而无需任何数据离开其环境。MIT 协议意味着这种使用是允许且不受限制的。
在以下情况下请跳过 Whisper: 您需要为语音代理或交互式应用程序提供延迟低于 500 毫秒的实时转录;您的用户是非技术人员且需要 Web 界面;您处理医疗或法律音频,在没有专用验证层的情况下无法接受幻觉风险;或者您需要开箱即用的生产级说话人日志功能。在这些情况下,AssemblyAI Universal-3 或 Deepgram Nova-3 解决了实时和日志记录的差距,代价是供应商依赖和按分钟计费。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Whisper 的精选合集。
相关文章
与 Whisper 相关的指南和文章。
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Amazon Translate Review (2026): Pricing, Accuracy, and When to Pick an Alternative
