OpenAI 在 2026 年初发布了 Whisper 语音识别模型的重要更新。新版本在准确率、语言覆盖范围和推理速度上都实现了大幅提升,进一步巩固了 Whisper 作为开源语音识别标杆的地位。
新版本亮点
Whisper 新版本最引人注目的变化是支持的语言从原来的 99 种扩展到了 120 种以上,包括多种低资源语言。在绝大多数语言上,词错误率(WER)降低了 15-30%。中文和日文等词表较大的语言改进尤为显著。
实时转录
新版本的推理延迟大幅降低。在 NVIDIA A100 上,large-v3 模型的实时转录因子(RTF)从 0.05 降低到了 0.02 以下,意味着 1 分钟音频可以在 1.2 秒内完成转录。配合流式处理 API,可以实现接近实时的语音转写体验。
「Whisper 新版本的准确率和速度让我们决定将自研语音识别系统全面替换为 Whisper。成本降低 80%,准确率反而提升了。」— 某 SaaS 公司技术负责人
多说话人识别
新版本引入了改进的说话人分离(Speaker Diarization)能力。在多人对话场景中,Whisper 能够更准确地识别不同说话人的语音片段并标注对应的说话人标签。这对于会议转写和访谈记录等场景极为实用。
噪声鲁棒性
在新版本的训练中,OpenAI 使用了更大规模、更多样化的噪声数据增强策略。Whisper 在嘈杂环境(街头、咖啡馆、工厂车间)下的识别准确率提升了超过 20 个百分点,使其能够胜任更多实际场景。
模型下载与使用
新版本 Whisper 模型权重已在 Hugging Face 上开源,采用 MIT 许可证。开发者可以使用 transformers 库或 whisper.cpp 在本地部署。OpenAI 也提供了 API 版本,支持更低的延迟和更高的并发。
Whisper 的这次更新再次证明了开源语音识别的巨大潜力。对于开发语音应用的个人开发者和企业来说,Whisper 已经成为一个不可或缺的工具。