Whisper:语音转写

Whisper 是 OpenAI 于 2022 年开源的自动语音识别(ASR)模型,使用大规模弱监督数据训练,支持近百种语言的语音转文字,并能把非英语语音直接翻译成英文。它既可本地运行,也常被集成进字幕、会议纪要与无障碍工具中。

它是什么

Whisper 把音频波形切分为片段并预测文本 token,具备以下特点:

  • 多语种识别,涵盖中文、英文、日文等常见语言。
  • 支持 transcribe(同语言转写)与 translate(译为目标语言)两类任务。
  • 提供 tiny 到 large 多种尺寸,越大越准但越慢。
  • 以开源权重发布,可完全离线部署。

为什么值得用

  • 对噪声与口音有较强鲁棒性,开箱即用无需微调。
  • 本地运行可保护音频隐私。
  • 社区基于它衍生出大量字幕、会议纪要工具。

怎么用

安装 Python 包后即可在命令行转写音频:

pip install openai-whisper
whisper meeting.mp3 --model medium --language Chinese --task transcribe

在代码中使用也只需几行:

import whisper

model = whisper.load_model("base")
result = model.transcribe("meeting.mp3", language="Chinese")
print(result["text"])

注意点

  • 大模型(large)对显存要求较高,低配设备建议用 small 或 base。
  • 识别结果不含说话人分离,多角色会议需配合额外工具。
  • 长音频建议预先分段,以提升准确率与内存可控性。

小结

Whisper 以开源、多语种与本地可部署的特性,成为语音转写的事实标准之一。配合合适的模型尺寸,它能高效产出字幕与纪要,是音频内容结构化的首选工具。

参考与延伸阅读

本文累计阅读