AI 语音工具:配音、克隆与实时转写
过去一年里,AI 语音从「能听清」走向「像真人」。文本转语音(TTS)、语音克隆、实时转写正在被剪辑软件、有声书平台、会议系统和无障碍工具大规模集成。本文梳理这类工具的能力图谱、主流产品、典型用法、能力边界,以及绕不开的版权与隐私问题,帮助你在选型时建立清晰判断。
能力图谱
AI 语音工具并非单一能力,通常覆盖以下四类:
- TTS 文本转语音:输入文字,输出一段可读的语音,是最基础的能力。
- 语音克隆(voice cloning):用少量样本学习某个说话人的音色,之后用该音色朗读任意文本。
- 实时语音转写与字幕:把听到的语音转成文字,常用于会议纪要、直播字幕、课程字幕。
- 声音分离与降噪:从一段混音里提取人声、去除环境噪声,是配音前处理的重要环节。
这四类能力往往会组合出现。例如先用降噪清理录音,再用 TTS 补录旁白,最后用转写生成字幕。
主流工具盘点
ElevenLabs
ElevenLabs 以高拟真语音见长。其官网显示,文本转语音支持 70 种以上语言,并提供语音库(voice library)与语音克隆能力,用户可克隆自己的声音、用提示词设计新声音,或直接使用库中上万个声音。在模型层面,ElevenLabs 提供 Eleven Multilingual(强调一致性与拟真)、Eleven Flash(约 75 毫秒延迟,适合对话场景)以及 Eleven v3(强调情绪表达)。同时它也提供 Speech to Text(Scribe)转写能力。开发者可通过 ElevenAPI 接入上述功能。
OpenAI TTS
OpenAI 的 TTS 接口提供多个模型:tts-1 延迟较低但质量一般,tts-1-hd 音质更高,较新的 gpt-4o-mini-tts 支持通过提示词控制口音、情绪和语调。官方文档列出 13 种内置音色,例如 alloy、echo、fable、nova、onyx、shimmer 等(其中 marin、cedar 被推荐为较高质量选项)。输出格式支持 mp3、opus、aac、flac、wav、pcm,并支持以分块传输方式进行流式播放。多语言支持大体沿用 Whisper 的语种覆盖范围,包含中文、日语、韩语、法语、西班牙语等数十种语言。
Fish Audio
Fish Audio 主打 TTS 与语音克隆,官网在周年活动中将 S2.1 Pro 模型通过开发者 API 免费提供,并强调免费语音克隆能力。具体支持语种数量与克隆所需样本时长,建议以官方文档最新说明为准(待核实)。
云厂商 TTS
Azure、阿里云、火山引擎等云厂商均提供 TTS 服务,通常以稳定、可批量、可按量计费、易于接入企业系统为特点,适合对合规与 SLA 有要求的场景。各厂商的具体音色数量、价格与语种支持差异较大,选型时需逐一核对官方文档(待核实)。
剪映与必剪配音
剪映(CapCut 国内版)官网列出的 AI 音频能力非常完整:文本朗读支持选择热门音色或进行音色克隆;人声分离可一键提取人声与背景声;音频降噪可过滤环境噪声;人声美化可改变磁性、圆润等听感;另有数字人与智能剪口播。必剪是 B 站推出的剪辑工具,同样内置配音相关功能,具体能力以客户端为准(待核实)。
Whisper 类转写
OpenAI 的 Whisper 是广为人知的开源语音识别模型,后续官方转录接口演进为 gpt-transcribe 等模型,并保留 whisper-1 以支持词级时间戳与 srt、vtt 字幕导出。需要说话人区分时,可使用支持说话人分离(speaker diarization)的模型。Whisper 类方案常被本地部署,适合对数据不出域有要求的团队。
典型使用场景
- 短视频配音:用 TTS 或克隆音色快速生成口播,配合剪映的文本朗读与音色克隆。
- 有声书:长文本需要一致的角色音色与稳定的语速,适合拟真度高的模型。
- 课程讲解:把讲义转成语音,或反过来把授课录音转写成文稿与字幕。
- 会议纪要与字幕:实时转写生成文字记录,再导出 srt、vtt 字幕。
- 无障碍:为视障用户朗读网页与文档,或为听障用户生成字幕。
提示词与参数要点
TTS 的效果很大程度取决于你给的提示与参数。以下是一段调用 TTS 接口时的参数示意,展示常见的可控项:
# TTS API 调用参数示意(以通用 REST 风格描述,非特定厂商)
POST /v1/audio/speech
Content-Type: application/json
Authorization: Bearer <API_KEY>
{
"model": "tts-1-hd", # 模型:音质优先或延迟优先
"voice": "alloy", # 音色:内置音色或克隆得到的 voice_id
"input": "今天我们来聊聊 AI 语音工具。",
"response_format": "mp3", # 输出格式:mp3 / wav / pcm / opus
"speed": 1.0, # 语速:0.5 至 2.0 之间调节
"language": "zh", # 语种提示:提升多语种发音稳定性
"style_prompt": "沉稳、偏讲解语气" # 情绪/语气提示(视模型支持)
}
几个实用经验:
- 语气与语速:讲解类内容建议语速 0.95 至 1.05,偏向自然;广告类可略快。
- 多语种:明确给出语种提示,能显著减少错音与口音漂移。
- 样本质量决定克隆上限:克隆用的录音应当安静、无混响、无背景音乐,单人清晰说话 1 至数分钟通常优于零散片段。
- 长文本分段:超长文本建议按标点或语义切段,统一音色与语速,避免前后不一致。
能力边界与局限
尽管进步很快,当前 AI 语音仍有明显边界:
- 长文本一致性:数十分钟以上的连续朗读,音色与情绪可能漂移,需要分段或后期处理。
- 方言与歌唱:主流 TTS 对标准普通话、英语表现好,方言与带旋律的歌唱仍是弱点。
- 情绪表达有限:即使支持情绪提示,复杂、细腻的情感层次仍不如真人演绎。
- 克隆需授权:用他人声音克隆通常要求本人明确同意,否则存在法律与伦理风险。
版权与隐私
这是使用 AI 语音时最不能省略的一节。
- 商用授权:将 TTS 或克隆音色用于商业视频、广告、有声书前,确认所选方案的商业授权范围与署名要求。
- 声音肖像权:越来越多司法辖区将声音视为具有可识别性的个人特征,未经同意克隆他人音色可能构成侵权。
- 数据出境与留存:云端 TTS 会把文本与样本上传到服务商,涉及用户隐私或机密内容时,优先考虑支持本地部署或数据不出域的方案。
- 标识义务:部分平台要求对 AI 生成音频进行标注,发布前了解目标平台的规则。
选型建议
按四个维度快速收敛:
- 音质优先:追求拟真与情绪表达,优先看 ElevenLabs、Fish Audio 等。
- 语种优先:需要小语种或方言,先核对厂商语种列表,再小规模试听。
- 价格优先:批量、可预期负载下,云厂商按量计费往往更可控。
- 合规优先:数据敏感或需本地化,优先 Whisper 类本地部署与私有化 TTS。
没有哪个工具在所有维度都最好。建议先用同一段脚本在 2 至 3 个候选工具上做盲听对比,再决定长期方案。
小结
AI 语音工具已经从实验室能力变成日常生产力。TTS 解决「把文字念出来」,语音克隆解决「用指定音色念」,实时转写解决「把声音变成文字」,而降噪与分离则是前处理基石。选型时请同时考虑音质、语种、价格与合规,并始终尊重声音肖像权与商用授权。把工具用在自己有权使用的声音与内容之上,才能既高效又安心。
参考与延伸阅读
- ElevenLabs 官网(功能、语音克隆、API 概览):https://elevenlabs.io/ 已核验
- OpenAI 文本转语音指南(模型、音色、格式、流式):https://platform.openai.com/docs/guides/text-to-speech 已核验
- OpenAI 音频与语音总览(TTS、转写、实时):https://platform.openai.com/docs/guides/audio 已核验
- OpenAI 转录指南(Whisper、gpt-transcribe、字幕、说话人分离):https://platform.openai.com/docs/guides/transcription 已核验
- Fish Audio 官网(S2.1 Pro、免费语音克隆):https://fish.audio/ 已核验
- 剪映官网(文本朗读、音色克隆、人声分离、降噪):https://www.capcut.cn/ 已核验
- 必剪(B 站剪辑工具)配音能力:待核实
- Azure / 阿里云 / 火山引擎 TTS 具体音色与价格:待核实
- Fish Audio 支持语种数量与克隆样本要求:待核实