Skip to content

语音翻译

语音翻译(Speech Translation,ST)的目标是将一种语言的语音直接翻译成另一种语言的文字或语音,是跨语言实时交流的核心技术。它串联了 语音识别 ASR、机器翻译(MT)和 语音合成 TTS 三大环节,而端到端模型正在将它们融合为统一网络。2024-2025 年,原生多模态大模型(如 GPT-4o)的出现进一步模糊了 ASR/MT/TTS 的边界——语音和文本在同一个模型中被统一处理。前置阅读:语音与音频技术概览。

语音翻译 = 给 AI 装一个”同声传译员”。 想象一个联合国同传译员:听到英语发言,几乎同步说出中文翻译——语音翻译系统就是要让机器完成这件事。

  • 级联式(Cascaded)= 三段接力。 先 ASR 把英文语音转成英文文本,再 MT 把英文文本翻译成中文文本,最后 TTS 把中文文本合成中文语音。每一步各自最优,但错误会逐级传递——ASR 的错字进入 MT 会被放大。举个真实例子:机场广播说 “Flight 202 is now boarding”(202 航班开始登机),如果 ASR 把 “Flight” 错听成 “Fight”(打架),MT 就会把这句话翻译成 “202 航班正在打架”,而 TTS 会一本正经地用语音念出这个荒谬的翻译。一个音素的识别错误,经过 MT 的语义推理后被放大成完全偏离原意的句子——这就是错误传播(error propagation):前级模块的错误不仅传递到后级,还会被后级的语义推理机制放大,因为 MT 会对它收到的文本做”合理化”处理,把一个噪声词强行编进通顺的句子里。
  • 端到端(End-to-End)= 一步到位。 用一个神经网络直接从英文语音输出中文文本(或中文语音),省去中间文本环节——翻译延迟更低,也避免了 ASR 错误传递。关键优势在于:模型直接从源语言语音特征(acoustic features,如 Mel 频谱图)映射到目标语言文本,不再经过”源语言文本”这个有损中间表示。以上面的例子说明:端到端模型看到的是 “Flight / Fight” 在频谱上极其相似的声学特征,但它同时拥有上下文——“航班号 + boarding”这个语境——因此可以学到”虽然这两个词声学上几乎不可区分,但在这个上下文里应该是 Flight”。这种利用上下文消歧的能力,是级联式 ASR(只做语音→文本,不关心翻译语义)无法具备的。代价是:端到端模型需要大量”源语言语音—目标语言文本”配对数据,而这类数据远比纯 ASR 或纯 MT 数据稀缺。
  • 同声传译(Simultaneous)= 边听边翻。 不等说话者说完就开始翻译,像真正的同传译员。核心难点在于”何时开始翻”——翻早了信息不足(句子未完),翻晚了延迟太大。
  • 多语言模型 = 一个模型通吃所有语言。 SeamlessM4T 和 Whisper 支持几十上百种语言的互译,不再为每个语言对单独训练模型——大规模预训练带来的涌现能力。2024 年后,这一趋势进一步演化为原生多模态大模型(如 GPT-4o),语音、文本在同一个 token 空间中被统一处理。

两种范式的对比:级联式串联三个独立模块,端到端用一个统一模型直接映射:

错误传播的具体路径:在级联式中,信息流经”语音 → 源文本 → 目标文本 → 目标语音”四个阶段,每一阶段的输出是下一阶段的唯一输入。ASR 阶段的一个词错误(如 flight→fight)会导致 MT 阶段产生完全错误的翻译(boarding→“打架登机”),而 TTS 忠实地合成了这个错误翻译。端到端模型之所以能缓解此问题,是因为声学特征和翻译目标在同一网络中联合优化——模型”知道”最终的翻译目标,可以在声学模糊时利用翻译上下文做消歧。

端到端 ST 的主流架构分两种:Cross-Attention(交叉注意力)和 Dual-Decoder(双解码器),它们处理”源语音编码”与”目标文本解码”之间关系的方式不同:

  • Cross-Attention 架构:最经典的端到端方案(如 ESPnet、Fairseq S2T 中的实现)。语音编码器(通常用 Conformer 或预训练的 wav2vec 2.0 / w2v-BERT)将源语音编码为向量序列,Transformer 解码器在生成目标语言文本时,通过 Cross-Attention(交叉注意力机制,即 Transformer decoder 对 encoder 输出的注意力)直接”查看”语音编码。结构简洁,与神经机器翻译的 encoder-decoder 一脉相承——只是把文本 encoder 换成了语音 encoder。优点:架构简单、易于大规模预训练。缺点:语音信号比文本长得多(1 秒语音约 100 帧),encoder-decoder attention 的计算开销大,且长语音序列建模困难。
  • Dual-Decoder 架构:在共享编码器上接两个解码器——一个 ASR 解码器(输出源语言转录文本),一个 ST 解码器(输出目标语言翻译)。ASR 解码器生成的源语言文本作为”桥梁”信号辅助 ST 解码器,相当于让模型在内部隐式地做了一次”识别再翻译”,但两个解码器共享同一个语音编码器,且联合训练时梯度可以互相补充。优点:ASR 任务作为辅助监督信号,缓解 ST 配对数据不足的问题——ASR 数据远比 ST 数据充足。缺点:参数量和计算量更大。代表工作:Fututr、Speech Matrix。

这两种架构并非互斥——SeamlessM4T v2 实际上采用了更统一的设计:用 w2v-BERT 做语音/文本统一编码,一个 Transformer 完成所有方向的翻译,可以说是 Cross-Attention 思想的多任务扩展。

同声传译的核心是决定何时输出翻译、何时继续等待输入:

wait-k policy 详解:最经典且广泛使用的同声传译策略是 wait-k(读 k 个词后开始写)。假设 k=3,则译员(模型)的行为是:从源语言句首开始,每读取 3 个源语言词,就输出 1 个目标语言词,形成一个固定的”读 3 写 1”的节奏。例如源句 “The / weather / is / very / nice / today”,k=3 时的执行过程为:读到 “The weather is” → 输出 “今天”(中文常先说时间);读到 “very nice today” → 输出 “天气很好”。这里的 k 控制延迟-质量权衡:k 越小,延迟越低但翻译质量越差(信息不足就开翻);k 越大,质量越高但延迟越大。k=∞ 退化为传统的句子级(离线)翻译。现代研究还提出了 adaptive wait-k(自适应等待),让模型根据语义复杂度动态调整 k 值——简单短语少等,复杂从句多等。

多模态大模型的语音翻译新范式(2024-2025)

Section titled “多模态大模型的语音翻译新范式(2024-2025)”

2024 年起,原生多模态大模型(如 GPT-4o)开启了一种全新的语音翻译范式:不再有独立的 ASR/MT/TTS 模块,语音和文本被统一编码为 token 序列,由同一个大语言模型处理:

这种方式的优势在于:大语言模型强大的上下文理解和推理能力天然适合消歧(如区分 flight/fight),且可以处理情感、语气等超出纯文本翻译范畴的信息。

用 Whisper 做语音翻译(HuggingFace Transformers)

Section titled “用 Whisper 做语音翻译(HuggingFace Transformers)”
import torch # 深度学习框架
from transformers import pipeline
# 加载 Whisper 模型(内置语音翻译任务:X 语 → 英文文本)
translator = pipeline(
"automatic-speech-recognition",
model="openai/whisper-medium")
# task=translate 将源语言语音翻译成英文文本
result = translator("chinese_speech.wav",
generate_kwargs={"task": "translate"})
print("翻译结果(英文):", result["text"])
# 如果需要中文翻译而非英文,先用 ASR 转文本再做 MT
asr_text = translator("chinese_speech.wav",
generate_kwargs={"task": "transcribe",
"language": "chinese"})["text"]
print("识别原文:", asr_text)
# 再用机器翻译模型翻译成目标语言

💡 Whisper 原生支持”源语言语音 → 英文文本”的翻译(task=translate),这是端到端语音翻译的一个实际应用。翻译到其他语言需要配合机器翻译模型。

用 SeamlessM4T v2 做多语言语音翻译

Section titled “用 SeamlessM4T v2 做多语言语音翻译”

SeamlessM4T v2 是 Meta 开源的统一翻译模型,单一架构支持四种翻译方向:语音→语音(S2ST)、语音→文本(S2TT)、文本→语音(T2ST)、文本→文本(T2TT),覆盖 100+ 语言。其核心组件是 w2v-BERT 编码器——结合 wav2vec 2.0 的自监督语音预训练与 BERT 的掩码语言建模,在大量无标注语音上学习通用语音表征,再用有标注翻译数据微调。

from transformers import (
SeamlessM4TProcessor, SeamlessM4TForMT)
import torch
# 加载 SeamlessM4T v2(支持 100+ 语言互译)
processor = SeamlessM4TProcessor.from_pretrained(
"facebook/seamless-m4t-v2-large")
model = SeamlessM4TForMT.from_pretrained(
"facebook/seamless-m4t-v2-large")
device = "cuda" if torch.cuda.is_available() else "cpu"
model = model.to(device)
# 语音 → 文本翻译(S2TT):中文语音 → 英文文本
# from datasets import load_dataset
# dataset = load_dataset("facebook/covost2", ...)
# audio_inputs = processor(aud=y, sampling_rate=sr,
# src_lang="cmn", return_tensors="pt").to(device)
# output_tokens = model.generate(**audio_inputs, tgt_lang="eng",
# generate_kwargs={"num_beams": 5})
# translation = processor.decode(output_tokens[0], skip_special_tokens=True)
# 文本 → 语音翻译(T2ST):英文文本 → 中文语音
# text_inputs = processor(text="Hello, how are you?",
# src_lang="eng", return_tensors="pt").to(device)
# output = model.generate(**text_inputs, tgt_lang="cmn")
# audio = processor.decode(output[0], skip_special_tokens=True)
print("SeamlessM4T v2 统一架构支持四种翻译方向")

用 GPT-4o API 做实时语音翻译(2024-2025)

Section titled “用 GPT-4o API 做实时语音翻译(2024-2025)”

GPT-4o 等原生多模态大模型可以直接处理实时语音流,延迟约 300ms,无需级联 ASR→MT→TTS:

from openai import OpenAI
client = OpenAI()
# 方式一:用 GPT-4o 音频 API 做语音翻译(音频输入 → 文本翻译输出)
# 适合需要翻译文本的场景
with open("chinese_speech.wav", "rb") as f:
translation = client.audio.translations.create(
model="whisper-large-v3", # OpenAI 托管的 Whisper 模型
file=f,
)
print("翻译结果(英文):", translation.text)
# 方式二:用 Realtime API 做实时双向语音翻译(2024 新增)
# 语音直接输入,翻译后的语音直接输出,无需 ASR→MT→TTS 级联
# import asyncio
# from openai import AsyncOpenAI
#
# async def realtime_translate():
# async with client.beta.realtime.connect(
# model="gpt-4o-realtime-preview"
# ) as rt:
# # 设置指令:将输入语音翻译为目标语言并输出
# await rt.session.update(session={
# "instructions": "You are a real-time translator. "
# "Listen to speech in any language and "
# "speak the translation in Chinese.",
# "voice": "alloy",
# "modalities": ["audio", "text"],
# })
# # 发送音频流(实际场景中从麦克风实时读取)
# # await rt.input_audio_buffer.append(audio_chunk)
# # 翻译后的音频会通过 response.output_audio 返回

💡 GPT-4o 实时语音翻译的优势:原生多模态意味着模型直接”理解”语音内容并生成语音输出,延迟约 300ms,接近人类同传的速度。相比级联式,它没有模块间切换的延迟累积,且能保留说话人的语气和情感。详见 语言模型演进。

  • 级联式仍是工业主力:尽管端到端模型在学术 benchmark 上表现亮眼,但级联式(ASR + MT + TTS)因可利用各环节的大量独立数据和成熟模型,在真实产品中仍占主导地位。Google Translate 的语音翻译即是级联式。
  • 端到端的数据瓶颈:端到端 ST 需要”源语言语音 - 目标语言文本”的配对数据,这类数据远比 ASR 或 MT 的单任务数据稀缺。MuST-C、CoVoST 等数据集是当前主流开源 ST 数据。Meta 在 2024 年发布的 Speech Matrix 数据集利用双语对齐技术从海量视频中挖掘出 8000+ 语言对的语音翻译数据,是目前规模最大的开源 ST 数据集。
  • 知识蒸馏弥补数据不足:用 MT 模型生成伪标签来增强 ST 训练数据——先 ASR 转文本,再用 MT 翻译,将结果作为端到端模型的额外训练信号。Dual-Decoder 架构将这一思想内化到模型结构中:ASR 解码器充当辅助任务,为 ST 解码器提供隐式的”源文本桥梁”。
  • 同声传译的延迟-质量权衡:用 Average Lagging(平均延迟)和 AL(Anticipatory Latency)等指标衡量延迟,与翻译 BLEU 分联合评估。wait-k policy 是当前研究主流——固定 k 值简单高效,adaptive wait-k 进一步用强化学习动态调整 k。
  • 流式 ASR 是同传基础:同声传译需要流式 ASR(实时输出中间结果),Whisper 本身不是流式的,需用 Conformer / RNN-T 等流式架构替代。详见 语音识别 ASR。
  • 语音克隆让翻译”说自己的声音”:先用 ASR+MT 翻译文本,再用目标说话人的声音克隆做 TTS,即可实现”用你的声音说外语”的效果。Meta 的 SeamlessExpressive(2024)更进一步——不仅克隆音色,还保持说话人的情感、语速、停顿、强调等表现力特征,让翻译后的语音”仍然像那个人在说话”。
  • 多语言预训练是趋势:Whisper 和 SeamlessM4T 用统一模型处理几十到上百种语言,低资源语言(如斯瓦希里语)的翻译质量也大幅提升。2025 年 Meta 开源的 Voxtral-24B(含 Core77J 语料)将这一趋势推向多模态大模型——它基于多模态 LLM 架构,可以听语音并直接用文本回答问题或翻译,将语音理解、翻译、问答统一在一个模型中。详见 语言模型演进。
  • 2025 年实践建议:对于需要极低延迟的实时对话翻译,GPT-4o Realtime API 等多模态大模型方案已可用且效果优秀;对于需要离线部署或处理罕见语言对的场景,SeamlessM4T v2 仍是最强的开源选择;对于只需要文本输出的场景,Whisper + MT 级联方案简单可靠。
  • 实时翻译设备/应用:Google Translate 的”对话翻译”模式、Microsoft Translator、讯飞翻译机——手机对着说话即可实时翻译成对方语言并朗读,出国旅行必备。
  • 会议实时字幕与翻译:Microsoft Teams 的实时翻译字幕、Zoom 的多语言字幕、飞书的妙记翻译——跨国会议中参会者各自看到母语字幕,大幅降低语言障碍。
  • 视频/直播字幕翻译:YouTube 的自动翻译字幕、B 站的 AI 实时翻译——用 ASR 转文本再翻译成目标语言,让视频内容跨越语言边界。
  • 会议同声传译:国际会议中,AI 同传系统为参会者提供实时语音翻译,辅助人类译员或替代低规格场景的人工同传。2025 年起,基于 GPT-4o 等多模态大模型的实时翻译已能提供接近人类同传的体验,延迟低于 500ms。
  • 跨国客服:跨国公司的客服中心用语音翻译让客服人员和不同语言的客户沟通,降低语言能力要求。
  • 语音翻译 API:Google Cloud Translation、Azure Speech Translation、讯飞开放平台提供语音翻译 API,开发者可集成到自己的应用中。2024 年起 OpenAI 的 Realtime API 也成为实时语音翻译的新选择。
  • 跨语言播客/视频配音:SeamlessExpressive 等技术让翻译后的视频/播客保持原始说话人的情感和风格,使 AI 配音不再是机械的”机器朗读”,而是”像原作者在用外语说话”。
类库语言说明
HuggingFace TransformersPython提供 Whisper、SeamlessM4T v2 等预训练 ST 模型,pipeline 接口极简
OpenAI WhisperPython支持 99 种语言识别和翻译为英文的开源模型
SeamlessM4T v2PythonMeta 开源的多语言多模态翻译模型,支持 100+ 语言四种方向互译,w2v-BERT 编码器
SeamlessExpressivePythonMeta 2024 开源,在翻译基础上保持说话人的情感、语速、停顿等表现力
Voxtral / Core77JPythonMeta 2025 开源的多模态语音大模型,基于 LLM 架构统一语音理解与翻译
GPT-4o Realtime APIAPIOpenAI 2024 推出,原生多模态实时语音翻译,延迟约 300ms
Fairseq S2TPythonMeta 的语音到文本工具包,支持 MuST-C 等数据集的端到端 ST 训练
ESPnetPython端到端语音处理工具包,覆盖 ASR/ST/语音增强全链路
Google Cloud Speech TranslationAPIGoogle 云的实时语音翻译 API,支持流式音频输入
Speech Matrix数据集Meta 2024 发布的大规模多语言 ST 数据集,8000+ 语言对
术语英文解释
语音翻译ST (Speech Translation)将源语言语音直接翻译为目标语言文本或语音
级联式语音翻译Cascaded Speech TranslationASR + MT + TTS 三段串联的传统语音翻译方式
错误传播Error Propagation级联式中前级模块的错误传递到后级并被放大的现象
端到端语音翻译End-to-End Speech Translation用一个神经网络直接从源语言语音生成目标语言文本
Cross-AttentionCross-AttentionTransformer 解码器对编码器输出的注意力机制,端到端 ST 的经典架构
Dual-DecoderDual-Decoder共享编码器上接 ASR 和 ST 两个解码器的架构,ASR 任务辅助 ST 训练
w2v-BERTw2v-BERT结合 wav2vec 2.0 自监督语音预训练与 BERT 掩码建模的语音编码器,SeamlessM4T 的核心组件
同声传译Simultaneous Interpretation在源语言说话者未说完时即开始翻译的低延迟模式
等待策略Read-Write Policy同声传译中决定何时输出翻译、何时继续等待的策略
wait-k policywait-k Policy每读取 k 个源语言词后开始输出 1 个目标语言词的固定读写节奏策略
平均延迟Average Lagging同声传译中衡量翻译输出滞后于源语言输入的指标
SeamlessM4TSeamless Multimodal Multilingual TranslationMeta 的多语言多模态翻译模型,支持 100+ 语言互译
SeamlessExpressiveSeamlessExpressiveMeta 2024 的表现力保持语音翻译模型,保留说话人情感和风格
VoxtralVoxtralMeta 2025 的多模态语音大模型,基于 LLM 架构统一语音理解与翻译
原生多模态大模型Native Multimodal LLM如 GPT-4o,语音和文本在统一 token 空间中处理,无需级联 ASR/MT/TTS
知识蒸馏Knowledge Distillation用 MT 模型的输出指导端到端 ST 模型训练的数据增强策略
MuST-CMuST-C Dataset大规模多语言语音翻译数据集,基于 TED 演讲构建
Speech MatrixSpeech Matrix DatasetMeta 2024 发布的超大规模多语言 ST 数据集,8000+ 语言对
  • Bérard et al., “Listen, Attend and Translate: A Comparison of Two-to-Three Approaches to End-to-End Speech-to-Text Translation” (IWSLT 2016):端到端语音翻译的开创性工作,首次证明单一神经网络可完成 ST。
  • Radford et al., “Robust Speech Recognition via Large-Scale Weak Supervision” (OpenAI 2022):Whisper 技术报告,68 万小时多语言弱监督预训练,内置语音翻译能力。
  • Seamless Communication Meta Team, “SeamlessM4T: Massively Multilingual & Multimodal Machine Translation” (2023) / “SeamlessM4T v2” (2024):Meta 的多语言语音翻译大模型,100+ 语言,语音和文本统一建模。v2 版本改进了编码器架构和训练数据规模。
  • Seamless Communication Meta Team, “SeamlessExpressive: Languages Should be Translated in Their Own Voice” (2024):表现力保持的语音到语音翻译,不仅翻译语言内容,还迁移说话人的情感、语速和停顿。
  • Meta AI, “Voxtral: Multimodal Large Language Model for Speech Understanding” (2025):基于多模态 LLM 的语音理解模型,将语音翻译、语音问答、语音指令统一在一个模型中。
  • Ma et al., “Monotonic Multihead Attention” (ICLR 2018):同声传译的经典工作,提出单调多头注意力实现流式翻译。详见 Transformer 架构。
  • Dalvi et al., “Incredible Machine Translation through Wait-k Policy” (2019) / “Wait-k Policy” 系列:wait-k 同声传译策略的系统化研究,提出固定延迟和自适应延迟两种模式。
  • Cho & Esipova, “Can Neural Machine Translation Do Simultaneous Interpretation?” (2016):最早探讨神经网络做同声传译可行性的论文,提出 wait-k 策略的雏形。
  • 延伸路线:语音翻译的上游技术见 语音识别 ASR,下游技术见 语音合成 TTS;底层的序列建模架构见 Transformer 架构,多语言预训练趋势见 语言模型演进。