Skip to content

语音与音频技术概览

语音是人与人、人与机器交互最自然的模态。本页概述语音 AI 的技术全景:ASR(听懂)和 TTS(说话)是两大基石,而端到端深度学习正在统一这条链路——从波形直接到文本,从文本直接到波形。2024 年以来,语音基础模型与 LLM 的融合更将这条链路压缩为”一个模型,端到端对话”。

  • 语音识别 ASR:将语音转为文字,从 HMM 到 CTC、Whisper 的端到端演进,语音助手与实时字幕的技术基础
  • Whisper 与 wav2vec2:两大预训练 ASR 模型深度对比,自监督预训练与弱监督多任务两条路线的分岔
  • 语音合成 TTS:将文字转为自然语音,从拼接合成到 Tacotron 2、VITS 的神经网络语音合成全景
  • TTS 核心模型详解:Tacotron2、FastSpeech2、VITS、HiFi-GAN、Bark 五大模型的原理与选型
  • 说话人识别与声纹:从声音判断”你是谁”,MFCC 到 ECAPA-TDNN 的声纹特征演进与确认/辨认/分离任务
  • 语音增强与降噪:从含噪录音中恢复干净语音,助听器、视频会议与 ASR 前处理的关键技术
  • 语音分离与降噪:从谱减法到 Conv-TasNet、Demucs,覆盖语音增强、说话人分离与回声消除
  • 音乐信息检索:节拍检测、和弦识别、源分离、流派与情感分类,Spotify 推荐与 Shazam 听歌识曲的底座
  • 声音事件检测:识别狗叫、警笛、婴儿哭声等环境声音事件及其时间,安防与智能家居的感知技术
  • 语音翻译:跨语言语音直接翻译,ASR + 机器翻译 + TTS 的级联与端到端融合

把语音 AI 的四个核心任务类比为人的器官:

  • ASR(语音识别)= 耳朵:把声波”听”成文字。声波进来 → 特征提取 → 模型解码 → 输出文本。
  • TTS(语音合成)= 嘴巴:把文字”念”成声波。文本进来 → 音素转换 → 声学模型 → 声码器 → 输出波形。
  • 声纹识别 = 身份证:从声波里提取说话人的生物特征,回答”说话的人是谁”。
  • 语音增强 = 降噪耳机:去除背景噪声、混响,让干净的人声凸显出来。

一条完整的语音交互链路:用户说话 → ASR 转文本 → NLU 理解意图 → 生成回复文本 → TTS 语音回复。深度学习时代,每个环节都可以用一个神经网络端到端完成;而在 2024 年后的多模态大模型(如 GPT-4o)中,这条链路进一步被压缩进单一模型,省去了中间的文本中转。

为什么语音处理比文本处理更难?

Section titled “为什么语音处理比文本处理更难?”

文本是离散符号——26 个字母或几千个汉字组成有限的词表,模型只需在离散空间里做分类。而语音是连续信号,处理难度体现在四个维度:

难点文本语音
信号类型离散符号(词表有限,天然已”分词”)连续模拟波形,每秒上万采样点,需要人为分帧
时变性一段文本的语义不随阅读速度变化同一句话说快说慢、拖音或吞音,波形差异巨大
环境干扰输入即干净的字符串背景噪声、房间混响(reverberation)、远场拾音、多人重叠说话
个体差异人与人之间用同一套字符音色、口音、语速、情绪、年龄、性别各异——同一个人的感冒前后声音都不同

正因为这些挑战,语音 AI 的进步深度依赖于声学建模(如何从波形中提取与任务相关的模式)和大规模数据(覆盖不同人、不同环境、不同语言)。这也是为什么自监督预训练(self-supervised pretraining,让模型在海量无标注语音上自己学习表征)和语音基础模型成为当前研究前沿——它们让模型从数据中自动习得对噪声、口音、说话人的不变性。

从”听”到”说”的完整技术链路,中间经过语言理解与生成:

2024 年后的趋势是跳过中间的文本中转:多模态大模型直接从声波 token 生成回复声波 token,实现真正的”语音进、语音出”。

增强、分离、识别、翻译、合成、声纹六大任务构成完整语音 AI 生态:前三个任务把”含噪多说话人的声音”变成”干净的文本”,翻译打通跨语言,TTS 负责说出,声纹为每一步提供身份信息:

原始波形不能直接喂给模型——16kHz 采样的 1 秒语音就有 16000 个采样点,信息冗余且维度过高。需要提取紧凑的声学特征。MFCC(Mel-Frequency Cepstral Coefficients,梅尔频率倒谱系数)是经典流程:

每一步背后的直觉:

  1. 预加重(Pre-emphasis):语音信号的高频能量通常远低于低频(声带振动产生的基频能量集中,高频谐波逐渐衰减)。用一个简单的一阶高通滤波器提升高频,使频谱更平坦,有利于后续处理。
  2. 分帧(Framing):语音是非平稳信号(频率成分随时间快速变化),但在 20-40ms 的短窗内可近似视为平稳。因此把波形切成重叠的短帧(如帧长 25ms、步长 10ms),每一帧当作稳态信号分析。
  3. 加窗(Windowing):直接截断波形会产生频谱泄漏(spectral leakage,即一个频率的能量”泄漏”到相邻频率)。乘以汉明窗(Hamming window)让帧两端平滑衰减,减少泄漏。
  4. FFT:对每一帧做快速傅里叶变换,从时域转到频域,得到能量随频率的分布(频谱)。
  5. Mel 滤波器组:这是最关键的一步。人耳对频率的感知是非线性的——对低频的变化非常敏感(几百赫兹的差异就能分辨),对高频则迟钝(几千赫兹的差异才感觉得到)。Mel 刻度(Mel Scale)就是一种模拟这种非线性感知的频率映射:在低频区域滤波器排列密集、分辨率高,在高频区域排列稀疏、分辨率低。经过 Mel 滤波后,特征更贴合人耳实际听到的内容,也更利于区分语音中的音素(如辅音的高频短促特征)。
  6. 对数(Logarithm):人耳对响度的感知近似对数关系(声压翻倍,感知只增加一点)。取对数也压缩了动态范围,使特征对音量变化更鲁棒。
  7. DCT(离散余弦变换):将对数 Mel 频谱去相关(decorrelate),使各维特征尽量独立。保留前 12-13 维系数(低频系数携带主要的声道形状信息,即”说了什么”;高频系数与激励源有关,即”声音特征”),加上能量和对数能量的一阶/二阶差分,通常构成 39 维特征向量。

💡 现代替代方案:深度学习时代,很多模型(如 wav2vec 2.0、Whisper)不再使用手工的 MFCC,而是直接从对数梅尔声谱图(log-mel spectrogram)甚至原始波形学习特征。但 Mel 刻度的思想仍然被保留——它是”人类听觉先验”的工程化结晶。

import librosa # 导入音频分析库
import numpy as np
# 加载音频文件,librosa 自带示例音
y, sr = librosa.load(librosa.ex("trumpet"), sr=22050) # 采样率 22050Hz
print(f"音频时长: {len(y) / sr:.1f} 秒")
# 提取 MFCC 特征(13 维)
mfcc = librosa.feature.mfcc(y=y, sr=sr, n_mfcc=13)
print(f"MFCC 形状: {mfcc.shape}") # (13, 帧数)
# 对系数取均值作为整段音频的特征向量
feat = np.mean(mfcc, axis=1)
print(f"特征向量: {feat.round(2)}")

💡 提示:提取 MFCC 后,每一帧音频被压缩成 13 维向量,后续可作为 ASR 声学模型或声纹分类器的输入。

用 faster-whisper 做实时语音识别(2024 推荐)

Section titled “用 faster-whisper 做实时语音识别(2024 推荐)”
# pip install faster-whisper
from faster_whisper import WhisperModel
# 加载 large-v3 模型,使用 GPU(int8 精度兼顾速度与显存)
model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16")
# 识别音频文件,自动检测语言
segments, info = model.transcribe("audio.wav", beam_size=5)
print(f"检测到语言: {info.language} (概率 {info.language_probability:.2%})")
for segment in segments:
print(f"[{segment.start:.1f}s -> {segment.end:.1f}s] {segment.text}")

💡 faster-whisper 基于 CTranslate2 推理引擎,速度比 OpenAI 官方 Whisper 快 4-8 倍,显存占用更低,是 2024 年部署 Whisper 的工业首选。

  • 语音助手:Siri、小爱同学、小度——“嘿 Siri,明天天气怎么样?“背后就是 ASR + NLU + TTS 全链路。
  • 实时字幕:YouTube、Zoom、钉钉会议自动生成字幕,让跨语言会议和听障人士都能跟上讨论。
  • 有声书:微信读书、Audible 用 TTS 把电子书批量转成自然语音,成本远低于真人录音。
  • 导航语音:高德、百度地图的语音播报,以及”定制语音包”(用明星声音导航)背后是声音克隆技术。
  • 语音搜索:淘宝、微信的语音输入,让不方便打字的场景(开车、做饭)也能轻松操作。
  • AI 实时语音对话:GPT-4o 等多模态大模型原生支持语音输入输出,端到端延迟降至 200-300ms(人类的对话停顿约 200ms),让 AI 语音助手可以像真人一样自然地抢话、被打断、带情绪说话。这是 2024 年语音交互的里程碑——语音不再是 ASR→LLM→TTS 的三级串联,而是在一个模型里直接完成。
  • AI 歌曲生成:Suno v4(2024)和 Udio 只需几句文字描述(风格、情绪、歌词)就能在几十秒内生成带人声的完整歌曲(主歌-副歌-桥段结构),背后是压缩音频 token + 大语言模型生成的组合。这一场景正在重塑独立音乐制作与短视频 BGM 生态。

语音 AI 在 2024-2026 年经历了从”专用任务模型”到”统一基础模型”的范式转移。以下五条主线值得关注:

1. 语音基础模型(Speech Foundation Models)

Section titled “1. 语音基础模型(Speech Foundation Models)”

类比 NLP 中的 BERT/GPT,语音领域也出现了大规模预训练的基础模型:在海量无标注或多语种语音上预训练,再适配到下游任务(ASR、TTS、翻译、分类等)。

  • Meta SeamlessM4T-v2(2023-2024):支持 100+ 语言的语音到语音、语音到文本、文本到语音、文本到文本翻译,单一模型覆盖多方向翻译,质量超过专用级联系统。
  • Google USM(Universal Speech Model,2023):覆盖超过 1000 种语言的语音识别,是目前语种覆盖最广的模型,展示了大规模预训练在低资源语言上的强大泛化能力。
  • OpenAI Whisper large-v3(2023):99 种语言的鲁棒 ASR,开源后成为行业事实标准。

关键思想:这些模型证明了”一个预训练模型 + 轻量微调”可以替代过去针对每个语言/任务单独训练的专用流水线。

不再区分 ASR 模型、TTS 模型、翻译模型——一个模型同时做理解(听)和生成(说):

  • Voxtral(Mistral AI,2025):开源多模态 LLM,原生抽入音频、抽出音频,统一处理 ASR、语音问答、声音理解。
  • Spirit-LM(Meta,2024):在语言模型中交替建模文本 token 和语音 token,让模型既能”读”文字也能”说”话,甚至保持语气和情感。
  • Moshi(Kyutai,2024):首个开源的全双工实时语音对话模型——可以同时听和说,不需要”说完再回复”的半双工等待。

GPT-4o(OpenAI,2024)是多模态 LLM 原生支持语音的标志性产品:

  • 原生语音输入输出:不再依赖外部 ASR/TTS 模块,语音直接作为模态进入模型。
  • 超低延迟:端到端响应延迟约 320ms(其中语音约 232ms),接近人类对话的反应速度,支持自然打断。
  • 情感与风格:能带笑声、耳语、唱歌等丰富表达,远超传统 TTS 的”播报腔”。

这一路线的核心创新是将语音离散化为 token,让 LLM 可以像处理文字一样”读”和”写”音频。

4. 神经编解码器(Neural Audio Codecs)

Section titled “4. 神经编解码器(Neural Audio Codecs)”

要让 LLM 处理音频,必须先把连续波形压缩成离散 token——这就是神经编解码器的任务:

  • SoundStream(Google,2021):开创性地用残差矢量量化(Residual Vector Quantization, RVQ)将音频压缩为多层离散码本,在低码率(1.5-12 kbps)下保持高保真度。
  • EnCodec(Meta,2022):开源、高效,成为众多语音 LLM 的音频 token 化标准方案。将 24kHz 音频压缩到约 75 token/秒。
  • Mimi(Kyutai,2024):Moshi 使用的编解码器,只用 12 个码本(EnCodec 通常用 8-32 个)就实现了高质量重建,大幅降低了 LLM 处理音频的序列长度,是实现全双工低延迟的关键。

编解码器的意义:它们是音频进入大模型世界的”网关”——有了离散 token,音频就能像文本一样被 Transformer 自回归生成,一切语音任务(ASR、TTS、翻译、声音克隆、音乐生成)都可以用同一个生成框架统一。

2024 年,一批高质量开源 TTS 涌现,让个人开发者也能部署接近商业水准的语音合成:

模型团队技术亮点
F5-TTS上海交大(2024)基于 Flow Matching(流匹配)的零样本 TTS,只需 10 秒参考音频即可克隆音色,无需微调
CosyVoice阿里通义(2024)多语言零样本 TTS,支持跨语言克隆和指令控制(“用悲伤的语气说”)
ChatTTS社区(2024)专为对话场景设计,支持笑声、停顿等口语化细粒度控制
GPT-SoVITS社区(2024)结合 GPT 与 VITS,1 分钟数据微调即可实现高质量声音克隆,中文社区最流行
类库语言说明
librosaPython音频分析经典库,提供特征提取、可视化、音乐分析全套工具
torchaudioPythonPyTorch 官方音频库,提供数据集加载、变换和 GPU 加速的频谱操作
HuggingFace TransformersPython一站式调用 Whisper(ASR)、Bark/VITS(TTS)等预训练语音模型
ESPnetPython端到端语音处理工具包,覆盖 ASR/TTS/语音翻译/语音增强全链路
KaldiC++/Shell经典 HMM 时代语音识别工具包,工业级流水线标杆
gTTSPythonGoogle Translate 的 TTS 接口,几行代码即可把文本转成语音
faster-whisperPython基于 CTranslate2 的高性能 Whisper 推理引擎,比官方实现快 4-8 倍,2024 年部署首选
WhisperXPythonWhisper + 强制对齐 + 说话人分离,提供精确时间戳与多人转写
Coqui TTSPython开源 TTS 工具包,支持 VITS、XTTS 等模型,适合本地部署与声音克隆
术语英文解释
采样率Sample Rate每秒对声波采样的次数,常见 16000Hz(语音)或 22050/44100Hz(音频)
梅尔频率倒谱系数MFCC模拟人耳非线性频率感知的经典语音特征,广泛用于 ASR 和声纹识别
声谱图Spectrogram音频信号在时频域上的二维能量分布(频率 × 时间),是语音模型的常见输入
梅尔刻度Mel Scale一种与人耳感知线性对应的频率刻度,低频分辨率高、高频分辨率低
音素Phoneme语言中区分词义的最小语音单位,如汉语拼音的声母韵母
声码器Vocoder把声学特征(如梅尔声谱图)转为可听波形的模块,如 WaveNet、HiFi-GAN
端到端End-to-End用单一神经网络从原始输入直接输出最终结果,省去多阶段流水线
神经编解码器Neural Audio Codec将连续音频压缩为离散 token 的神经网络,如 EnCodec、SoundStream,使音频能被语言模型处理
残差矢量量化RVQ多层级联的矢量量化方法,逐层编码前一层残差,用少量码本高效压缩音频
自监督预训练Self-Supervised Pretraining在无标注数据上让模型自己学习表征的预训练范式(如掩码预测),语音领域的 wav2vec 2.0 是代表
全双工Full-Duplex通信中双方可同时发送和接收——在语音 AI 中指模型能同时听和说,实现自然打断
零样本Zero-Shot无需针对特定说话人或语言微调,仅凭参考音频直接完成任务(如零样本声音克隆)
  • HMM 语音识别经典教程:Rabiner, L. R. (1989). A Tutorial on Hidden Markov Models and Selected Applications in Speech Recognition. Proceedings of the IEEE. —— 统计语音识别时代的”圣经”,引用超 3 万次。
  • 深度学习语音识别:详见 语音识别 ASR 中的 CTC、Whisper 等关键论文。
  • 深度学习语音合成:详见 语音合成 TTS 中的 Tacotron 2、VITS 等关键论文。
  • SeamlessM4T:Seamless Communication et al. (2023). SeamlessM4T—Massively Multilingual & Multimodal Machine Translation. arXiv:2308.11559. —— Meta 的统一多语言语音翻译模型。
  • EnCodec:Défossez, A. et al. (2022). High Fidelity Neural Audio Compression. arXiv:2210.13438. —— 神经编解码器的代表作,语音 LLM 的音频 token 化基础。
  • Moshi:Défossez, A. et al. (2024). Moshi: A Speech-Text Foundation Model for Real-Time Dialogue. arXiv:2410.00037. —— Kyutai 的全双工实时语音对话模型。
  • 音乐与视频生成:语音之外,AI 还能直接生成音乐和视频,见 AI 音乐生成 与 AI 视频生成。