语音分离与降噪
语音分离与降噪是音频处理的核心任务。本页从经典信号处理方法(谱减法、Wiener 滤波)讲到深度学习方案(DCCRN、Conv-TasNet、SepFormer、Demucs),覆盖语音增强、说话人分离、回声消除三大方向,并追踪到 2024-2026 年的最新 SOTA 模型(TF-GridNet、BS-RoFuFormer、Apollo 等)。前置阅读:音频增强概述、自动语音识别 ASR。
你在嘈杂的咖啡馆打电话——手机麦克风同时收到你的声音、咖啡机噪音、旁边人的谈话。你的耳朵能轻松分辨出这些声音,但麦克风做不到。这就是经典的鸡尾酒会问题(Cocktail Party Problem):如何从混合信号中分离出目标声源。
人类之所以能解决鸡尾酒会问题,依赖的是双耳时间差(Interaural Time Difference, ITD)、双耳强度差、头部传递函数(Head-Related Transfer Function, HRTF)以及大脑对语音模式的高级语义先验。机器没有这两只”耳朵”和大脑的推理能力,只能从单通道或多通道的混合波形中寻找统计规律。
解决这个问题的思路经历了四个阶段:
- 信号处理(1960s-2010s):用数学公式分析频谱——噪音的频谱通常是稳定的,人声的频谱快速变化。用 Wiener 滤波等方法把”稳定”的部分压下去。像是在一张图上擦掉背景色,保留前景物体。代表作:谱减法、Wiener 滤波、统计模型方法(MMSE / LogMMSE)。
- 时频掩蔽(2015-2020):用深度网络在时频图(Spectrogram,由 STFT 得到)上学习一个掩码(mask),决定每个时频 bin(time-frequency bin,即频谱图上的一个像素格)属于目标还是噪声,然后乘回原信号。像是用一支智能橡皮擦精准擦除指定区域。
- 端到端波形建模(2018-至今):直接在波形域(或学习到的表示域)做分离,跳过 STFT 的限制。像是不经过中间格式,直接从原始像素生成干净图像。代表作:Conv-TasNet、Demucs。
- 时频联合 Transformer(2022-至今):将分离建模为三维张量(时间×频率×通道)的处理,用 Transformer 自注意力同时捕捉时域和频域的长程依赖。代表作:TF-GridNet、BS-RoFuFormer、SepFormer。这是当前(2024-2026)的前沿方向。
经典语音增强
Section titled “经典语音增强”谱减法(Spectral Subtraction):假设语音存在时频谱是变化的、而噪声频谱是相对稳定的。在无语音段(前导静音或停顿)估计噪声频谱的均值,然后从含噪频谱中减去噪声频谱。数学形式为:
其中 是含噪信号的功率谱, 是估计的噪声功率谱, 是过减因子(over-subtraction factor)。减完后还需重建相位(通常复用含噪信号的相位),再做逆 STFT 得到增强波形。问题:减得太多会产生”音乐噪声”(musical noise)伪影——频谱上随机出现孤立的窄峰,听感上像水滴声或鸟鸣声。
Wiener 滤波:从统计最优角度出发,寻找一个滤波器 H(f) 使得输出信号与纯净信号的均方误差(Mean Squared Error, MSE)最小。最优解为:
其中 是语音的功率谱密度(Power Spectral Density, PSD), 是噪声的功率谱密度。直觉上:信噪比高的频段(语音强于噪声,)中 ,几乎全保留;信噪比低的频段()中 ,几乎全衰减。Wiener 滤波本质上是谱减法的优化版本,在 MMSE(Minimum Mean Square Error,最小均方误差)意义下最优。实际使用时需要对 和 做估计(如用语音活动检测 Voice Activity Detection, VAD 分段估计噪声谱)。
深度学习语音增强:DCCRN
Section titled “深度学习语音增强:DCCRN”DCCRN(Deep Complex Convolutional Recurrent Network)是深度学习增强的代表作。关键创新是复数域处理:
- 传统方法只处理 STFT 的幅度谱(magnitude spectrum,即复数的模),丢弃相位信息(phase,即复数的辐角)。但相位对语音质量至关重要——人耳对相位失真非常敏感,相位重建不准会导致语音”含糊”或”发闷”。
- DCCRN 用复数卷积(complex-valued convolution)同时处理实部和虚部,保留完整的复频域信息。复数卷积的定义为:若输入为
(a + bi),卷积核为(c + di),则输出为(ac − bd) + (ad + bc)i——即实部和虚部在乘法中交叉耦合,比分开处理更完整地建模了频域的旋转与缩放。 - 编码器-解码器结构:编码器逐层下采样提取深层特征,CRN(卷积循环网络,Convolutional Recurrent Network)在中间用 LSTM 做时序建模,解码器逐层上采样恢复频域掩码。
- 输出一个复数掩码(complex mask),与输入复频谱逐元素相乘后做逆 STFT(Inverse STFT, ISTFT)得到增强后的波形。复数掩码可以同时调整幅度和相位,而实数掩码只能调整幅度。
语音分离:鸡尾酒会问题
Section titled “语音分离:鸡尾酒会问题”当混合信号中有多个说话人(不是单纯噪声),需要做说话人分离(speaker separation)。
排列不变训练(PIT)的数学直觉
Section titled “排列不变训练(PIT)的数学直觉”核心难点是排列不变性(Permutation Invariant Training, PIT):网络输出多路分离信号,但不知道哪一路对应哪个说话人。
具体来说,假设混合信号中有 2 个说话人 A 和 B,网络有 2 个输出通道。理想情况下,输出通道 1 应该对应说话人 A、通道 2 对应说话人 B,但也可能恰好反过来。在训练初期,网络随机初始化,两种对应关系都可能。如果固定用”通道 1 → 说话人 A,通道 2 → 说话人 B”来计算损失,但网络当前恰好把 B 放在通道 1,梯度就会告诉网络”你错了”——可实际上是标签分配的问题,不是网络分离能力的问题。这会导致训练在两种排列之间反复震荡,无法收敛。
PIT 的解法:在每一步枚举输出与标签之间所有可能的排列组合,计算每种排列下的总损失,取最小的那个用于反向传播。对 2 个说话人,排列有 2! = 2 种:
对 N 个说话人,排列有 N! 种(3 人就是 6 种,4 人是 24 种,5 人是 120 种……)。因此在说话人数量较多时,PIT 的计算开销会急剧增长。后续工作(如 uPIT,utterance-level PIT)将排列对齐从帧级别提升到整句级别(一段语音只确定一次最优排列),降低了开销并提升了训练稳定性。
PIT 之后,语音分离模型的输出通道是匿名的——你不知道通道 1 是”张三”还是”李四”,只知道它是”某一个说话人”。要确定具体身份,还需要接一个说话人识别(Speaker Identification)模块。
Conv-TasNet:为什么超越 STFT 方案
Section titled “Conv-TasNet:为什么超越 STFT 方案”Conv-TasNet(2019) 是时域分离的里程碑,在 WSJ0-2mix 基准上首次用纯时域方法超越了基于 STFT 的方案。其核心设计有三点:
- 学习的编码器(Learnable Encoder)替代固定 STFT:STFT 使用固定的正弦/余弦窗函数作为基函数(basis function),这些基函数是为通用信号分析设计的,并非针对语音分离优化。Conv-TasNet 用一个一维卷积层(kernel size = 2ms ≈ 32 samples @16kHz,stride = 16 samples)作为编码器,其卷积核权重在训练过程中学习。网络可以自动学出一组比 STFT 更紧凑、更针对语音特征的基函数——学到的滤波器往往呈现出类似不同频率响应的带通滤波器形状,但能自适应地编码对分离最有用的信息。
- 直接在时域操作避免了相位重建问题:STFT 方案在分离后需要从幅度谱重建波形,但分离掩码只调整了幅度、相位往往直接复用混合信号的相位——这在多说话人场景下是不准确的(混合相位不等于任何单一说话人的相位)。Conv-TasNet 的编码器-解码器都是可学习的线性变换,掩码后的表示直接通过转置卷积(解码器)映射回波形,相位信息隐含在学习到的变换中,无需显式重建。
- TCN(Temporal Convolutional Network)分离网络:堆叠多层一维膨胀卷积(dilated convolution,即卷积核中插入间隔来扩大感受野,类似于 DeepLab 中的空洞卷积),膨胀因子按 1, 2, 4, 8, … 指数增长。这使得网络在较小的参数量下获得非常大的时间感受野(覆盖约数百毫秒的语音上下文),足够区分不同说话人的时间模式。每个说话人共享同一个 TCN,但输出各自的掩码。
SepFormer:用 Transformer 做分离
Section titled “SepFormer:用 Transformer 做分离”SepFormer(2020) 用 Transformer 替代 Conv-TasNet 中的 TCN 分离网络:
- Transformer 的自注意力(Self-Attention)机制可以直接建模任意两个时间步之间的依赖,不受卷积的感受野限制。对语音分离而言,这能更好地捕捉长时间的语音连续性(如一个人说了一个长句子)以及说话人间的交互模式。
- SepFormer 采用双路 Transformer(dual-path 思想):一部分 Transformer 跨时间维度做注意力(建模同一说话人在时间上的连续性),另一部分跨”块”维度做注意力(建模不同说话人之间的区分性)。
- 这种结构在 WSJ0-2mix 上达到了 SI-SDR 约 22.3 dB 的性能(Conv-TasNet 约 15 dB 量级),长期保持 SOTA。
回声消除(AEC)
Section titled “回声消除(AEC)”视频通话中,远端说话人的声音从扬声器播放出来,又被你的麦克风收进去,远端就会听到自己的回声。回声消除的目标是:参考远端信号(扬声器播放的信号),从麦克风信号中减去回声成分。
- 自适应滤波器(LMS / NLMS):经典方法,用自适应滤波器(Least Mean Square / Normalized LMS)估计扬声器到麦克风的传递函数(Room Impulse Response, RIR),然后从麦克风信号中减去估计的回声。NLMS 每一步根据误差信号更新滤波器权重,能适应环境变化。难点是回声路径会随房间布局、头部位移而变化,需要持续自适应。
- 深度学习 AEC:微软等公司用神经网络替代经典滤波器,输入远端参考信号和近端麦克风信号,输出回声消除后的干净信号。网络能隐式地学习非线性的扬声器失真(廉价扬声器在小音量时的非线性很严重,经典线性滤波器处理不了)。在 Microsoft AEC Challenge(Interspeech 2021/2022)上推动了大量创新,参赛模型普遍采用 CRN 结构 + 复数域处理。
音乐分离:Demucs
Section titled “音乐分离:Demucs”Demucs 是 Meta 为音乐源分离(Music Source Separation,从完整歌曲中分离出人声 vocals、鼓 drums、贝斯 bass、其他 other 四个声轨)设计的混合域模型:
- 同时在波形域和频谱域做处理,结合两者的优势——波形域保留相位、频谱域提供清晰的频率结构。
- U-Net 结构:编码器逐层下采样提取深层特征,解码器逐层上采样重建波形,中间用跳跃连接(skip connection)保留细节。
- 时间膨胀卷积:在最低分辨率处用膨胀卷积扩大感受野,捕捉长距离依赖。
Demucs v4 / HTDemucs(Hybrid Transformer Demucs,2023-2024) 是当前版本,引入了 Transformer:
- 在 U-Net 的瓶颈层(bottleneck)插入 Transformer 模块,用自注意力建模音乐中的长程结构(如一段主歌到副歌的过渡)。
- 混合时频域 Transformer 架构同时处理波形和频谱表示,在 MUSDB18-HQ 基准上长期保持 SOTA,至今仍是音乐分离的标杆。
- 轻量化方面,Meta 还提供了 Demucs 的量化版本和 ONNX 导出,便于在消费级 CPU 上实时运行。
2024-2026 最新进展
Section titled “2024-2026 最新进展”语音分离领域在 2024-2026 年出现了几个重要趋势:
TF-GridNet(2024)
Section titled “TF-GridNet(2024)”Mitsubishi Electric 提出的**时频网格网络(Time-Frequency GridNet)**将分离建模为三维张量(时间 × 频率 × 通道)的处理:
- 传统方法要么沿时间轴建模(如 Conv-TasNet 的 TCN),要么沿频率轴建模,而 TF-GridNet 用三维交织的自注意力同时捕捉时间、频率和通道三个维度的依赖关系。
- 具体地,每个 GridNet 块包含三个子模块:帧内(intra-frame)频域注意力、帧间(inter-frame)时域注意力、以及通道维度的混合。这种”三明治”结构让模型能利用语音的谐波结构(同一基频在不同倍频上的能量关联)。
- 在 WSJ0-2mix、WSJ0-3mix 等基准上取得 SOTA,SI-SDR 超过 23 dB。
BS-RoFuFormer(2024)
Section titled “BS-RoFuFormer(2024)”Band-Split RoPEFormer 将频谱分成多个子带(sub-band,即将频谱切成若干频段)分别处理,然后融合:
- 动机是语音信号在不同频段有不同特性(低频能量集中、高频包含辅音细节),统一处理不够精细。
- “RoFu”指旋转位置编码(Rotary Position Embedding, RoPE)用于频率维度,让模型感知频率的相对位置关系。
- 在语音分离、语音增强、目标说话人提取(Target Speaker Extraction, TSE)等多个任务上都表现优异。
Apollo(2024)
Section titled “Apollo(2024)”专为实时语音分离设计的轻量模型:
- 面向实时通信(RTC)场景:视频通话、在线会议中需要极低延迟(通常 < 20ms 算法延迟)的分离方案。
- 用线性循环(linear recurrent)结构替代自注意力,保持恒定的每帧计算量,不受输入长度影响。
- 在 causality(因果性,即只用过去信息、不看未来帧)约束下仍能达到接近非实时模型的分离质量,适合部署到手机和边缘设备。
Bandit(2024)
Section titled “Bandit(2024)”基于 Band-Split 的多声源分离框架:
- 将频谱分带后,用交叉注意力(cross-attention)让不同子带之间交换信息,建模频带间的谐波关联。
- 支持灵活的声源数量,不限定于固定人数的分离。
- 在音乐分离和语音分离上均有应用。
Demucs v4 / HTDemucs 持续演进(2023-2024)
Section titled “Demucs v4 / HTDemucs 持续演进(2023-2024)”Meta 的混合时频域 Transformer 音乐分离模型仍然是音乐分离的标杆:
- HTDemucs 在 MUSDB18-HQ 上 SDR(Signal-to-Distortion Ratio,信号失真比)约 8.5 dB(人声)和 9 dB(鼓),是目前开源方案中最优的。
- 社区出现了多种微调变体,针对特定音乐风格(如古典、电子)做适配。
音乐分离基准更新
Section titled “音乐分离基准更新”- MUSDB18-HQ:MUSDB18 的高质量版本,采样率 44.1kHz(原版压缩过),包含 150 首完整歌曲的分离 stems,是音乐分离的标准评测集。
- MoisesDB:2023-2024 年发布的新基准,覆盖更多曲风和录音条件,比 MUSDB18-HQ 更多样化。
语音分离技术的发展阶段
Section titled “语音分离技术的发展阶段”Conv-TasNet 分离流程
Section titled “Conv-TasNet 分离流程”TF-GridNet 三维处理示意
Section titled “TF-GridNet 三维处理示意”用 noisereduce 做经典谱降噪
Section titled “用 noisereduce 做经典谱降噪”# pip install noisereduce librosa soundfileimport noisereduce as nrimport librosa, soundfile as sf
# 加载含噪音频audio, sr = librosa.load("noisy.wav", sr=16000)
# stationary 模式:估计稳定噪声并减去clean_stationary = nr.reduce_noise(y=audio, sr=sr, stationary=True)
# 非稳定模式:用自适应频谱门限(效果通常更好)clean_nonstationary = nr.reduce_noise(y=audio, sr=sr, stationary=False, prop_decrease=0.8)sf.write("clean.wav", clean_nonstationary, sr)print(f"降噪完成,降噪前后长度一致: {len(audio) == len(clean_nonstationary)}")用 SpeechBrain 做说话人分离(SepFormer)
Section titled “用 SpeechBrain 做说话人分离(SepFormer)”# pip install speechbrain torch torchaudiofrom speechbrain.inference.separation import SepformerSeparation as separatorimport torchaudio
# 加载预训练 SepFormer(专为 2 说话人分离训练)model = separator.from_hparams(source="speechbrain/sepformer-wsj02mix")mix, sr = torchaudio.load("two_speakers.wav")# 模型要求 8kHz 采样率if sr != 8000: mix = torchaudio.functional.resample(mix, sr, 8000)
est_sources = model.separate_batch(mix) # 输出两路分离信号torchaudio.save("speaker_1.wav", est_sources[:, :, 0].cpu(), 8000)torchaudio.save("speaker_2.wav", est_sources[:, :, 1].cpu(), 8000)print("分离完成,已保存两个说话人的音频")用 Demucs 做音乐分离(一行命令)
Section titled “用 Demucs 做音乐分离(一行命令)”# 安装:pip install demucs# 命令行一行分离(推荐,自动下载 HTDemucs v4 权重):# demucs --two-stems vocals song.mp3 # 只分人声/伴奏# demucs song.mp3 # 分出 vocals/drums/bass/other
# Python API 方式:import torch, torchaudiofrom demucs.pretrained import get_modelfrom demucs.apply import apply_model
model = get_model("htdemucs") # 加载 HTDemucs v4model.cpu()wav, sr = torchaudio.load("song.wav") # 录音采样率建议 44.1kHzif sr != model.sampler_rate: import torchaudio.functional as F wav = F.resample(wav, sr, model.sampler_rate)if wav.dim() == 2: # 补齐到 (batch, channels, samples) wav = wav.unsqueeze(0)
sources = apply_model(model, wav) # 输出 (batch, n_sources, channels, samples)labels = ["drums", "bass", "other", "vocals"]for i, name in enumerate(labels): torchaudio.save(f"{name}.wav", sources[0, i].cpu(), model.sampler_rate)print("音乐分离完成:drums / bass / other / vocals 四轨已保存")- 实时降噪用 RNNoise 或 DCCRN 的轻量版:WebRTC 中内置的 RNNoise 用 GRU(Gated Recurrent Unit,一种轻量循环网络)实现超低延迟(约 10 毫秒)实时降噪,适合视频通话。微软 Teams 用深度学习 AEC + 降噪组合。
- 分离任务要注意 PIT 训练:做多说话人分离时必须用排列不变训练,否则模型无法收敛。大多数开源框架(Asteroid、SpeechBrain)已内置 PIT。注意说话人数超过 4-5 人时 N! 排列开销大,可考虑目标说话人提取(TSE)这类定向方案。
- 评估指标用 SI-SDR:尺度不变信噪比(Scale-Invariant SDR,对幅度缩放不敏感的 SDR 变体)是语音分离的标准评估指标,比传统 SNR 更合理。SI-SDR 计算时先对估计信号做最优尺放对齐,再计算残差能量比,公式为 。详见音频增强概述。
- 采样率要匹配模型:Conv-TasNet、SepFormer 等模型通常在 8kHz 或 16kHz 上训练,使用前务必重采样到匹配的采样率。
- 音乐分离首选 Demucs:从歌曲中分离人声、鼓、贝斯、其他,用 HTDemucs(Demucs v4)效果最好。
pip install demucs后一行命令即可:demucs song.mp3(自动下载模型)。只需人声/伴奏两轨时加--two-stems vocals更快。 - 追求最新 SIDA 可试 TF-GridNet / BS-RoFuFormer:这两类模型在 WSJ0-2mix 等学术基准上当前最优,但参数量和计算量较大,实时部署需配合蒸馏或量化。
- 实时分离选 Apollo:如果目标是 RTC 场景(延迟 < 20ms),Apollo 这类因果线性循环模型比 SepFormer / TF-GridNet 更合适。
- AEC 的难点是双讲场景:当双方同时说话时(double-talk),既要保留近端语音又要消除远端回声,经典方法容易出错,深度学习方案明显更优。
- 视频会议降噪与 AEC:Zoom、Teams、腾讯会议内置 AI 降噪和回声消除,在嘈杂环境中保持通话清晰。微软的 AEC Challenge 推动了这一领域的工业落地。新一代方案(如 Apollo 实时分离)正在进入消费级会议软件。
- 助听器:现代助听器用深度学习降噪帮助听障人士在嘈杂环境中听清目标语音,cochlear 植入体也在引入这些技术。Edge AI 芯片(如专用 DSP)使得在毫瓦级功耗下跑深度分离模型成为可能。
- 播客与影视后期:用 Demucs / HTDemucs 从老录音中分离人声和噪声、从电影中提取清晰对白、做卡拉 OK 伴奏分离。
- 语音识别前端处理:在 ASR 前加一级降噪或分离模块可以显著降低词错率(Word Error Rate, WER),尤其在远场和嘈杂场景。详见Whisper 与 wav2vec2。
- 音乐制作与教学:用 Demucs 把商业歌曲拆成各乐器声轨,用于混音参考、扒谱教学、采样制作;MoisesDB 等基准推动了专用模型的研发。
- 监听与安防:多说话人场景下的智能麦克风阵列分离,用于安防监控和会议记录。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| noisereduce | Python | 轻量级频谱降噪库,两行代码完成经典谱减法降噪 |
| SpeechBrain | Python | 通用语音工具包,提供 SepFormer 等分离模型的预训练权重 |
| Asteroid | Python | 基于 PyTorch 的音频分离框架,含 Conv-TasNet、DPRNN、DPTNet 等主流模型 |
| Demucs / HTDemucs (Meta) | Python | 音乐分离首选工具,从歌曲中分离人声/鼓/贝斯/其他 |
| RNNoise | C | Jean-Marc Valin 的超低延迟实时降噪,WebRTC 标配 |
| DeepFilterNet | Python / Rust | 轻量级深度降噪网络,可在 CPU 上实时运行,适合边缘设备 |
| TF-GridNet | Python | Mitsubishi 的时频网格分离网络,学术 SOTA(需自行复现或找开源实现) |
| Apollo | Python | 专为实时通信设计的轻量因果语音分离模型 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 鸡尾酒会问题 | Cocktail Party Problem | 从多人混合语音中分离出各个说话人声音的经典难题 |
| 语音增强 | Speech Enhancement | 从含噪语音中去除噪声,提升目标语音清晰度 |
| 语音分离 | Speech Separation | 从混合信号中分离出多个目标声源 |
| 音乐源分离 | Music Source Separation | 从完整歌曲中分离出人声、鼓、贝斯等各声轨 |
| 谱减法 | Spectral Subtraction | 从含噪频谱中减去估计的噪声频谱的经典方法 |
| Wiener 滤波 | Wiener Filter | 在 MMSE 意义下最优的线性滤波器,用于降噪 |
| 排列不变训练 | PIT (Permutation Invariant Training) | 解决分离任务中输出与标签对应关系不确定的训练策略,枚举 N! 种排列取最小损失 |
| 时频掩码 | Time-Frequency Mask | 决定每个时频单元属于哪个声源的权重矩阵 |
| 复数掩码 | Complex Mask | 同时调整幅度和相位的复数值掩码 |
| SI-SDR | Scale-Invariant SDR | 语音分离的标准评估指标,对幅度缩放不敏感 |
| 回声消除 | AEC (Acoustic Echo Cancellation) | 从麦克风信号中去除远端扬声器播放的回声成分 |
| 双讲 | Double-talk | 通话双方同时说话的场景,AEC 最具挑战的情况 |
| 复数网络 | Complex-Valued Network | 同时处理复数的实部和虚部的神经网络,保留相位信息 |
| 膨胀卷积 | Dilated Convolution | 卷积核中插入间隔以扩大感受野,不增加参数量 |
| 子带 | Sub-band / Band-Split | 将频谱分成多个频段分别处理的技术 |
| 因果模型 | Causal Model | 只使用当前及过去信息、不依赖未来帧的实时模型 |
| 目标说话人提取 | TSE (Target Speaker Extraction) | 给定目标说话人特征(如声纹),从混合信号中只提取该说话人 |
- Luo & Mesgarani, “Conv-TasNet: Surpassing Time-Frequency Magnitude Masking for Speech Separation” (IEEE TASLP 2019):Conv-TasNet 论文,首次用纯时域方法超越基于 STFT 的分离方案,里程碑式工作。
- Hu et al., “DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement” (Interspeech 2020):DCCRN 论文,复数域深度学习降噪的代表作。
- Subakan et al., “Attention is All You Need in Speech Separation” (ICASSP 2021):SepFormer 论文,将 Transformer 自注意力引入语音分离。
- Yu et al., “Permutation Invariant Training” / Kolbæk et al., “Multitalker Speech Separation with Utterance-Level Permutation Invariant Training” (ICASSP 2017):PIT / uPIT 论文,排列不变训练的奠基工作。
- Wang et al., “TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation” (IEEE TASLP 2024):TF-GridNet 论文,三维时频网格建模,当前 WSJ0-2mix SOTA。
- Liu et al., “BS-RoFuFormer: Band-Split Rotary Position Embedding Transformer for Speech Separation” (2024):BS-RoFuFormer,子带 + RoPE 的分离架构。
- Rouard et al., “Hybrid Transformers for Music Source Separation” (ICASSP 2023):HTDemucs / Demucs v4 论文,Meta 的混合域 Transformer 音乐分离模型。
- Stoter et al., “Open-Unmix - A Reference Implementation for Music Source Separation” (Journal of Open Source Software 2019):音乐分离开源工具,Demucs 的对比参考。
- Microsoft, “Acoustic Echo Cancellation Challenge” (Interspeech 2021/2022):微软 AEC 挑战赛系列论文,推动了深度学习 AEC 的工业落地。
- Mitsubishi Electric, “TF-GridNet” 项目页 / Asteroid 生态:跟踪最新的分离模型开源实现与基准排名。