Command Palette
Search for a command to run...
语音增强 Speech Enhancement
语音增强是一种旨在通过抑制噪声、混响和干扰来改善退化语音信号的技术框架,主要用于解决复杂声学环境中因信号污染导致的「语音可懂度与自然度受损」问题。该架构广泛涵盖了语音恢复、目标说话人提取、语音分离和噪声抑制等核心任务,在滤除背景杂音的同时精准保留了原始语音的声学特征。研究成果表明,现代语音增强有效打破了传统统计滤波器的性能瓶颈,不仅显著提升了人类的听觉体验,更作为自动语音识别(Automatic Speech Recognition)与音频理解(Audio understanding)的完美补充;在助听设备、远程会议和复杂环境语音交互等场景中,使系统以极高的鲁棒性实现了清晰的语音捕获与解析。
语音增强(Speech Enhancement)技术起源于 20 世纪 70 年代末的信号处理研究,其中一个关键里程碑是 1979 年犹他大学学者 Steven F. Boll 发表的论文《Suppression of Acoustic Noise in Speech Using Spectral Subtraction》(IEEE Transactions on Acoustics, Speech, and Signal Processing, vol. 27, no. 2, pp. 113-120),他在其中提出利用语音无声段实时估计平稳背景噪声谱,并从带噪信号的短时傅里叶幅度谱中直接扣除噪声成分来实现增强,这一高效的谱减法范式为后续研究奠定了实用基础。
在此基础上,1984 年 Y. Ephraim 和 D. Malah 发表了另一篇里程碑论文《Speech enhancement using a minimum-mean-square-error short-time spectral amplitude estimator》(IEEE Trans. Acoust., Speech, Signal Process., vol. 32, no. 6, pp. 1109-1121),他们假设谱分量为高斯随机变量,通过最小均方误差准则推导短时谱幅度估计器,有效平衡了噪声抑制与语音失真。 1990 年代中期,Ephraim 与 H. L. Van Trees 进一步引入信号子空间方法,将带噪信号分解为信号和噪声正交子空间并进行投影滤波,提升了低信噪比环境下的性能。
中国科学技术大学(USTC)与佐治亚理工学院(Georgia Tech)的研究人员于 2014 年 9 月正式确立了基于深度学习的回归范式,相关代表性研究成果发表于音频与声学处理领域的里程碑论文《A Regression Approach to Speech Enhancement Based on Deep Neural Networks》,他们将语音增强抽象为深度神经网络的回归问题,利用 DNN 直接学习带噪谱到干净谱的隐式映射,突破了传统统计假设的局限,推动了 AI 时代语音增强的快速发展。这些工作共同构成了从经典谱处理向数据驱动智能系统的完整演进,已广泛应用于助听器、语音识别和实时通信等领域。