
一、降噪 45-90dB这个区间的读法AU-60 的规格里AI 智能降噪写的是 45-90dB。这类区间标注在语音处理模块里很常见但它的含义经常被误解为可调范围——好像有一个旋钮往上拧就是 90dB往下拧就是 45dB。实际上降噪深度不是一个可以自由设定的独立变量。它与语音失真之间存在一条确定的折中曲线任何单通道降噪算法都在这条曲线上取点无法同时把两端都做好。理解这条曲线的形状比记住 45 和 90 这两个数字更有用。二、单通道降噪的基本约束先把问题形式化。麦克风拾取的信号 y(n) s(n) d(n)其中 s 是语音、d 是噪声。降噪的任务是从 y 恢复 s。在频域上绝大多数方法谱减、维纳滤波、以及神经网络方法都可以归结为对每个时频单元 (t,f) 估计一个增益 G(t,f) ∈ [0,1]输出 Ŝ(t,f) G(t,f)·Y(t,f)。理想情况下G 应该等于 |S|²/(|S|²|D|²)即所谓的维纳增益。问题在于 |S| 和 |D| 都未知只能估计。估计误差有两个方向G 估计偏小该保留的语音成分被压低 → 语音失真、发闷、辅音丢失G 估计偏大该压制的噪声被保留 → 残余噪声、音乐噪声这里有一个结构性的不对称噪声抑制量的提升必然伴随更多时频单元被赋予小 G 值而估计误差是存在的被误判的语音单元也会被压小。所以抑制更深和语音更完整在同一算法框架下是此消彼长的。三、折中曲线的三个区段把降噪深度作为横轴、语音质量作为纵轴实际系统的表现大致分三段。第一段0 ~ 20dB几乎无代价这一段抑制的主要是稳态噪声中能量最集中、与语音频谱重叠最少的部分——低频的空调隆隆声、电源工频干扰、风扇的窄带分量。这些成分在时频图上和语音的重叠度低压制它们几乎不影响语音。这一段是白送的。第二段20 ~ 45dB代价可控继续深入开始触及与语音有部分重叠的噪声。此时语音的低能量成分句间弱音、共振峰之间的谷会受到一些影响但主要的语音结构共振峰峰值、基频谐波仍然完好。主观听感是背景明显变干净人声基本不变。规格里的 45dB 这个下界大致对应的就是这一段的末端——一个可以在多数工况下稳定达到、且副作用不明显的工作点。第三段45 ~ 90dB失真快速上升要再往下压 45dB必须对大量时频单元施加很小的增益。此时被牺牲的包括清辅音/s/、/f/、/ʃ/、/th/ 这些擦音是宽带类噪声信号能量低且频谱平坦与噪声在统计上极为相似。深度降噪几乎必然会把它们一起压掉。这是降噪开太狠就听不清四和十的技术原因。语音起止的瞬态塞音的爆破段/p/、/t/、/k/持续时间只有 5~20ms短于多数算法的判决时间常数容易被当作冲击噪声处理掉。句尾气声与呼吸能量低、随机性强最容易被判为噪声。丢掉它们后语音听起来被切断不自然。换句话说90dB 这个上界描述的是算法在最有利工况下的能力上限噪声稳态、信噪比高、噪声与语音频谱分离好而不是日常工作点。四、为什么神经网络方法改变了曲线形状但没有取消它AU-60 用的是深度学习方法。相对传统谱减/维纳滤波神经网络的优势在哪传统方法依赖统计假设噪声是短时平稳的、语音与噪声不相关、噪声谱可以在语音间隙估计。这些假设在稳态噪声下成立在敲击、鸣笛、金属碰撞这类非稳态噪声下全部失效——噪声谱来不及估计噪声就已经过去了。神经网络不做平稳性假设它从大量数据中学习语音长什么样因此可以在单帧内判断某个时频单元是否属于语音。这使得它能处理传统方法完全无能为力的非稳态噪声。AU-60 规格里列举的风扇/空调/敲击/鸣笛/金属碰撞/风噪前两个传统方法能做后四个基本只能靠神经网络。但神经网络并没有取消折中曲线只是把它整体上移了在同样的语音失真水平下能拿到更大的抑制量或者在同样的抑制量下失真更小。当抑制量继续加深时清辅音丢失、瞬态削平这些问题依然会出现——因为它们的根源是信息论层面的即在低信噪比时频单元上语音信息本身已经不足以恢复。还有一个神经网络特有的现象值得注意模型对训练数据分布外的噪声类型泛化能力有限。遇到训练集里没有的噪声抑制量会明显下降有时还会出现语音被误伤的情况。这也是同一个模块在不同现场表现差异较大的原因之一。五、后端是人耳还是 ASR最优工作点不同这是选择降噪深度时最容易被忽略的一条。如果后端是人耳通话、对讲人的听觉系统有很强的补全能力能从残缺的语音中恢复语义但对残余噪声比较敏感听着累。所以偏向更深的降噪是合理的。如果后端是自动语音识别情况相反。ASR 声学模型通常在带一定噪声的真实数据上训练它期望的输入分布包含自然的噪声底。过度降噪产生的信号是分布外样本频谱被挖出很多空洞清辅音缺失时域包络被改变。实测中经常出现降噪开太深反而识别率下降的情况。AU-60 内置 DSP/ADC/DAC可以替代传统音频 Codec这意味着它在链路中的位置往往是麦克风之后、主控之前处理后的信号直接送给上层。若上层是 ASR 引擎就需要专门验证把降噪档位调低反而可能提升端到端识别率。这个验证成本不高但很少有人做。六、AU-60 的其它参数如何服务于这个折中把规格表里其它数字放进来看会发现它们与降噪策略是配套的。MIC 输入 30KΩ / 1.0Vrms、MIC 输出 120Ω / SNR 105dB / 1.07Vrms输入满量程较大前端不容易过载输出 SNR 105dB 意味着处理链自身的噪声底很低。降噪算法能压到多深前提是通道底噪不构成新的下限——105dB 提供了充足的空间。I2S 默认 16kHz/16bit16kHz 采样对应 8kHz 带宽覆盖了语音的主要能量。清辅音的能量集中在 4~8kHz正好在这个带宽的上半段。若采样率更低如 NR37 的 8kHz清辅音信息本身就被截掉了一半降噪造成的辅音丢失会雪上加霜。16kHz 是一个务实的选择。双麦双波束波束形成提供的是空间维度的抑制它与单通道降噪的折中曲线是正交的——空间抑制不会造成语音失真目标方向增益为 1。所以在双麦可用时应优先靠波束拿抑制量把单通道降噪的负担减轻。这是两个麦克风比一个好最实际的价值。100dB AEC容忍延迟 100msAEC 与降噪是串联的两级。若 AEC 残余较大残余回声会被降噪模块当作噪声处理进一步加深抑制间接加剧语音失真。所以 AEC 做好是降噪能保持温和的前提。七、实践建议不要按最大降噪选型或配置。先确定后端是人耳还是机器再定工作点。能用双麦就用双麦把抑制量优先分配给波束形成单通道降噪留温和档。评估时不要只听背景是否干净要专门测四/十、发/花这类靠清辅音区分的词。接 ASR 时做 A/B 测试同一段音频分别用不同降噪档位跑识别对比字错率。现场噪声类型若与常见类型差异大特殊机械、动物叫声、特定环境音实测比规格更有参考价值。降噪深度是一个容易量化、也容易被过度追求的指标。把它放回折中曲线的框架里看选型时问的问题就会从能降多少 dB变成在我的噪声类型和后端需求下最优工作点在哪——后者才是决定实际体验的问题。