ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

概率论与随机过程:信号处理工程师的必修课

概率论与随机过程:信号处理工程师的必修课 做信号处理的人基本都有过被概率论和随机过程折磨的经历。我当年刚开始接触现代信号处理时翻课本第一反应就是这些数学公式和滤波器、检测器到底有什么关系直到后来做实际项目处理语音噪声、雷达回波、通信信号才真正意识到一个残酷的事实——现代信号处理几乎所有核心算法从匹配滤波、维纳滤波到卡尔曼滤波、粒子滤波再到机器学习里大量用到的估计理论和检测理论底层全都在跟随机过程打交道。这篇作为整个系列的起点把概率论与随机过程中最核心、最常用的知识点重新梳理一遍重点讲清楚每一块内容在信号处理场景里到底是怎么用的而不是单纯复习数学定义。如果大学学的内容已经还给老师了不用慌。这篇按信号处理实用视角把关键部分重新捡起来重点讲清楚“这东西是干嘛的”“信号处理里怎么用它”以及“为什么非用它不可”。1. 为什么现代信号处理非要先过概率论这道坎1.1 确定性信号与随机信号的分野信号处理研究的对象是信号而信号首先分成两大类确定性信号和随机信号。确定性信号可以用一个确切的数学表达式描述比如一个正弦波 $x(t) A\cos(2\pi ft \varphi)$任意时刻的值都能精确算出来。这种信号在教科书里很好用因为分析起来干净利落傅里叶变换一套就完事。但现实世界远没有这么理想化。实际工程里碰到的信号不管是语音、雷达回波、通信符号还是传感器采集的数据都混入了噪声和干扰。更根本的问题是很多东西本质上就是随机的——通信系统里下一时刻传输的比特是什么事先无法确定雷达下一次扫描目标出现在哪个位置事先也无法确定语音信号下一帧的频谱形态是什么同样无法精确预测。面对这些信号确定性数学工具就力不从心了。这种情况下只能退一步不再追求“精确预测每个时刻的值”而是转向描述信号的统计规律——它在某个取值范围内出现的可能性有多大它的平均能量是多少它的波形在不同时刻之间有多强的相关性。这就是概率论和随机过程进入信号处理的原因。1.2 从单次结果到统计平均的思维转变学确定性信号处理的时候判断一个系统好不好直接看某个信号经过处理后的输出波形就行。但处理随机信号时这个思路行不通。你给同一个系统输入同一类随机信号每次得到的输出波形都不一样没法靠单次结果评价性能。所以信号处理领域评价算法或系统性能看的都是统计平均意义下的指标。通信系统看误码率——统计意义下传错的概率估计问题看均方误差——估计值和真值差的平方的期望滤波问题看输出信噪比——信号功率和噪声功率的统计比值。如果不懂期望、方差、概率分布这些概念连“评价一个算法好不好”这个基本操作都做不到。这种思维转变是很多初学者最不适应的地方。习惯了确定性分析遇到随机信号总觉得心里没底。但搞明白统计视角之后反而会觉得这套工具比确定性分析更贴近工程实际。1.3 信号处理三大任务背后的概率论现代信号处理的核心任务基本可以归纳为三类估计、检测、滤波。这三类任务本质上都是在跟随机过程打交道。估计问题典型代表是从含噪观测中估计某个参数或整个信号波形。比如根据接收到的带噪信号估计发送端信号的幅度、频率、时延这需要建立观测与待估计量之间的概率模型然后在某种最优准则下求解。检测问题典型代表是判断信号的有无或判断发送的是0还是1。雷达要判断目标是真目标还是虚警通信接收机要判断当前收到的是比特0还是比特1。这本质上是一个假设检验问题需要用似然比和概率模型来刻画。滤波问题典型代表是从混合信号中提取有用信号、抑制噪声。维纳滤波、卡尔曼滤波本质上都是求解最小均方误差意义下的最优估计全部建立在信号和噪声的统计特性自相关函数、功率谱密度基础上。这三类问题共同构成了现代信号处理的主体而它们的数学基础恰好就是概率论和随机过程。所以这门课的“第01讲”从概率统计基础开始不是因为课程编排偷懒而是因为后面所有内容都要在这里调用这些工具。2. 随机变量的数字特征——信号处理最常用的描述工具2.1 期望、方差与均方值从统计角度看信号随机变量是随机信号的“快照”信号在某个固定时刻的值就是一个随机变量。描述一个随机变量可以用完整的概率密度函数但很多情况下几个数字特征就够用了而且用起来方便得多。期望 $E[X]$ 是随机变量取值的概率平均对应信号处理里的直流分量。一个信号如果均值不为零说明它带有恒定的直流偏置。去直流操作本质上就是减去样本均值。方差 $\mathrm{Var}(X) E[(X-E[X])^2]$ 衡量随机变量偏离均值的程度。在信号处理里方差直接对应信号的交流功率。如果一个噪声的方差大说明它波动剧烈能量强。还有一个经常用到的是均方值 $E[X^2]$它等于方差加均值的平方$$E[X^2] \mathrm{Var}(X) (E[X])^2$$均方值在工程里直接对应信号的总平均功率。这里的意义很直白直流功率和波动功率分开算加起来就是总功率。信噪比、功率谱密度这些概念都跟它脱不开关系。数字特征数学定义信号处理含义均值 $E[X]$$\int x f_X(x)dx$直流分量方差 $\mathrm{Var}(X)$$E[(X-E[X])^2]$交流功率波动强度均方值 $E[X^2]$$E[X^2]$总平均功率标准差 $\sigma$$\sqrt{\mathrm{Var}(X)}$波动幅度与信号同量纲2.2 多维随机向量与协方差矩阵数据相关性的核心实际信号处理很少只处理单个随机变量。一个采样序列可以看成多个随机变量组成的向量一个多通道传感器系统的输出天然就是一个多维随机向量。多维随机向量最核心的描述工具是协方差矩阵$$\mathbf{C} E[(\mathbf{X} - E[\mathbf{X}])(\mathbf{X} - E[\mathbf{X}])^T]$$协方差矩阵的对角线元素是各分量的方差非对角线元素是不同分量之间的协方差。协方差的符号和大小反映了两个随机变量之间相关性的方向和强弱。这个矩阵在信号处理里的出场率极高。主成分分析PCA的第一步就是计算协方差矩阵然后做特征分解找主要成分方向信号白化操作本质上就是在协方差矩阵的“坐标系”里做旋转和缩放让各分量去相关阵列信号处理里的信源数估计、波达方向估计大量工作也是围绕协方差矩阵展开的。可以说协方差矩阵是理解多维随机信号之间依赖关系的门户。2.3 高斯随机变量的独特地位在所有分布里高斯分布是信号处理中出现频率最高的没有之一。这不是偶然的而是因为高斯分布有一系列极其优秀的数学性质。第一个性质是线性变换不变性。一个高斯随机向量经过任意线性变换后得到的仍然是高斯随机向量。这意味着高斯信号通过线性滤波器后还是高斯的均值按系统响应演化协方差按双线性变换更新。这个性质让级联系统的分析变得异常简洁——每个环节只需要更新均值和协方差矩阵无须担心分布形状改变。第二个性质是“不相关即独立”。对一般的随机变量不相关协方差为零推不出独立。但在联合高斯分布的前提下不相关和独立完全等价。这个性质在分析滤波器输出、传感器融合时特别有用——如果两个高斯噪声源不相关就可以放心地把它们的联合分布拆成乘积形式大大化简推导。第三个性质是中心极限定理的支持。大量独立同分布随机变量的和在极限条件下趋于高斯分布。工程里的噪声往往是很多微小干扰叠加的结果所以天然近似高斯。这解释了为什么高斯白噪声模型在通信、雷达、控制领域如此通行——它既是实际现象的合理近似又在数学上足够简洁。3. 条件概率、贝叶斯定理与估计理论的起点3.1 贝叶斯公式的信号处理解读条件概率 $P(A|B)$ 描述的是“在已知B发生的条件下A发生的概率”。这个看似简单的概念放到信号处理的语境里就是整个估计和检测理论的出发点。贝叶斯公式$$P(\theta|y) \frac{P(y|\theta)P(\theta)}{P(y)}$$用信号处理的语言翻译一下$y$ 是我们拿到的观测数据$\theta$ 是我们感兴趣的未知量比如信号幅度、目标位置、调制参数。$P(\theta)$ 是拿到观测之前对 $\theta$ 的先验认识$P(y|\theta)$ 是在已知 $\theta$ 的情况下数据 $y$ 的分布规律也叫似然函数$P(\theta|y)$ 是观测到 $y$ 之后对 $\theta$ 的认识更新称为后验概率。这个公式的价值在于它把“如何根据数据学习未知参数”这个问题变成了一个可计算的概率更新过程。拿到新的观测数据就更新一次后验有更多数据认知就更精确。现代信号处理里大量算法包括卡尔曼滤波、粒子滤波、贝叶斯压缩感知本质上都是在各种复杂场景下反复执行这个“先验→似然→后验”的更新循环。3.2 从后验到估计三种典型的估计思路有了后验概率 $P(\theta|y)$ 或后验概率密度 $f(\theta|y)$接下来要回答的问题是怎么从这个分布里拿出一个具体的数值作为 $\theta$ 的估计值第一种思路是最大后验估计MAP直接取后验概率密度最大的那个点作为估计值。直观理解就是“在所有可能的取值里挑一个最可能的”。这个估计的优点是计算相对简单——在不少模型下有一个闭式解缺点是需要先验分布。当先验信息不准时MAP估计可能被误导。第二种思路是最大似然估计MLE只看 $P(y|\theta)$不看先验取让观测数据出现概率最大的那个 $\theta$。可以理解成“哪个参数让当前数据最可能出现就选哪个”。MLE不需要先验信息在大样本条件下有很多良好的渐近性质是实际工程里用得最多的估计方法之一。第三种思路是最小均方误差估计MMSE目标是让估计误差的平方期望最小。推导结论是MMSE估计量就是后验均值 $E[\theta|y]$。这个估计在均方误差意义下是最优的代价是计算后验均值往往涉及积分在非高斯模型下没有闭式解。3.3 一个直观例子高斯模型下的贝叶斯估计看一个最简单的例子。观测模型为$$y \theta n$$其中噪声 $n \sim \mathcal{N}(0, \sigma^2)$先验 $\theta \sim \mathcal{N}(\mu, \tau^2)$且 $n$ 与 $\theta$ 独立。根据共轭性后验分布仍然是高斯分布。可以做解析计算也可以直接套公式得出后验均值和方差为$$E[\theta|y] \frac{\frac{\mu}{\tau^2} \frac{y}{\sigma^2}}{\frac{1}{\tau^2} \frac{1}{\sigma^2}}$$$$\mathrm{Var}(\theta|y) \frac{1}{\frac{1}{\tau^2} \frac{1}{\sigma^2}}$$这个结果有非常直观的解释。后验均值是观测值 $y$ 和先验均值 $\mu$ 的加权平均权重取决于它们的精度方差的倒数。如果观测噪声方差 $\sigma^2$ 很小说明观测很准后验估计就会偏向观测值 $y$反之如果先验方差 $\tau^2$ 很小说明先验信息很可靠后验估计就会偏向先验均值 $\mu$。这正好对应了工程里的直觉如果有可靠的经验先验比如目标的常见速度范围、信号的典型幅度而且当前观测噪声很大那估计时应该多参考先验反过来如果观测质量高就应该让数据说话、少依赖先验。贝叶斯估计把这个权衡过程量化成了清晰的数学公式。做实际信号处理的理解这个例子之后再去看卡尔曼滤波的时间更新和量测更新公式会发现核心思想一模一样——只不过把一个标量参数换成了随时间演化的状态向量。4. 随机过程基础——从随机变量到随时间演化的信号4.1 随机过程到底是什么随机变量是静态的——一个数值加上它取各值的概率分布。但信号是随时间变化的每个时刻都有一个值而且这些值之间存在时间上的关联。这就是随机过程的用武之地。严格地说随机过程是一族样本函数的集合。做实验观察一个随机信号每做一次实验得到一条随时间变化的曲线这叫一个样本函数也叫实现。不同实验得到不同曲线因为信号本身是随机的。把所有可能的实验曲线放到一起加上每条曲线出现的概率规律就构成一个随机过程。一个更接地气的类比随机过程就像一台自动售货机每次投币出来的饮料都不一样但总体上有个概率规律。重复很多次之后你可以统计出“出可乐的概率有多大”“出果汁的概率有多大”。对应到随机过程就是做很多次实验统计各时刻信号取值分布是怎样的。注意区分两个概念固定一个时刻 $t_0$$X(t_0)$ 是一个随机变量固定一条样本曲线 $\omega_0$$X(t, \omega_0)$ 是一条确定性的时间函数。初学随机过程最容易出的问题就是把这两个视角混为一谈。4.2 均值函数与自相关函数一阶和二阶统计量描述一个随机过程最常用的是两个统计量。均值函数$$m_X(t) E[X(t)]$$它表示在任意时刻 $t$对全部样本函数取平均。注意这个平均是对所有可能实现做的集合平均不是对时间做的平均。对于非平稳过程均值函数会随时间变化表示信号的整体偏移在动态演化。自相关函数$$R_X(t_1, t_2) E[X(t_1)X(t_2)]$$如果先各自减去均值再做平均得到的就是自协方差函数$$C_X(t_1, t_2) E[(X(t_1)-m_X(t_1))(X(t_2)-m_X(t_2))]$$自相关函数刻画的是随机过程在两个不同时刻取值之间的统计依赖性。如果 $t_1$ 和 $t_2$ 靠得很近多半取值也接近自相关值就高如果相隔很远关联就弱自相关值会衰减。这个时间上的关联结构直接决定了信号的频谱形状和可预测性——自相关衰减越慢说明信号变化越缓慢、低频成分越丰富。均值函数和自相关函数是随机过程理论里最核心的两个“基本画像”。它们决定了随机过程在时域上的大体样子。更精细的分析则要看更高阶统计量但在大多数工程应用里一阶和二阶统计量已经足够支撑建模和算法设计。4.3 复随机过程与解析信号实际信号处理中经常会接触复信号比如通信里的基带等效信号、雷达里的I/Q两路正交采样。相应的就有复随机过程。复随机过程 $Z(t) X(t) jY(t)$ 需要用自相关和互相关来描述两路实随机过程之间的统计关系。复随机过程的均值函数与实情况类似但自相关函数定义不同需要特别注意。复过程的自相关函数定义为$$R_Z(t_1, t_2) E[Z(t_1)Z^*(t_2)]$$这里的共轭符号不是随便加的它保证了自相关函数在原点取得最大值且具有共轭对称性。如果定义里漏了共轭很多性质和公式都会乱掉。这个细节在推导带通信号分析、匹配滤波器输出统计时特别容易踩坑建议从开始就按规范形式来记。5. 平稳性与遍历性——把理论变成可操作的工具5.1 宽平稳工程中最常用的平稳形式随机过程理论很美但如果每一步都要考虑所有时刻的联合分布工程上根本没法用。平稳性的引入就是为了在不失太多一般性的前提下大大简化分析。平稳分为严格平稳和宽平稳也叫广义平稳WSS。严格平稳要求任何阶数的联合分布随时间平移不变这个条件太强实际很难验证。工程里几乎都用宽平稳。宽平稳只需要满足三个条件均值恒定$m_X(t) m_X$与时间 $t$ 无关自相关函数只依赖于时间差$R_X(t_1, t_2) R_X(t_1 - t_2)$写成一元函数 $R_X(\tau)$均方值有限。一个持续运行在统计平衡状态的系统其输出信号往往可以近似看成宽平稳的。比如工作的电子设备产生的稳态噪声、平稳信道中的通信信号都能近似满足宽平稳条件。宽平稳为什么够用因为在大多数问题里我们只关心信号的一阶和二阶统计量而宽平稳恰好保证这两个量不随时间变化、结构简单。特别地高斯随机过程的分布完全由均值和协方差确定一个宽平稳的高斯过程就是严格平稳的这也让宽平稳假设在使用场景上更加有底气。5.2 遍历性为什么一段数据可以代表整体宽平稳简化了统计特性的形式但还有一个现实问题没解决理论上均值 $E[X(t)]$ 是对所有样本函数做集合平均可现实中往往只有一条观测记录——比如一段录好的语音、一段雷达回波。就这一条曲线怎么估计“所有可能样本的统计平均”答案就是遍历性假设。如果随机过程是遍历的那么集合平均可以用时间平均代替$$m_X \lim_{T\to\infty} \frac{1}{T}\int_0^T x(t)dt$$$$R_X(\tau) \lim_{T\to\infty} \frac{1}{T}\int_0^T x(t\tau)x(t)dt$$也就是说一条足够长的样本函数能够“经历”这个随机过程全部可能的统计状态因此拿时间平均就能估计出集合平均。直观理解就是你在一家餐厅吃了很多次饭虽然每次都不同但把长期的平均体验当成这家店的稳定水平是合理的——前提是这家店的口味水平确实稳定没有越做越差或者突然换大厨改变风格。工程里做功率谱估计、参数估计基本都默认遍历性成立。这个假设大多数情况下是合理的但要注意前提过程必须是平稳的而且观测时间要足够长。如果信号是非平稳的比如一段语音里的语音段和静音段直接拿整段求时间平均就会得到不伦不类的结果。所以在做统计估计之前先确认信号是否满足平稳性以及是否可以用遍历性假设。5.3 非平稳信号怎么办现实里的信号很多是非平稳的语音就是最典型的例子——有人说话时能量高没说话时能量低统计特性随时间明显变化。处理这类信号直接套平稳假设和遍历性显然不行需要一些变通手法。一种做法是短时平稳假设把信号切成短帧假设每一帧内近似平稳。语音信号处理的标准做法就是分帧加窗每帧10~30毫秒帧内信号近似平稳然后对每帧单独做平稳假设下的分析和处理。另一种做法是主动引入非平稳模型比如用卡尔曼滤波跟踪时变参数、用时变自回归模型描述信号的演化。理解平稳和遍历的边界就不会在实际应用里不分青红皂白地滥用统计工具。这也是为什么随机过程基础不只是在推导公式更是在规定数学工具的使用条件。6. 自相关函数与功率谱密度——时域与频域的统计桥梁6.1 维纳-辛钦定理随机信号频域分析的基石确定性信号可以用傅里叶变换做频域分析随机信号呢一个随机过程的样本函数持续时间无限通常不满足绝对可积条件直接做傅里叶变换往往发散没有意义。就算在有限区间内截断做变换得到的频谱也是随机波动的不同实现差异很大不能作为信号的稳定频域特征。功率谱密度的引入解决了这个问题。维纳-辛钦定理给出了一个极简洁漂亮的结果对于宽平稳随机过程功率谱密度等于自相关函数的傅里叶变换$$S_X(f) \int_{-\infty}^{\infty} R_X(\tau)e^{-j2\pi f\tau}d\tau$$反过来自相关函数是功率谱密度的逆傅里叶变换$$R_X(\tau) \int_{-\infty}^{\infty} S_X(f)e^{j2\pi f\tau}df$$这个定理把两个看似不同的视角联系在了一起。自相关函数描述信号在时域上的相关结构功率谱密度描述信号能量在频域上的分布。两者是同一信息的两种表现形式。时域上看相关结构很复杂换到频域却可能非常简洁反过来也一样。功率谱密度有个直观的物理意义$S_X(f)df$ 表示信号在频率 $f$ 附近 $df$ 带宽内的平均功率。通过对功率谱密度在整个频率轴上积分可以得到信号的总功率这与时域上的均方值 $E[X^2]$ 一致体现了帕塞瓦尔定理在随机信号领域的对应形式。6.2 白噪声统计意义上的“均匀频率分布”白噪声是概率论和随机过程在信号处理应用中最常见的噪声模型。它的定义很简洁功率谱密度在整个频域上是常数即 $S_N(f) N_0/2$双边定义。从维纳-辛钦定理反推白噪声的自相关函数是$$R_N(\tau) \frac{N_0}{2}\delta(\tau)$$这意味着白噪声在任意两个不同时刻的取值都不相关$\tau \neq 0$ 时自相关为零。换言之白噪声样本点之间完全没有统计关联——每个时刻的值都是“全新”的不携带任何关于过去或未来的信息。这就像一个完全不记事的室友你问他昨天发生了什么他脑子里是一片空白。需要注意的是理想白噪声的功率无限大现实中并不存在。实际中的“白噪声”通常指在系统关心的频带内功率谱近似平坦的噪声。比如电阻热噪声在很宽的频段内谱密度基本平坦可以按白噪声处理但如果频带取得足够宽它的功率谱在高频端最终还是滚降的。6.3 用自相关和功率谱识别周期信号一个高价值应用自相关函数和功率谱密度在工程上有个典型的应用场景从强噪声背景中检测和识别周期信号。举例说明。观测信号为$$x(t) A\cos(2\pi f_0 t) n(t)$$其中 $n(t)$ 是高斯白噪声。噪声的功率谱是平坦的自相关函数集中在零点附近。而周期信号的自相关函数保持周期振荡、不衰减对应地它的功率谱密度在 ±f₀ 处出现尖锐的谱线其余频段基本为零。当信噪比很低时直接画时域波形周期信号完全淹没在噪声里看不出任何规律。但计算自相关函数之后噪声成分很快衰减周期信号的自相关峰值稳定保持周期性清晰可见。换到频域功率谱里对应频率处会出现明显高于噪声底座的尖峰。这个特性在机械故障诊断、生物医学信号分析、天文信号探测等场景里被广泛使用——从强背景噪声中找出微弱的周期性成分靠的就是统计谱分析。我自己的实测经验是当信噪比降到0dB以下时直接看时域波形基本看不出东西但自相关函数和功率谱上的峰值仍然可辨。当然前提是观测时间足够长用足够多的数据把统计平均做稳然后利用自相关或功率谱的峰值检测把这个“凸起”用一下。7. 高斯噪声与信号处理中的典型应用7.1 为什么高斯白噪声无处不在信号处理里最常见的噪声模型就是高斯白噪声AWGN。前面讲过中心极限定理——大量独立同分布随机因素之和趋于高斯分布。实际工程中的噪声源通常非常多比如热噪声来自大量电子的无规则热运动这些微小随机运动的叠加在统计上就表现为高斯分布。高斯白噪声的“高斯”指每个时刻的取值服从高斯分布“白”指不同时刻的取值不相关。如果把噪声写成离散序列 $w[n]$则$$w[n] \sim \mathcal{N}(0, \sigma^2), \quad E[w[m]w[n]] \sigma^2\delta[m-n]$$这两个条件组合起来让高斯白噪声成为数学上非常容易处理的模型。再加上真实噪声在不少场景下确实近似满足这些条件AWGN模型就成了通信系统、雷达系统、控制系统性能分析的标准默认假设。7.2 高斯随机信号通过线性系统高斯白噪声通过一个线性时不变系统之后输出不再是“白”的除非系统是全通的但仍然保持“高斯”属性。这个性质的严格描述是高斯随机过程通过线性系统后仍然是高斯过程均值函数和自相关函数发生相应变化。设输入高斯过程 $X(t)$系统冲激响应 $h(t)$输出为$$Y(t) X(t) * h(t) \int h(\tau)X(t-\tau)d\tau$$输出的均值是输入均值经过同一线性系统后的结果 $m_Y m_X * h(t)$。输出的自相关函数满足$$R_Y(\tau) R_X(\tau) * h(\tau) * h(-\tau)$$频域表达更简洁$$S_Y(f) |H(f)|^2 S_X(f)$$这个式子说明线性系统对随机信号功率谱的影响仅仅体现在幅频响应模平方上。滤波器设计时就可以通过塑形 $H(f)$ 来控制噪声功率谱的形状。高斯性保持不变这个性质保证了输出信号的任意线性组合仍然是高斯分布这使得接收机里对高斯噪声环境下的信号做线性处理时输出统计特性始终在可控范围内。7.3 匹配滤波器与最大信噪比匹配滤波器是通信和雷达接收机里最经典的一个模块它的推导过程充分展示了随机过程工具如何解决实际问题。问题可以这样描述接收到一个确定信号 $s(t)$ 加高斯白噪声 $n(t)$$$r(t) s(t) n(t)$$要求设计一个线性滤波器 $h(t)$使得输出在某个时刻 $t_0$ 的瞬时信噪比最大。输出信号为 $s_0(t) s(t) * h(t)$输出噪声功率为$$P_N \frac{N_0}{2}\int_{-\infty}^{\infty}|H(f)|^2 df$$输出信噪比为$$\text{SNR} \frac{|s_0(t_0)|^2}{P_N} \frac{\left|\int H(f)S(f)e^{j2\pi f t_0}df\right|^2}{\frac{N_0}{2}\int |H(f)|^2 df}$$利用柯西-施瓦茨不等式可以得出信噪比的上界当且仅当 $H(f) cS^*(f)e^{-j2\pi f t_0}$ 时取等号。在时域里这个最优滤波器的冲激响应正好是发射信号的镜像即 $h(t) c s(t_0 - t)$——“匹配”这个名字就是这么来的。整个推导过程里噪声模型、功率谱密度、随机过程通过线性系统的基本结论全部用上了。匹配滤波器输出的最大信噪比只取决于信号能量和噪声功率谱密度与信号具体波形无关$$\text{SNR}_{\max} \frac{2E_s}{N_0}$$这也是通信系统性能分析里经常用到的基本公式。7.4 维纳滤波从相关函数到最优滤波器匹配滤波器解决的是“已知波形从噪声中提取信号”的问题维纳滤波解决的是更一般的“从观测中估计期望信号”的问题。假设观测 $y(n) s(n) v(n)$要从 $y$ 中估计 $s$目标是最小化均方误差 $E[(s-\hat{s})^2]$。维纳滤波的推导过程体现了随机过程理论中一阶二阶统计量的力量。核心结论是维纳-霍夫方程在连续时间形式下最优滤波器冲激响应 $h(t)$ 满足$$R_{sy}(\tau) \int_0^{\infty} h(\lambda) R_{yy}(\tau - \lambda) d\lambda, \quad \tau \geq 0$$其中 $R_{sy}$ 是期望信号与观测信号之间的互相关函数$R_{yy}$ 是观测信号的自相关函数。在离散时间和有限阶实现下这变成一个线性方程组求解的关键输入就是信号和噪声的自相关、互相关函数而这些函数正是从随机过程的统计建模里来的。换句话说只要给出信号和噪声的统计特性自相关或功率谱就能算出最优滤波器。反过来如果统计特性估计不准维纳滤波的性能就会明显恶化。这也是为什么随机过程基础一定要放在滤波器设计前面讲——没有这些统计工具滤波器的设计根本无从谈起。8. 概率论与随机过程学习中的常见问题与实操建议8.1 几个高频踩坑点初学随机过程有几个错误是我见过也亲历过很多次的。列出来算是帮大家扫雷。第一个是把概率密度函数的值当成概率本身。概率密度函数在某个点的取值可以大于1只要它在某个小区间上的积分不超过1就行初学者看到 $f_X(x) 2$ 就以为概率超过100%其实完全没有问题。掌握“概率是区间积分、密度只是某一时刻的权值”这个关系很多混乱就不会出现。第二个是把宽平稳当成严格平稳。宽平稳只约束一阶和二阶统计量不随时间平移而改变更高阶统计量可能仍然随绝对时间变化。区分这两者在推导高阶统计量的应用场景时需要特别留意。第三个是混淆随机变量和随机过程。$X(t)$ 这个符号在一篇文章里有时指过程整体有时指某个具体时刻的随机变量有时指某个具体样本函数。同一个符号承载了三个不同的对象。建议学习时先明确当前语境下用的是哪个视角再往下推公式。第四个是默认时间平均一定等于集合平均。只有遍历过程才能这么做。做实验时如果观测时间不够长或者过程本身是非平稳的时间平均估计出来的“统计特性”可能跟真正的统计特性差得很远。8.2 用仿真把抽象概念落地光看公式随机过程的很多概念不容易真正内化。我建议有条件的读者在学完基础概念后用Python或MATLAB做几个小仿真把理论跟看得见摸得着的波形对应起来。第一个仿真建议生成一段高斯白噪声序列计算它的自相关函数和功率谱密度。观察自相关函数是不是在零点附近出现峰值、在其他位置近似为零观察功率谱是否基本平坦。这个过程能直观理解“白”的含义。第二个仿真建议生成一个正弦信号加高斯白噪声信噪比调到0dB以下。分别画时域波形、自相关函数、功率谱密度。你会看到时域里几乎找不到正弦的影子但自相关函数的周期性和功率谱上的谱峰仍然清楚。亲手做一遍比看十遍推导都更有说服力。第三个仿真建议设计一个一阶低通滤波器让高斯白噪声通过它再算输出信号的自相关函数和功率谱密度。可以看到输出功率谱确实按照 $|H(f)|^2$ 被塑形自相关函数也不再是冲激状。这个实验把“高斯过程通过线性系统”的理论变成了肉眼可见的结果。代码写起来很简洁。用Python时生成高斯白噪声就是np.random.randn(N)自相关用np.correlate或直接调用plt.acorr功率谱用plt.psd或scipy.signal.welch。十分钟就能跑完一组实验收获比单看公式大得多。8.3 这门基础到底给后面铺了什么路回顾这一篇的内容最值得记住的不是某个具体公式而是一个核心思维信号处理面对的真实信号是随机的确定性的方法解决不了随机问题必须用统计的语言来描述信号、用概率的框架来做决策、用均值和相关函数来刻画信号结构。具体到后面的学习路径这篇内容几乎覆盖了现代信号处理所有常用算法的基础模块。匹配滤波器、维纳滤波需要功率谱密度和自相关函数卡尔曼滤波需要高斯假设和贝叶斯更新信号检测需要似然比和假设检验自适应滤波需要相关矩阵和特征值分析机器学习类的信号处理方法比如隐马尔可夫模型、高斯混合模型更是全部建立在概率模型之上。这一篇打底之后下一篇可以开始进入随机信号的线性变换与分析或者直接进入参数估计理论把最大似然、最小均方误差、克拉美-劳界限这些概念展开细讲。按这个系列一贯的路子后面会接着往深里走。
返回列表