
分类高维统计 / 随机矩阵 / 机器学习理论低维统计里我们习惯让样本量nnn单独增大。此时 Fisher 信息随nnn线性放大方差按1/n1/\sqrt{n}1/n收缩极大似然估计渐近正态后验围绕极大似然估计呈高斯分布。进入高维后这些结论会集体失效。问题不在于样本量不够大而在于维度ppp也参与极限。本文先回答一个总纲问题当p/np/np/n同阶增长时经验信息矩阵为什么不随nnn放大1. 低维渐近的经典画面经典回归中样本协方差矩阵1n∑i1nxixi⊤ \frac{1}{n}\sum_{i1}^n x_i x_i^{\top}n1i1∑nxixi⊤随nnn增大收敛到一个正定极限。Fisher 信息与nnn成正比估计量的方差与nnn成反比因此参数可以被一致估计。贝叶斯视角同样依赖这个机制。经典 Bernstein-von Mises 结论说后验近似为N(β^MLE, (nI)−1). N\left(\hat\beta^{\mathrm{MLE}},\ (nI)^{-1}\right).N(β^MLE,(nI)−1).这个公式成立的隐含前提是新增样本持续增加曲率先验效应最终被数据淹没。2. 比例渐近改变了什么高维比例渐近把极限写成pn→κ. \frac{p}{n}\to\kappa.np→κ.当κ\kappaκ是正常数时ppp不再是可以忽略的误差项而是极限系统的一部分。每个新样本带来的信息必须同时分配给越来越多的坐标。如果画成谱图低维时信息曲率峰随nnn不断变高高维时峰高被固定住噪声谱始终与信号峰处于同一尺度。于是经典后验收缩、MLE 渐近正态和参数一致性都需要重新判断。如图1所示后续所有讨论围绕三条主线展开信息稀释决定相变工具决定我们能得到风险还是分布设计谱决定结论能否迁移到真实数据。高维渐近样本信息工具选择设计谱先验效应相变AMPCGMT留一腔插值普适性后验壳图1 高维渐近知识地图。红色是根节点黄色代表信息稀释橙色代表工具蓝色代表设计谱绿色代表先验紫色代表输出。关键分支只有三条信息稀释、工具选择和设计谱。3. 信息稀释的数学机制线性回归的经验信息矩阵由 Gram 矩阵决定。低维时下式随nnn增大∥∑i1nxixi⊤∥O(n). \left\|\sum_{i1}^n x_i x_i^{\top}\right\|O(n).i1∑nxixi⊤O(n).比例渐近下特征维度同步增长Gram 矩阵的谱被新增维度稀释结果变成∥∑i1nxixi⊤∥OP(1). \left\|\sum_{i1}^n x_i x_i^{\top}\right\|O_P(1).i1∑nxixi⊤OP(1).这里OP(1)O_P(1)OP(1)的含义是无论nnn多大经验信息矩阵的算子范数都不会线性放大。MLE 渐近方差依赖的曲率没有随样本量增长经典一致性路径被切断。如图2所示低维路径和高维路径走向完全不同。低维极限高维极限信息放大信息稀释高斯收缩薄壳结构图2 经典与高维极限路径。蓝色路径信息随样本放大后验高斯收缩红色路径信息被维度稀释后验退化为薄壳结构。4. 经典结论失效清单对象低维结论高维比例渐近经验信息矩阵随nnn放大保持OP(1)O_P(1)OP(1)MLE 方差按1/n1/n1/n收缩可能不收缩后验高斯尖峰薄壳或非高斯先验被数据淹没效应保留参数一致性通常成立需要相变判断分析工具中心极限定理AMP、CGMT、腔、插值这张表不是否定经典理论而是说明它适用的极限区域不同。真实工程中p/np/np/n落在常数尺度时应主动切换到比例渐近语言。5. 工程判断高维不是样本量不够而是新增维度会持续消耗新样本带来的信息。把p/np/np/n当成常数比单独报告ppp和nnn更能预测真实系统行为。经典后验高斯近似在高维下会给出过度乐观的不确定性区间。在部署中这意味着一件事模型评估必须报告维度比值、设计谱和信息边界而不是只报告测试集误差。认知检查点高维比例渐近的根因是特征维度参与极限导致经验信息矩阵保持OP(1)O_P(1)OP(1)尺度经典一致性结论因此失效。附代码实验与输出实验使用 iid 标准高斯设计分别观察低维固定ppp和高维p/np/np/n固定时的经验 Gram 矩阵谱范数。低维路径谱范数逐渐下降高维路径谱范数稳定在常数附近。importnumpyasnpdefavg_spectral_norm(n,p,seeds5):vals[]forseedinrange(seeds):rngnp.random.default_rng(seed)Xrng.normal(size(n,p))GX.T X/n vals.append(float(np.linalg.eigvalsh(G)[-1]))returnfloat(np.mean(vals))print(low_dim p5, n grows)fornin[100,500,1000]:print(fn{n:5d}avg_operator_norm{avg_spectral_norm(n,5):.4f})print(high_dim pn/2, n grows)fornin[100,500,1000]:pn//2print(fn{n:5d}p{p:4d}avg_operator_norm{avg_spectral_norm(n,p):.4f})实验输出low_dim p5, n grows n 100 avg_operator_norm1.3469 n 500 avg_operator_norm1.1359 n 1000 avg_operator_norm1.1040 high_dim pn/2, n grows n 100 p 50 avg_operator_norm2.7417 n 500 p 250 avg_operator_norm2.8790 n 1000 p 500 avg_operator_norm2.8753低维时谱范数向111收敛高维时谱范数稳定在2.82.82.8附近不再随nnn下降。这就是“信息稀释”的直接数值表现。