ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Stable Diffusion 真能“读脑”吗?精读 Takagi Nishimoto 2023 fMRI 图像重建

Stable Diffusion 真能“读脑”吗?精读 Takagi  Nishimoto 2023 fMRI 图像重建 Stable Diffusion 真能“读脑”吗精读 Takagi Nishimoto 2023 fMRI 图像重建原论文High-Resolution Image Reconstruction With Latent Diffusion Models From Human Brain Activity作者Yu Takagi、Shinji Nishimoto会议CVPR 2023pp. 14453–14463DOI10.1109/CVPR52729.2023.01389原文CVF Open Access30 秒看懂这篇论文研究问题能否不重新训练大型生成模型只用少量、可解释的线性映射把 fMRI 活动接入 Stable Diffusion重建自然图像使用方法分别从早期视觉皮层解码图像 latent (z)从高级腹侧视觉皮层解码文本条件 ©再把二者交给 Stable Diffusion v1.4 的 image-to-image 流程生成 (z_c) 和最终图像。核心发现(z) 更保留低层外观© 更偏语义合并后的 (z_c) 在机器指标和人类二选一判断中表现最好。编码分析还显示不同 latent、去噪阶段和 U-Net 层与不同视觉皮层区域具有可预测性对应。主要贡献大型生成模型保持冻结每位被试只训练 L2 正则线性回归同时把“脑到图像重建”和“用脑数据解释扩散模型”放进同一框架。最大局限这不是跨被试模型也不是逐像素读取视觉体验。生成结果强烈依赖 Stable Diffusion 的先验、MS COCO 文本标注和随机采样皮层可预测性相关也不能证明模型层与脑区具有同一机制。先给结论这篇工作的重要性不只在于图像看起来逼真而在于它把低层视觉线索与高层语义条件拆开并用一个冻结的生成模型重新组合。但“重建得像”不等于“从脑中逐像素读出”生成先验贡献了多少始终是理解结果时必须保留的问题。1. 研究缺口外观与语义为什么很难同时保住传统 fMRI 图像重建常见两难直接回归像素或浅层视觉特征容易保住位置、轮廓和颜色却缺乏清晰语义借助深层生成模型图像会更自然但可能只生成“像某一类别”的合理图片和被试真正看到的具体实例并不一致。更复杂的方法还要针对脑数据训练 GAN、生成器或大量非线性模块而单个被试能够提供的配对 fMRI—图像样本非常有限。Takagi 与 Nishimoto 的思路是把一个现成的 Latent Diffusion Model 当作冻结的视觉先验。Stable Diffusion 本来就具有两个入口图像 latent 提供空间与外观线索文本条件提供语义约束。既然人类视觉皮层也大致呈现从早期视觉特征到高级语义表征的层级能否分别从不同脑区解码这两个入口再让扩散过程完成融合**来源原论文 Figure 1PDF 第 1 页忠实页面裁剪DOI: 10.1109/CVPR52729.2023.01389。**上排红框是呈现给 subj01 的图像下排是重建。泰迪熊、飞机、钟楼和火车等类别通常可辨认颜色与大致构图也有对应但物体姿态、局部纹理和背景并不精确。它展示的是“受脑信号约束的高概率生成”不是摄影式复原。2. 数据四名被试、7T fMRI以及严格的被试内建模论文使用 Natural Scenes DatasetNSD。NSD 由 7 Tesla fMRI 采集每名被试完成 30–40 个扫描 session观看来自 MS COCO 的自然图像每张图重复呈现三次。作者分析八名被试中完成全部扫描的四人subj01、subj02、subj05、subj07。每名被试有 27,750 个公开 trial其中 2,770 个 trial 对应四人共同观看的 982 张图作为测试集剩余 24,980 个 trial 用作训练。训练集保留三次重复为独立 trial测试时则对同一图像的三次 beta 取平均。补充材料说明使用 NSD 提供的 1.8 mm 预处理数据betasfithrGLMdenoiseRR已做切片时间校正、头动与空间畸变校正每个 voxel 的 beta 在各 run 内 z-score。早期视觉区和高级腹侧视觉区 ROI 由 NSD 的独立功能定位实验确定。这里有三个边界。第一模型为每名被试分别训练不能据此宣称跨人泛化。第二四人是完成全部密集扫描的被试样本量虽小但每人数据量远高于普通 fMRI 实验。第三这篇 CVPR 正文没有重新报告知情同意或伦理审批细节而是直接复用 NSD伦理来源应追溯到 NSD 原始数据论文不能由本文替代。3. 方法两条线性解码通道接入冻结的 Stable Diffusion**来源原论文 Figure 2PDF 第 3 页忠实页面裁剪。**图的上半部分是 Stable Diffusion中间是从 fMRI 重建图像的 decoding底部是反过来用模型特征预测 voxel 的 encoding。作者定义三个关键表示(z) 是原图经 VAE 编码器压缩后的图像 latent© 是每张 MS COCO 图像五条文字标注的 CLIP 文本表示平均值(z_c) 是对 (z) 加噪后在 © 条件下经反向扩散得到的 latent。解码流程只有三步用早期视觉皮层 fMRI 预测 (z)经 VAE decoder 得到 320×320 的粗图 (X_z)再放大到 512×512。把 (X_z) 重新编码并按 image-to-image 流程加噪得到 (z_T)。用高级腹侧视觉皮层 fMRI 预测 ©让去噪 U-Net 在 © 的 cross-attention 条件下把 (z_T) 还原为 (z_c)最后解码成 512×512 图像。所有脑到 latent 的模型都是按被试训练的 L2-regularized linear regression正则系数用训练集内五折交叉验证选择。大型生成模型没有在 fMRI 上训练或微调“无需训练复杂深度网络”不等于完全零训练因为两套高维线性解码器仍需拟合。补充材料给出的生成设置是 Stable Diffusion v1.4、DDIM 50 步、classifier-free guidance scale 5.0、默认 strength 0.8。还要分清本文的 decoding 与 encoding。Decoding 是从 voxel 活动预测 (z) 或 ©目标是生成图像encoding 则反过来用已知图像经过 LDM 得到的特征预测 voxel 活动目标是分析模型表征与脑活动的对应。二者使用同一批训练/测试刺激但权重方向和科学问题不同。后半篇的皮层图并不是“解码时模型注意了哪里”而是哪些模型特征可以线性解释哪里的 fMRI 方差。这里的 © 也不是模型先把脑活动翻译成一句可读文本。每张 MS COCO 图像原有五条 caption作者先用冻结的 CLIP text encoder 编码并取平均再以这个高维向量作为线性回归目标。测试时从高级视觉 ROI 直接预测该向量文本句子并不会显式出现。因此更准确的说法是“解码语言模型的条件表征”而不是“从大脑读出被试心中的句子”。此外作者预先选择早期视觉皮层预测 (z)、高级腹侧视觉皮层预测 ©这个设计带有明确的视觉层级假设。后续 encoding map 与这一假设一致增强了整体解释的连贯性但也意味着方法并非完全数据驱动地发现脑区分工。若要更强验证应交换 ROI、使用全脑统一模型或在独立数据上比较 ROI 选择是否仍然最优。4. 解码结果(z) 管外观© 管语义二者结合最好**来源原论文 Figure 3PDF 第 5 页忠实页面裁剪。**仅用 (z) 时色彩、方向和空间结构更接近原图但火车、泰迪熊或钟楼的类别容易错仅用 © 时类别更清晰却可能改变具体外观和背景(z_c) 通常兼顾两者。这是论文最核心的消融因为它直接对应两条脑解码通道的功能分工。不过Figure 3 的展示策略会让视觉印象偏乐观作者对每张测试图生成五个随机样本再选择 perceptual similarity metricPSM最高的样本用于可视化。客观评价则对五次生成的相似度取平均。因此不能只根据图中的“最佳一次”判断真实单次使用效果。**来源原论文 Figure 4PDF 第 6 页忠实页面裁剪。**四名被试对同一原图的重建大致保留类别但细节差异明显。作者提出这些差异可能反映个体体验也可能只是数据质量差异补充材料显示 subj01 的 latent (z) 解码相关最高0.239±0.137subj07 最低0.145±0.136而 subj01 的 tSNR 和简单 GLM 指标也较高。现有证据更支持“信号质量影响重建”不足以把差异解释成主观体验差异。**来源原论文 Figure 5PDF 第 6 页忠实页面裁剪。**客观评价是 two-way identification比较对应原图与随机非对应图看哪张与重建更相似。指标取 CLIP 与 AlexNet 的早、中、晚层特征机会水平为 50%。(z) 在早层特征上较强© 在晚层语义特征上更强(z_c) 跨层更均衡。六名人类评分者也在原图、对应重建和随机重建之间二选一(z_c) 最高论文报告三种条件之间均有显著差异双侧 signed-rank testFWE 校正后 (P0.01)。这组证据比单纯展示图片可靠但仍有注意点CLIP 既参与 Stable Diffusion 的文本条件又参与部分评价可能偏爱与自身表示一致的输出AlexNet 指标和人类判断缓解了这种同源偏差却没有消除生成先验带来的合理化。二选一识别也比从大量候选中精确检索更容易不能直接解释为“恢复了全部图像信息”。人类评价虽然只有六名评分者但每人面对的判断数量很大每种 (z/c/z_c) 条件包含四名被试各 200 张图即每种条件 800 次、三种条件共 2,400 次。大量 trial 能稳定估计任务表现却不能把评分者人数自动变成六人以上评分者之间的偏好差异、熟悉度和疲劳仍可能影响结果。论文给出条件比较的显著性但没有把这些二选一正确率转换为单张重建的置信区间或可校准不确定性。5. 编码分析用脑活动解释扩散模型还是用模型解释脑论文第二部分反转映射方向从 LDM 表示预测全脑 voxel 活动并计算预测与真实 fMRI 的 Pearson 相关。所有特征先在训练数据中用 PCA 降到 6,400 维显著性通过长度 (N982) 的高斯随机向量构造零分布单侧 (P0.05)再做 FDR 多重比较校正。来源原论文 Figure 6PDF 第 7 页忠实页面裁剪。(z) 对后部早期视觉皮层的预测较强© 在更广泛的高级腹侧视觉区域更强(z_c) 则覆盖两者。这与“外观—语义”的分工一致但 encoding correlation 只说明某表示线性包含可预测脑活动的信息不代表该 latent 就是脑内真实计算变量。**来源原论文 Figure 7PDF 第 7 页忠实页面裁剪。**作者把 (z) 和 (z_c) 同时放入模型分解二者的 unique variance。低噪声时 (z) 更占优势噪声增大后受文本条件影响的 (z_c) 在高级视觉区贡献上升。补充材料对应 strength 0.6、0.8、0.9。作者据此认为扩散过程逐步强调语义但噪声强度也同时改变图像质量和特征统计不能把红蓝变化简单当成脑内“语义开关”。**来源原论文 Figure 8PDF 第 8 页忠实页面裁剪。**作者在 0、20、40 个去噪步骤后提取 (z_c)。早期阶段 (z) 主导到了中间阶段(z_c) 对高级视觉皮层的独特解释量明显增加晚期两者趋于平衡。该结果为“语义在反向扩散中逐渐显现”提供了相关性证据但只展示离散时间点且主要正文图来自 subj01。**来源原论文 Figure 9PDF 第 8 页忠实页面裁剪。**在反向扩散早期U-Net bottleneck 特征对较广皮层最具预测力随着去噪推进早期 U-Net 层更偏早期视觉区bottleneck 更偏高级视觉区。补充材料给出其他被试和不同随机种子的近似结果。不过“最可预测层”受层特征维度、PCA、正则化和特征共线性影响它是模型—脑表征对应图不是神经网络层与皮层区域的一一同源证明。6. 证据评价论文真正证明了什么数据直接支持的结论有三项第一在四名 NSD 被试的被试内测试中两条线性 latent 解码通道能够约束冻结的 Stable Diffusion生成可识别的自然图像第二(z)、©、(z_c) 在低层与高层特征评价上呈互补模式第三不同 LDM 表示、去噪阶段和 U-Net 层对视觉皮层活动具有不同的线性预测分布。作者进一步解释为扩散模型的组件与视觉系统不同层级相对应语义内容在反向扩散中逐渐出现。这一解释合理但仍是表征相关。可替代解释包括CLIP/Stable Diffusion 自身的视觉层级结构与评价指标共同塑造了结果高级 ROI 更容易预测文本语义噪声和去噪改变了可线性读出的统计特性而不一定对应人脑中的生成过程。我的判断是这篇工作的工程贡献强于“神经机制同构”主张。它证明了预训练生成模型可以作为高质量、低样本脑解码的强先验且简单线性接口已经很有效但重建内容由 fMRI 证据与模型先验共同决定论文没有量化每个像素或语义成分分别来自哪一方。一个尤其容易被忽略的事实是生成模型本身见过远多于 NSD 的自然图像。当 fMRI 只提供模糊结构和语义方向时Stable Diffusion 会依据自己的训练分布补足纹理、光照和物体细节。补全结果可能与刺激非常相似也可能只是同类中“最像真的”实例。要区分二者应比较冻结生成先验下的多次样本方差并检查哪些属性在不同随机种子间持续稳定稳定成分更可能受到脑信号约束易变成分更可能来自生成先验。7. 局限与复现要点只有四名高密度扫描被试所有模型按被试训练没有跨被试、跨扫描仪或临床人群验证。测试图来自与训练相同的 NSD/MS COCO 生态Stable Diffusion 又在大规模网络图文数据上预训练潜在的数据重叠没有被系统审计。© 的训练目标来自图像的五条人工 caption 平均而真实应用并不存在“脑中唯一文本描述”这会把丰富视觉体验压成语言可表达的语义。定性图选择五次采样中的最高 PSM客观指标更稳健但应同时报告随机单次、分布和失败样例。512×512 是生成器输出分辨率不等于 fMRI 提供了 512×512 的独立空间信息。图像重建涉及心智隐私风险。当前结果离任意场景读心很远但数据治理、用途限制和知情同意应与算法性能同时讨论。最小复现应锁定 NSD beta 版本、ROI、训练/测试 trial、run 内 z-score、测试三次平均、Stable Diffusion v1.4、DDIM 50 步、guidance 5.0、strength 0.8并对每名被试独立做五折选择的 ridge regression。评价至少同时包含随机单次与五次平均、CLIP/AlexNet 多层 two-way identification、人类盲评、跨随机种子稳定性以及不使用文本条件和不使用图像 latent 的消融。8. 对脑解码研究的启发这项工作给后续研究一个清晰模板把脑信号映射到预训练基础模型的多个互补接口而不是让一个端到端网络承担全部任务。低层结构、高层语义和生成先验应分别建模、分别评价。进一步可以加入不确定性估计当 (z) 与 © 冲突时输出多种候选并标明哪些特征由脑信号稳定支持哪些只是生成模型补全。更严格的下一步不是单纯追求更漂亮的图而是测试跨被试迁移、跨数据集泛化、caption-free 条件、真实单次采样、生成先验审计和因果干预。如果改变某个脑区或模型组件能够产生可预测的选择性变化才能更接近机制解释。总结Takagi 与 Nishimoto 把 fMRI 到图像重建变成了一个简洁的“双通道接口”问题早期视觉皮层提供 (z) 的外观骨架高级腹侧视觉皮层提供 © 的语义条件冻结的 Stable Diffusion 负责在二者之间生成高分辨率图像。(z/c/z_c) 消融、机器与人类识别、以及 voxel-wise encoding 共同支持这种分工。但最准确的表述不是“Stable Diffusion 读出了脑中的照片”而是**在高密度 NSD 数据上线性解码出的低层与语义表征能够约束一个强生成先验产生与刺激在多层特征上可识别的图像。**这既是很强的结果也是理解其边界的关键。参考资料与图片来源Takagi, Y., Nishimoto, S.High-Resolution Image Reconstruction With Latent Diffusion Models From Human Brain Activity. CVPR 2023, 14453–14463。正文和补充材料来自 CVF Open Access。本文 9 张图全部是原论文 Figure 1–9 的忠实页面裁剪未生成、重绘、增强或添加标注。完整页码、裁剪框与 SHA-256 记录在本地manifest.json。
返回列表