ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

TRIBE v2 训练数据集深度解析:Algonauts2025、Wen2017 等 4 大 fMRI 数据集组织原理

TRIBE v2 训练数据集深度解析:Algonauts2025、Wen2017 等 4 大 fMRI 数据集组织原理 TRIBE v2 训练数据集深度解析Algonauts2025、Wen2017 等 4 大 fMRI 数据集组织原理【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2TRIBE v2 是一个多模态 fMRI 脑响应预测模型其核心能力正来自 4 个精心组织的训练数据集Algonauts2025、Wen2017、Lahner2024BoldBOLD Moments与 Lebel2023Bold。本文面向初学者完整拆解这 4 大 fMRI 数据集的实验设计、目录结构、时间线组织方式以及 TRIBE v2 如何将它们统一成一张事件表喂给 Transformer 模型 。一、为什么需要 4 个数据集fMRI 脑编码模型的训练面临一个根本矛盾每个实验的数据量都有限而单一数据集的模态覆盖太窄。TRIBE v2 的解法是多研究联合训练Multi-Study Learning视频类Algonauts2025多模态电影、Wen2017自然主义视频、Lahner2024Bold3 秒短视频️语言类Lebel2023Bold口述叙事故事四个数据集在 tribev2/studies/ 目录下各有一个独立的Study定义文件由 studies/__init__.py 统一注册再由 grids/defaults.py 中的study.names列表一次性加载。二、4 大 fMRI 数据集一览数据集模态被试数时间分辨率 TR时间线数数据形态Algonauts2025视频文字转写41.49 s15881000 分区 × 592 时间点Schaefer-1000 图谱Wen2017视频32.0 s多 seg/run 组合MNI 空间 NIfTILahner2024Bold短视频3 秒/条101.75 s520MNI 体素 fsaverage 皮层表面163842 顶点/半球Lebel2023Bold语音叙事82.0 s432T1w / MNI / fsaverage / fsnative 多空间提示TRRepetition Time是 fMRI 采样一个脑图像素的时间间隔。TR 越小时间分辨率越高。四个数据集的 TR 被统一归一到 1 Hz 的神经特征频率见 grids/defaults.py 中neuro_extractor的frequency: 1。三、逐个拆解组织原理是什么3.1 Algonauts2025多模态电影数据集定义文件tribev2/studies/algonauts2025.py这是 Algonauts 2025 挑战赛的官方数据集Courtois NeuroMod 子集信息密度最高刺激物friends《老友记》7 季、约 175 集切成 ~5 分钟的 a/b/c/d 块movie104 部提取片Bourne、Wolf、Life、Figures标注词级时间戳转写.tsv含words_per_tr、onsets_per_tr、durations_per_tr三列代码在_load_timeline_events中将其展开为Word事件并合成整段Text事件划分策略按季划分——第 1–6 季 全部电影为train第 7 季整体作为 test见_get_split方法保证测试数据与训练数据在内容上完全不重叠质量处理自动剔除 5 个已知损坏的时间线块Life和Figures两片放映两次专门用于信度分析3.2 Wen2017经典自然主义视频基准定义文件tribev2/studies/wen2017.py最简洁的一个采用目录即配置的扫描式发现目录约定download/video_fmri_dataset/subject*/fmri/{seg|test*}/mni/用前缀区分 trainseg*和 testtest*run 数量不同训练段每个 2 个 run测试段每个 10 个 run——重复扫描让测试集可以评估模型稳定性小细节测试文件的命名规则不同{seg}_{run}.mni.nii.gz代码里做了兼容 fallback_get_nii_file数据为 CC-BY 0 许可即公共领域级别开放3.3 Lahner2024Bold3 秒短视频的神经 GPT 数据定义文件tribev2/studies/lahner2024bold.pyBOLD Moments 是四个数据集中结构化最严格的范式被动观看 1,000 条 3 秒短视频train10 runs 102 条短视频test3 runs ×10 次重复重复次数专为信度分析设计多空间覆盖MNI152NLin2009cAsym、T1w、fsaverage163842 顶点/半球、fsnative由_load_raw统一分发LLM 生成的字幕每段视频的中间帧带有 LLM 生成的 captionllm_frame_annotations.json作为middle_frame_captions字段附加到 Video 事件上——这是文本桥接视觉的关键自带校验器_validate_downloaded_data会检查每个被试的 fMRIPrep 文件、GLM betas 形状如 train 应为(1000, 3, 163842)、刺激文件数量缺文件直接抛错下载不完整就训不了模型3.4 Lebel2023Bold纯语言理解的金标准定义文件tribev2/studies/lebel2023bold.py来自 OpenNeuro ds003020被试在扫描仪里只听故事规模UTS01–03 各扫描 20 个 session共 82 个故事UTS04–08 各 6 个 session测试集设计以wheretheressmoke故事为 test10 个 run其余故事全部 train双粒度标注通过 TextGrid 文件同时解析出Word 级与Phoneme 级音素级事件是四个数据集中标注粒度最细的时间对齐故事开始前有 10 秒静音代码将所有非 Fmri 事件的start统一10对齐音频轴坏数据处理硬编码跳过损坏的UTS01/ses-7/treasureisland并对 TextGrid 中的控制符号{BR}、sentence_start等建立黑名单过滤四、统一层MultiStudyLoader 如何熔四个数据集单个 Study 文件只是方言真正的统一发生在三个文件4.1 事件表一切皆 Event每个 Study 的_load_timeline_events返回同一张 pandas 事件表type/start/stop/filepath/split/subject类型统一为Fmri、Video、Audio、Word、Text、Phoneme。多研究加载器 MultiStudyLoader 会把四个表纵向拼接并打上study列。4.2 变换流水线把异构数据归一化grids/defaults.py 中study.transforms定义了 8 步流水线自定义变换见 eventstransforms.pyExtractAudioFromVideo从视频中抽音频ExtractWordsFromAudio语音转词级时间戳AddText/AddSentenceToWords/AddContextToWords补齐文本事件与上下文RemoveMissing丢弃缺模态的时间线ChunkEvents声音/视频切成 30–60 秒块SplitEvents按 10% 比例切验证集这一步解释了为什么四个格式完全不同的数据集能共用一个训练配置——在变换之后它们已经长得一模一样。4.3 采样与对齐细节100 个 TR 滑窗main.py 中Data类按duration_trs100生成训练片段5 秒血氧动力学偏移fMRI 是慢信号neuro_extractor设置offset: 5将目标向后推 5 秒补偿延迟皮层表面投影SurfaceProjector把各数据集的体素响应统一投影到 fsaverage5 皮层约 2 万顶点这是跨数据集训练能成立的空间基础实现见 utils_fmri.py被试加权utils.py 的get_subject_weights支持按n_subjects/speech/video/recording_time四种策略加权避免扫描时间长的数据集在损失函数中压倒其他数据集五、新手上手路线 读定义从 studies/__init__.py 出发对照上表浏览 4 个 Study 类的类属性_SUBJECTS、TR、_info看流水线打开 grids/defaults.py从study→neuro→brain_model_config三块配置理解数据如何变成模型输入跑通本地测试设置DATAPATH环境变量后执行python -m tribev2.grids.test_run入口在 grids/test_run.py扩展研究若要接入第 5 个数据集只需在 tribev2/studies/ 下新建一个继承neuralset.events.study.Study的类实现iter_timelines与_load_timeline_events两个方法 一句话总结TRIBE v2 的数据组织原理 目录约定 统一事件表 变换流水线 空间归一化。每个数据集保留自己的实验设计但在进入模型前全部被翻译成同一种语言。六、常见疑问 FAQ ❓Q1为什么 Lahner2024 的测试集要重复 10 次重复扫描同一刺激可分离模型预测误差与脑响应噪声是神经影像领域评估模型信度的标准做法。Q2四个数据集的 fMRI 空间都不一样不冲突吗不冲突。训练时体素响应统一投影到 fsaverage5 皮层表面SurfaceProjector各数据集差异被吸收为同一坐标系下的不同响应。Q3训练/测试划分是谁决定的各 Study 的_get_split/ 事件表split字段决定如 Algonauts 按季、Lebel 按故事MultiStudyLoader只做透传流水线里另有 10% 时间验证集。【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表