ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何下载并整理 Cell-DINO 训练所需的 HPA 单细胞数据集文件?

如何下载并整理 Cell-DINO 训练所需的 HPA 单细胞数据集文件? 如何下载并整理 Cell-DINO 训练所需的 HPA 单细胞数据集文件【免费下载链接】dinov2PyTorch code and models for the DINOv2 self-supervised learning method.项目地址: https://gitcode.com/GitHub_Trending/di/dinov2如果你准备在 dinov2 仓库中运行 Cell-DINODINOv2 自监督学习代码的 HPA 单细胞训练数据这一步要做两件事把 HPA 单细胞数据集下载到本地再把文件整理成HPAone数据加载器能识别的目录结构。下载地址和必需文件清单写在 docs/README_CELL_DINO.md 的 “Data preparation” 一节目录与文件的对应关系则定义在加载器 dinov2/data/datasets/cell_dino/hpaone.py 中。本文按“下载 → 整理 → 验证”的顺序走完这条路径。数据从哪里下载按docs/README_CELL_DINO.md的说明HPA-FoV 与 HPA 单细胞HPAone数据集都在 EBI BioStudies 上研究页面为 S-BIAD2443。同一个下载文件夹里还附带一个sample_images子文件夹含三张样例图像。它的用途是在 notebooks/cell_dino/inference.ipynb 中快速测试推理与训练所需的文件无关随主文件一起保留即可。需要保留哪些文件针对 HPA 单细胞数据dataloaderHPAone.pyREADME 列出的必需文件是fixed_size_masked_single_cells_HPAvaried_size_masked_single_cells_HPAvaried_size_masked_single_cells_pretrain_20240507.csvfixed_size_masked_single_cells_evaluation_20240507.csvfixed_size_masked_single_cells_pretrain_20240507.csv前两项是图像目录后三项是 CSV。文件名必须与上面完全一致hpaone.py是按这些固定名称与数据集根目录root拼接路径的改名或漏下任何一个都会导致后续找不到文件。目录结构与 split 的对应关系把五个文件放在同一个根目录下本文用 README 命令里的占位符PATH/TO/DATASET指代它PATH/TO/DATASET/ ├── varied_size_masked_single_cells_HPA/ # 图像目录 ├── fixed_size_masked_single_cells_HPA/ # 图像目录 ├── varied_size_masked_single_cells_pretrain_20240507.csv ├── fixed_size_masked_single_cells_pretrain_20240507.csv └── fixed_size_masked_single_cells_evaluation_20240507.csv这些文件如何被HPAone加载器消费依据hpaone.py源码split读取的 CSV图像目录ALLvaried_size_masked_single_cells_pretrain_20240507.csvvaried_size_masked_single_cells_HPATRAINfixed_size_masked_single_cells_pretrain_20240507.csvfixed_size_masked_single_cells_HPAVALfixed_size_masked_single_cells_evaluation_20240507.csvfixed_size_masked_single_cells_HPA几个值得注意的细节ALL用于编码器自监督训练取的是无标签图像CSV 的img_path列与varied_size_masked_single_cells_HPA目录拼接出图像路径。TRAIN/VAL读取带标签的 CSVfile列只取文件名部分再拼到fixed_size_masked_single_cells_HPA目录下标签列对应两种评估模式——蛋白定位PROTEIN_LOCALIZATION19 个标签与细胞类型CELL_TYPE29 个细胞系标签清单定义在hpaone.py中。图像按 4 通道解码加载与训练配置 dinov2/configs/train/cell_dino/vitl16_hpaone.yaml 中 student、teacher 均为in_chans: 4的设定一致。验证环境验证步骤要运行仓库自带的数据加载器先按docs/README_CELL_DINO.md的 “Installation” 一节建环境也可改为遵循 DINOv2 README 的说明conda create -n py310 python3.10 conda activate py310 pip install -r requirements.txt pip install -U scikit-learnREADME 有一条明确警告运行训练、评估命令时dinov2包必须在 Python 模块搜索路径中即命令前加PYTHONPATH.并在仓库根目录下执行。验证文件已就位在仓库根目录运行下面命令把PATH/TO/DATASET替换成你整理好的数据集根目录PYTHONPATH. python -c from dinov2.data.datasets import HPAone root PATH/TO/DATASET print(ALL:, len(HPAone(splitALL, rootroot))) print(TRAIN:, len(HPAone(splitTRAIN, modeCELL_TYPE, rootroot))) print(VAL:, len(HPAone(splitVAL, modeCELL_TYPE, rootroot))) HPAone在构造阶段就会打开并解析对应 split 的 CSV并按目录名定位图像CSV 缺失、无法读取时构造会直接失败。三个数量依次打印出来说明五个必需文件都已就位且命名正确图像文件本身是在之后按 CSV 中的路径逐个读取的这里只验证到 CSV 与目录结构层。mode也可以换成PROTEIN_LOCALIZATION与 README 评估命令中的两种模式一致。接入训练文件验证通过后把root代入 README 的 Cell-DINO 快速启动命令即可开始训练命令前缀按 README 警告加了PYTHONPATH.PYTHONPATH. python dinov2/run/train/train.py \ --nodes 4 \ --config-file dinov2/configs/train/cell_dino/vitl16_hpaone.yaml \ --output-dir PATH/TO/OUTPUT/DIR \ train.dataset_pathHPAone:splitALL:rootPATH/TO/DATASETREADME 说明该配置在 SLURM 集群中经 submitit 提交需要 4 个 A100-80GB 节点32 张 GPU训练耗时约 2 天训练代码每 9000 次迭代把 teacher 权重存入eval文件夹供后续评估使用。限制仓库中的 Cell-DINO 代码与模型权重仅限研究用途不用于任何医疗程序docs/README_CELL_DINO.md与 README.md “DINOv2 for Biology” 一节的明确声明代码为 CC BY-NC 许可模型权重为 FAIR Non-Commercial Research License。本文只覆盖 HPA 单细胞HPAone数据HPA-FoV 使用同一下载源但其加载器与文件清单不同见 dinov2/data/datasets/cell_dino/hpafov.py。【免费下载链接】dinov2PyTorch code and models for the DINOv2 self-supervised learning method.项目地址: https://gitcode.com/GitHub_Trending/di/dinov2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表