
gh_mirrors/dataset/datasets 数据格式详解CSV/JSON文件规范、节点索引规则与特征解析教程【免费下载链接】datasetsA repository of pretty cool datasets that I collected for network science and machine learning research.项目地址: https://gitcode.com/gh_mirrors/dataset/datasetsdatasets 是一个面向网络科学与机器学习研究的数据集仓库收录了 13 组真实社交网络与图数据。本文用 1 个实例目录带你快速搞懂其中的CSV 文件规范、节点索引规则与 JSON 特征格式新手也能零基础上手。 仓库里到底有哪些数据文件整个仓库结构非常精简数据全部集中在 tigerlily_example_data/ 目录文件行数含表头用途edges.csv816,684异构图边列表drug–gene 关联target.csv187,851药对pair二分类标签pagerank_scores.csv54,111个性化 PageRank 完整得分pagerank_toy_scores.csv251剪枝后的精简得分配套的 README.md 则记录了全部数据集的统计信息节点数、边数、密度、传递性和推荐任务。 CSV 文件规范边列表三件套1. 边文件 edges.csv标准的“两节点 附加列”格式表头为node_1,node_2,type_1,type_2 DB00008,ENTREZ:995300,drug,gene DB00009,ENTREZ:306914,drug,gene前两列是边的两端节点后两列声明各自的节点类型drug/gene。这种“带类型的边列表”是异构图数据的通用写法读取时只需按逗号 split 即可。2. 目标文件 target.csv用于训练/评估的监督标签表头为drug_1,drug_2,labellabel取 0 或 1是典型的二分类药对评分格式。3. 得分文件 pagerank_scores.csv表头为node_1,node_2,score每行记录“源节点 → 目标节点”的 PageRank 分值。对比 pagerank_toy_scores.csv 可以发现toy 版只保留了每个节点得分最高的前若干邻居每节点 8 行左右这就是**剪枝pruning**后的版本——完整 5.4 万行被压缩到 251 行模型推理时加载更快。 节点索引规则0 起整型 vs 带前缀字符串 ID仓库中存在两种节点标识体系这是新手最容易混淆的点规则一从 0 开始的整型索引Deezer、Facebook、Wikipedia 等数据集在 README 中明确说明 “nodes are indexed from 0”。即edges.csv里第 0、1、2…… 号用户就是节点本身特征 JSON 的键也必须用同一套 0 起编号两者才能对齐。规则二带前缀的字符串 IDtigerlily 示例数据则保留了原始 ID通过前缀区分类型DB00008→ 药物drugENTREZ:995300→ 基因gene好处是自解释、可直接映射回公共数据库代价是 ID 不连续做邻接矩阵前需要先建立一张 ID → 行号的映射表。 快速判断方法看edges.csv第一列——纯数字且从 0 开始就是规则一带字母/冒号前缀就是规则二。️ JSON 特征文件规范键值对 特征列表README 对 JSON 特征格式有统一约定以 Deezer、Wikipedia 数据集为例“json files contain the features —each key is a user/page id, and the features are given as lists.”也就是说JSON 是一个扁平字典键节点 ID与 CSV 边文件同体系保证一一对应值特征列表例如用户的音乐流派偏好、文章中出现的名词各节点的特征标注保持一致README 指出 Deezer 中所有用户共享同一套 84 个流派标签词表这样一行特征向量就能对齐这种“列表 全局词表”的写法等价于稀疏 one-hot非常适合直接转成特征矩阵喂给模型。 特征解析从原始列到模型输入结合 pair_scoring.jpg 的四步流程可以把数据解析路径总结为图定义与上传edges.csv构出节点与边type列决定节点类型PageRank 计算与剪枝对每个源节点如DB01620计算到全图节点的得分保留 Top-K 邻居即 toy 文件节点嵌入把剪枝得分与 JSON 特征列表拼接成节点向量推理用向量对target.csv中的药对打分✔/✘。注意 pagerank_scores.csv 中每 8 行重复出现同一个node_1如DB01620说明该文件是按源节点分组的长表解析时记得groupby(node_1)再取分数。✅ 新手避坑清单索引对齐边 CSV 与特征 JSON 必须使用同一套节点 ID 体系读取后先校验集合是否一致toy vs 完整实验调试用pagerank_toy_scores.csv追求精度换回完整版类型列别丢type_1/type_2是异构图的类型信息直接删列会丢失 drug/gene 区分稀疏特征JSON 值是变长列表转矩阵时按全局词表 pad/one-hot不要直接拼串统计信息写论文前先查 README.md 中每个数据集的 Nodes/Edges/Density 表。 延伸阅读更多数据集Twitch、LastFM、Reddit、GitHub 等社交网络的完整清单与引用格式见 README.md其目录结构涵盖Twitch Gamers、LastFM Asia、Deezer Europe、GitHub StarGazer、Reddit Threads、Facebook Page-Page、Wikipedia Articles 等 13 组网络科学基准可直接作为图分类、节点分类、链接预测的起步数据。【免费下载链接】datasetsA repository of pretty cool datasets that I collected for network science and machine learning research.项目地址: https://gitcode.com/gh_mirrors/dataset/datasets创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考