
Awesome Public Datasets不用全网翻找公开数据集按主题挑好了【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets做数据分析的人都知道最难的一步往往不是建模而是找数据搜索引擎翻十几页得到的要么是付费墙、要么是失效链接。Awesome Public Datasets 把分散各处的高质量公开数据集按主题整理成一份清单你打开目录就能挑省掉的是反复试错的时间。场景你需要一份电商评论数据去哪找假设你下周要交一个产品评论情感分析的作业第一步永远是找数据。常规路径是搜索引擎加数据集网站碰运气但你会花大量时间甄别这份数据还在不在、格式清不清、许可允不允许商用。Awesome Public Datasets 替你做了第一层筛选条目按主题分区每个数据集带一段描述链接状态用图标做了区分。你不用自己满网爬打开目录就能挑。它不替你下载但把去哪下、数据长什么样这两件事先答定了。数据全景按你要做什么翻目录 README 按 Agriculture、Biology、Economics、MachineLearning 等主题分区但对新手更有用的翻法是按任务类型对号入座做分类建模、入门练习Titanic Survival Data SetSocialSciences 区是经典入门集乘客属性预测生存率数据小、字段干净适合练数据清洗和逻辑回归。仓库的Datasets/目录里就放了一份titanic.csv.zip样例可以直接解包上手。做推荐系统MovieLens Data SetsMachineLearning 区包含用户-电影评分数据是推荐算法练习的标准靶子协同过滤、内容过滤都能在上面跑通。它的元数据文件是MachineLearning/MovieLens-Data-Sets.yml先看元数据里的关键词和版本说明再决定拿哪个规模100K、1M、20M 都有。做时序预测NYC Taxi Trip DataTransportation 区提供纽约出租车行程记录时间戳、上下车点、费用齐全适合做客流预测和定价分析也是机器学习课里常用的回归案例。做文本、NLPNaturalLanguage 区收录了从语料库到标注任务的多种资源比如 Automatic Keyphrase Extraction 这类带标注的中小数据集拿来做抽取式任务很合适要更大规模的语料可以顺着该区的入口继续找。做地理空间分析GIS 区里 GeoNames、OpenStreetMap、Natural Earth 这类基础地理数据齐全再配合 Government 区里各城市的开放数据如 NYC Open Data做位置类分析基本够用。最短上手路径三步就能开始用克隆仓库git clone https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets打开 README.rst从顶部目录跳到你的任务主题每条数据集后面都有两个链接数据源地址和 MetaYAML 元数据。先看元数据里的描述、关键词、数据规模确认匹配需求再回数据源下载。避坑提醒FIXME 图标不是装饰每个条目前有两个状态的图标之一OK 表示链接可用FIXME 表示待修复——这类数据源可能已迁移或下线使用前务必先验证官网还活着。大部分免费但不是全部README 明确写了多数数据集免费、少数不免费。生物、医疗类数据常附带数据使用协议下载前看条款尤其打算写论文或商用的时候。README 是自动生成的它由 YAML 元数据生成直接改 README 不会被采纳。想贡献新数据集按贡献指南提交对应的 YAML 文件即可不需要动清单本身。数据会过时清单靠社区维护个别条目更新滞后。像 Lending Club 贷款数据这类标 FIXME 的条目建模前最好核对数据年份和字段版本。clone 下来之后别从头通读 README——翻到目录按你手头的任务类型挑一个主题区从第一个 OK 状态的数据集开始看起。【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考