ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

知网文献批量下载怎么做:CNKI-download 工具简单实践

知网文献批量下载怎么做:CNKI-download 工具简单实践 知网文献批量下载怎么做CNKI-download 工具简单实践【免费下载链接】CNKI-download:frog: 知网(CNKI)文献下载及文献速览爬虫 (Web Scraper for Extracting Data)项目地址: https://gitcode.com/gh_mirrors/cn/CNKI-download交论文前夜还有一批参考文献要整理网页里一篇篇点过去复制标题、作者再逐个点下载。CNKI-download 就是一个用 Python 写的命令行工具帮你把知网检索结果里的文献信息批量抓下来再把原文文件CAJ 格式知网的官方文档类型批量存到本地。以前这些动作要靠浏览器里反复点跑一次脚本之后元数据会整理成 Excel 表格下载链接会存成清单需要哪几篇原文再挑着下。CNKI-download 安装与依赖配置项目基于 Python 3 实现克隆到本地后一条命令装完依赖git clone https://gitcode.com/gh_mirrors/cn/CNKI-download cd CNKI-download pip install -r requirements.txt依赖清单里是 requests、BeautifulSoup、xlwt 这类常见库。唯一需要留意的地方验证码自动识别依赖 tesseract 这个 OCR 引擎如果你打算一直手动输验证码安装前把 CrackVerifyCode.py 里调用 tesserocr 的两行注释掉即可。Config.ini 参数怎么配程序的行为都由根目录的 Config.ini 控制真正需要弄懂的只有四个开关isDownloadFile设为 1 才会把每篇文献的 CAJ 原文下进data/CAJs/设为 0 只记录链接不下载文件isCrackCode设为 1 时遇到验证码会用 OCR把图片里的字符转成文字自动识别设为 0 则弹出验证码图片让你自己输入isDetailPage设为 1 时额外抓取每篇文献的详情页把题名、作者、单位、关键词、摘要、来源写进 Excel 表stepWaitTime相邻两次请求之间的停顿秒数数值越大请求节奏越慢越不容易触发服务器端的反爬限制新手首跑推荐值isDownloadFile 0isDetailPage 1isCrackCode 0stepWaitTime 5。先空跑一遍只拿信息原文后面再补。运行 main.py实际流程长什么样终端里执行python main.py随后按提示一步步走选择检索字段主题、关键词、篇名、摘要、全文等可多选每个字段填入词再指定与上一个条件的逻辑关系并且 / 或者 / 不含。可选地限定来源期刊名称。脚本会告诉你命中多少条、预计耗时你可以选全部抓取或者只取前 N 条按每页 20 条换算页数。过程中弹出验证码时图片存在data/crack_code.jpeg手动模式下看图输入即可脚本会自动继续。跑完后所有结果落在 data/ 目录data/ ├── CAJs/ # 原文文件isDownloadFile1 时才生成 ├── Links.txt # 全部文献的下载链接 ├── ReferenceList.txt # 文献简要信息清单 └── Reference_detail.xls # 详细信息 Excel 表注意data 目录在每次启动时会被删掉重建上一轮的结果不会保留。一个完整实例毕业论文的文献整理以机器学习在医疗诊断中的研究为主题走一遍。检索字段选主题加关键词分别填两个词、用并且关联数量限制在 100 条左右配置用 isDetailPage 1、stepWaitTime 8其余保持首跑推荐值。跑完打开data/Reference_detail.xls100 篇的摘要、作者、发表时间都在表里。接着在表里做筛选把明显不相关的行删掉留下要精读的。对其中十几篇关键文献把 isDownloadFile 改成 1 再跑一次原文就进了data/CAJs/。Excel 里的题录信息可以直接粘进 Zotero 或 EndNote引用格式由文献管理软件代劳。整个过程里你真正动手的环节只有输验证码和看表。知网批量下载的五个坑验证码优先用手动。内置 OCR 的识别准确率有限作者自己也承认效果一般长期建议保持 isCrackCode 0。等待时间跟着网络走。校园网 3~5 秒够用公网我倾向给 8~10 秒如果报远程主机拒绝了访问先加长 stepWaitTime 再重试。分批处理别一口气跑完。只爬信息不下载时跑到约 1000 条附近可能出现反复弹验证码的情况即使输入正确大批量检索按年份或子主题切开多次跑更稳。重跑前关掉 Excel。data 目录下次启动会被删除重建Reference_detail.xls 等文件还开着的话删除会报错导致程序起不来。确认网络能直接访问知网。脚本的前提是当前 IP 能访问并下载知网资源通常是买了数据库的校园网公网无 IP 授权的环境受限项目也在规划跳转接口来补这块。使用的边界这个工具定位在个人学习与学术研究使用量保持在合理范围内别用于商业目的。下载到的文献仍受版权约束引用要规范也遵守知网的服务条款。三步开始它没有太多花哨的设计做的事情就是把重复的点击换成一段脚本而上手只需要三步按第一节命令装好依赖用首跑推荐配置空跑一次拿到 Excel在表里筛选需要原文时再打开下载开关跑一次【免费下载链接】CNKI-download:frog: 知网(CNKI)文献下载及文献速览爬虫 (Web Scraper for Extracting Data)项目地址: https://gitcode.com/gh_mirrors/cn/CNKI-download创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表