ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Calibre 中文图书元数据获取完整指南:国家图书馆ISBN插件的3个最快工作流

Calibre 中文图书元数据获取完整指南:国家图书馆ISBN插件的3个最快工作流 Calibre 中文图书元数据获取完整指南国家图书馆ISBN插件的3个最快工作流【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin中文电子书入库后元数据经常缺东少西出版社、出版年缺失中图分类号更是几乎没人能帮你补上。国家图书馆ISBN插件正好解决这件事——它接入 Calibre按 ISBN 或书名检索国家图书馆目录自动回填书名、作者、出版信息和中图分类号等完整元数据。它凭什么值得装三个同类插件没有的能力1. 能拿到中图分类号CLC这是目前唯一能获取中图分类号的 Calibre 元数据插件。它不仅把代码原样带回来还支持按层级把它解析成可读的分类名称1–3 级默认 2 级并写进标签你的书库分类管理从此有据可依。2. 双路检索有 ISBN 走精确没 ISBN 走模糊有 ISBN直接精确匹配目录记录一次取回整条书目信息没有 ISBN输入书名走模糊搜索插件会顺带把对应的 ISBN 号一起带回来等于帮残缺的书补上了识别码。模糊搜索还支持自动拼接作者信息缩小匹配范围。3. 字段全还能区分版本返回项覆盖书名、作者、简介、出版社、出版年份和标签。另外插件会写入一个nlchash标识符书名出版年的哈希ISBN 相同但版本不同的书可以靠它区分批量整理时不会互相覆盖。从克隆到出结果最短安装与首次使用路径克隆仓库到本地git clone https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin打开 Calibre 的「首选项 插件」点「加载插件从文件」指向项目里的__init__.py入口文件在 src/ 目录下安装后在插件列表中勾选启用。在书库中选中一本中文书右键「编辑元数据」在弹出的元数据编辑器里点「下载元数据」。插件从国家图书馆检索完毕后核对信息、点确定即可——书名、作者、出版信息已经填好。全程就这 3 步不需要改任何代码。三个真实工作流单本补全、批量整理、学术文献库工作流一单本快速补全适用场景刚导入一本中文电子书元数据几乎全空。右键该书 →「编辑元数据」在 ISBN 栏填入号码没有就只填书名点「下载元数据」等插件回填确认无误后保存。得到书名、作者、出版社、出版年、简介、含分类的标签一次到位。工作流二批量整理书库适用场景库里几十上百本中文书信息混乱。框选需要整理的一批书批量触发元数据下载默认 2 线程 随机延时会控制请求节奏批量跑不用额外干预跑完后用nlchash字段核对 ISBN 相同、版本不同的书确认没有错配。工作流三建专业文献库适用场景研究人员按学科归档专著。导入专著后走 ISBN 精确检索拿全出版信息依赖中图分类号标签做学科归类解析层级默认 2 级够细但不啰嗦作者字段默认已清理「著/编」后缀引文信息可直接使用出版年份精确到目录登记值方便排引用格式。让它跑得又快又稳参数与限流保护配置入口在「首选项 插件 自定义插件」建议保持默认只有遇到问题再动参数默认值说明最大线程数2并发请求数。调大更快但请求过密可能触发国家图书馆对 IP 的封锁最大返回量6标题模糊搜索时最多取回几条结果越大请求量越大爬虫基础间隔时间200 ms实际间隔 基础间隔 30~600 ms 随机延时模拟自然访问节奏中图分类号解析层级2取值 1–31 只给一级分类3 给完整路径2 是平衡点其余开关标题/作者字段清洗、nlchash、纯净标签、带作者模糊搜索都是为适配国家图书馆目录的字段格式设计的。比如作者清洗会把「XXX 著」里的后缀去掉——如果你的作者名本身以「著/编」结尾关掉它即可其他项没有明确理由不必碰。踩坑清单常见报错与排查现象安装时报错 It does not contain a top-level init.py file→ 原因「加载插件从文件」时指向的位置不含插件入口__init__.py选错了层级。 → 解决把路径对准项目里的__init__.py再加载同时确认 Calibre 版本支持插件机制。现象ISBN 检索查不到任何记录→ 原因稀有书、新出版的书可能尚未进入国家图书馆目录。 → 解决改用书名模糊搜索或核对 ISBN 本身是否抄错。现象请求超时、反复失败→ 原因本地网络访问不到国家图书馆站点或此前请求过猛导致 IP 被临时限流。 → 解决先确认浏览器能正常打开国家图书馆 OPAC 检索页然后把线程数和间隔恢复默认过一段时间再重试。现象一个 ISBN 对应多本书时元数据下不下来→ 原因同一 ISBN 下存在多条目录记录不同版本。 → 解决保持nlchash开启默认即开启靠书名出版年区分版本或改走标题搜索从返回的多条结果里手动选定。现象书名、作者字段带多余字符→ 原因目录原始字段含「[著]」等标注。 → 解决标题/作者清洗默认已开启若个别作者名被误切关闭作者字段清洗。它在生态里的位置插件以元数据源source/identify的形式寄生在 Calibre 内部不改动主程序行为装完即用。配合 Calibre Web 这类 Web 书库管理工具时元数据同样完整入库线上线下共用一套书目信息。项目基于 Apache 2.0 协议开源见 LICENSE由 Doiiars 持续维护检索入口与字段解析在 src/init.py中图分类号的层级解析逻辑在 src/clc_parser.py。欢迎提交代码贡献也设有专门的交流群接收反馈。装上不复杂克隆仓库、指向__init__.py、点一下「下载元数据」——今晚装好明天你导入的每本中文书都能自动带上完整元数据和中图分类号。【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表