ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

spaCy 训练好的模型如何手动下载安装到自定义目录?

spaCy 训练好的模型如何手动下载安装到自定义目录? spaCy 训练好的模型如何手动下载安装到自定义目录【免费下载链接】spaCy Industrial-strength Natural Language Processing (NLP) in Python项目地址: https://gitcode.com/GitHub_Trending/sp/spaCy当你需要把 spaCy 的训练好的 pipeline如en_core_web_sm放到自己指定的目录、而不是默认安装进site-packages时——例如受管环境、离线部署或统一的数据目录管理——文档提供了手动下载这条路径从官方发布渠道拿到包归档文件解压后把pipeline 包目录放到文件系统任意位置再用spacy.load()传本地路径加载。整个流程依据 模型使用文档、CLI 参考 与保存/加载文档。准备条件已安装 spaCy模型包与 spaCy 版本需兼容见文末限制与边界。v3.0 起en这类快捷别名会在 spaCy 安装目录创建符号链接已弃用下载和加载都要用完整包名例如en_core_web_sm而不是en- python -m spacy download en python -m spacy download en_core_web_sm - nlp spacy.load(en) nlp spacy.load(en_core_web_sm)第一步获取模型包的下载地址用spacy info的--url参数v3.5.0 起支持打印与当前 spaCy 版本兼容的最新 pipeline 版本下载地址$ spacy info en_core_web_sm --url该命令会输出一个 URL可用于自动化脚本或直接在浏览器中下载。注意文档明确说明查询兼容性信息需要互联网连接。如果你能访问浏览器也可以直接到 spacy-models 的最新 releases 页面查找下载链接文档同样说明你可以基于归档文件的 URL 自行配置下载脚本。包名规则可参考模型文档的命名规范[lang]_[name]形式例如en_core_web_md中的core表示通用能力分词标注、句法解析、词形还原、命名实体识别md/lg等表示包大小档位。第二步下载归档并了解目录结构手动下载得到的归档.tar.gz或 wheel内部是一个包目录其中还嵌套了一个存放 pipeline 数据的目录└── en_core_web_md-3.0.0.tar.gz # downloaded archive ├── setup.py # setup file for pip installation ├── meta.json # copy of pipeline meta └── en_core_web_md # pipeline package ├── __init__.py # init for pip installation └── en_core_web_md-3.0.0 # pipeline data ├── config.cfg # pipeline config ├── meta.json # pipeline meta └── ... # directories with component data以上为文档中给出的目录结构示例。关键点pipeline 包目录可以放在你本地文件系统的任意位置。也就是说解压后把里面带有config.cfg的那一层上例中的en_core_web_md-3.0.0即pipeline data目录移动到你想要的自定义目录即可无需执行任何安装。第三步用 spacy.load 从自定义目录加载并验证对自定义目录中的模型用spacy.load传入数据目录的本地路径。加载时 spaCy 会在这个目录里查找config.cfg读取其中的lang和pipeline设置来初始化Language类并载入模型数据import spacy nlp spacy.load(/path/to/en_core_web_sm) # 替换为你放置模型的自定义目录路径 doc nlp(This is a sentence.)验证方式有两种均来自文档直接跑一句文本doc nlp(This is a sentence.)若返回Doc对象且能取到分词、实体等结果说明模型已正确加载文档示例。查看元数据加载后的Language对象通过meta属性暴露 pipeline 元数据nlp.meta[version]返回包版本也可以在加载前用spacy info/spacy.info()打印包元数据做核对。如果你只想加载二进制数据而不走配置初始化文档给出了另一条路径先创建Language类再调用from_disknlp spacy.blank(en).from_disk(/path/to/data)替代路径用 pip 直接安装对比参考如果你的目标不是自定义目录而是常规的依赖管理文档推荐用pip指向 URL 或本地文件路径安装而不是 spaCy 的download命令# 用 spacy info 输出的 URL 直接安装 $ pip install $(spacy info en_core_web_sm --url) # 或指向已下载的本地文件 $ pip install /Users/you/en_core_web_sm-3.0.0-py3-none-any.whl默认这会安装进site-packages随后用包名加载spacy.load(en_core_web_sm)或import en_core_web_sm; en_core_web_sm.load()。文档还建议把直接下载链接写进应用的requirements.txtpip 支持包名 直接URL形式URL 即spacy info --url的输出这样模型就成为可版本化、可声明的依赖。python -m spacy download命令本身也是官方下载入口它会做兼容性检查并调用pip install安装到site-packages因此不适合自定义目录场景其常用参数可参考 CLI 文档--direct强制指定精确版本直接下载、--sdist下载源码归档而非 wheel、--url从镜像仓库下载。文档同时提醒download更适合交互式使用自动化流程推荐 pip 直接链接。限制与边界版本兼容pipeline 包版本a.b.c中a/b对应 spaCy 的主/次版本号c是模型版本。手动下载时请确保选的包版本与你的 spaCy 版本兼容spacy info --url输出的正是与当前 spaCy 兼容的最新版本地址。升级 spaCy 后升级 v3.x 需要下载对应的新 pipeline 包自训的 pipeline 在升级 spaCy 后需要重新训练。文档建议升级后用spacy validate检查已安装的 pipeline 包是否仍与当前 spaCy 兼容。若语言已有训练 pipeline 但你的环境缺少lookups依赖词形还原规则功能需要 spaCy 以lookups选项安装或在同环境安装spacy-lookups-data这一点在模型文档中有明确提示。相关文档Models Languages安装与使用训练 pipelineCLI 参考download / info 命令Saving and Loading从数据目录加载自定义 pipeline 包【免费下载链接】spaCy Industrial-strength Natural Language Processing (NLP) in Python项目地址: https://gitcode.com/GitHub_Trending/sp/spaCy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表