ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

三步搞定中文分词:segmentit JS 分词工具完整指南

三步搞定中文分词:segmentit JS 分词工具完整指南 三步搞定中文分词segmentit JS 分词工具完整指南【免费下载链接】segmentit任何 JS 环境可用的中文分词包fork from leizongmin/node-segment项目地址: https://gitcode.com/gh_mirrors/se/segmentitsegmentit 是开源开发者 linonetwo 维护的中文分词包基于 node-segment 魔改增强在任何 JS 环境都能运行把中文文本切分成带词性标注的词解决Node 分词库没法进浏览器的问题。为什么必须先分词中文词与词之间没有空格做关键词抽取、搜索索引、用户输入分析第一步都得先把句子切成词。自己写规则很容易翻车「工信处女干事每月经过下属科室」简单切分会把「处女」切出来意思完全跑偏。而现有分词库大多绑死在 Node 环境想在浏览器或 Electron 里用就得另想办法。⚡ 核心能力一览切分边界准「工信处/女/干事」切得干净利落「24口」这样的连续数字量词也不会被拆散自带词性标注每个词附带结巴风格的中英文词性「一条红色内裤」里的颜色词会正确标成形容词任何 JS 环境可跑Node、浏览器、Electron 通吃浏览器端有现成 UMD 构建流水线可扩展分词由 Tokenizer 中间件 Optimizer 结果修正串成一条链遇到特例写一个中间件即可不用动主流程 三步完成首次分词安装依赖npm i segmentit用useDefault初始化默认模块和词典一次加载好调用doSegment拿到结果import { Segment, useDefault, cnPOSTag } from segmentit; const segmentit useDefault(new Segment()); segmentit.doSegment(工信处女干事每月经过下属科室) .forEach(i console.log(${i.w} ${cnPOSTag(i.p)}));每个 token 都是「词文本 词性」的结构比如「干事」独立成词、「每月」标为时间词可以直接接进索引构建或命名实体预处理。 谁在用角色解决什么问题数据工程师用户输入先分词再送搜索引擎召回更准前端 / 桌面端开发者浏览器分词或 Electron 分词不依赖 Node 后端研究者配合词性标注做语料统计、关键词提取内容运营给文章标题批量打标签、抽关键词 怎么精简词典、加载自定义分词词典全量词典约 3.8M对浏览器项目偏大。不想全量加载时用 ESM 只引入你需要的词典和模块如盘古词典、停用词词典逐个载入webpack 的 tree shaking 会自动去掉用不到的部分。取舍依据看场景只要基础分词同义词典就不用引。如果领域里有产品名、行话这类专有词把自己写的词典文件通过loadDict载入即可这些词以后会被完整识别不用改源码。上手体验需要一套准确、随处可跑的中文分词segmentit 三行代码就能跑起来想写自定义 Tokenizer 这类进阶玩法翻一下项目里 src/module 目录的源码就有范例。【免费下载链接】segmentit任何 JS 环境可用的中文分词包fork from leizongmin/node-segment项目地址: https://gitcode.com/gh_mirrors/se/segmentit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表