ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

在 Label Studio 中构建光学字符识别(OCR)标注模板:区域框选、标签与文本转录实战

在 Label Studio 中构建光学字符识别(OCR)标注模板:区域框选、标签与文本转录实战 在 Label Studio 中构建光学字符识别OCR标注模板区域框选、标签与文本转录实战【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio光学字符识别OCR标注是文档数字化、票据识别、车牌识别等场景的基础数据生产环节。Label Studio 提供了内置的 Optical Character RecognitionOCR标注模板允许标注人员先用矩形或多边形框选出图像中的文本区域再为每个区域打上印刷文本 / 手写文本等类别标签最后逐区域转录出对应的文字内容。本文将基于该模板的完整配置逐标签拆解参数语义并对照仓库源码与关联用例讲解如何把这一模板落地到真实标注项目、如何理解其输出结构以及与 EasyOCR 等 ML 后端配合实现预标注加速。OCR 模板解决什么问题在计算机视觉标注体系中OCR 任务与普通目标检测最大的区别在于除了要定位文本所在的区域还要知道区域属于哪一类文本并读出区域内的具体文字。因此一个完整的 OCR 标注模板至少需要三类能力区域定位用矩形Rectangle或多边形Polygon圈出文本出现的位置类别判定用 Labels 控制标签为区域指定类别如Text印刷文本或Handwriting手写文本文本转录用 TextArea 为每个区域填写识别出的文字内容。仓库内置模板的行业应用说明见 模板配置文件列举了文档数字化、发票处理、收据扫描、车牌识别、银行自动化、保险理赔、表单处理、护照扫描、历史文档保护、法律检索、医疗档案等典型场景并标注了 Tesseract、PaddleOCR、EasyOCR、TrOCR、CRAFT、DBNet 等常见关联模型——这也印证了该模板的通用性它既支持纯人工标注也天然兼容模型预标注结果的回填。完整的标注配置模板的完整标注配置如下同样收录在 optical-character-recognition 模板配置 中View Image nameimage value$ocr/ Labels namelabel toNameimage Label valueText backgroundgreen/ Label valueHandwriting backgroundblue/ /Labels Rectangle namebbox toNameimage strokeWidth3/ Polygon namepoly toNameimage strokeWidth3/ TextArea nametranscription toNameimage editabletrue perRegiontrue requiredtrue maxSubmissions1 rows5 placeholderRecognized Text displayModeregion-list / /View其中value$ocr表示从任务数据中读取名为ocr的字段作为图片 URL导入任务时需要保证每个任务包含类似{ocr: https://example.com/scan.jpg}的数据结构。逐标签解析配置1. View一切标注配置的根容器所有标注配置必须包裹在View标签内它决定了标注界面中各组件的整体布局参见 View 标签文档。2. Image指定待标注图片Image nameimage value$ocr/Image是对象Object标签负责渲染待标注的图片。nameimage是供其他控制标签通过toName引用的标识符value$ocr从任务数据中取图详见 Image 标签文档。3. Labels为区域指定类别Labels namelabel toNameimage Label valueText backgroundgreen/ Label valueHandwriting backgroundblue/ /LabelsLabels控制标签通过toNameimage绑定到图片对象定义了标注人员可以赋予不同形状区域的类别集合。每个Label的value是类别名称background决定该类别区域在画布上的高亮颜色。你可以自由修改value来适配不同 OCR 任务例如改成Letters和Numbers或者参考 OCR 文档数字化用例 中更细粒度的方案——Printed Text印刷文本、Handwritten Notes手写笔记、Stamp or Seal印章、Signature签名四种类别分别使用绿、蓝、橙、紫四种背景色。完整参数说明见 Labels 标签文档。4. Rectangle绘制无标签矩形框Rectangle namebbox toNameimage strokeWidth3/Rectangle控制标签用于在图像上添加矩形Bounding Box。这里刻意使用Rectangle而非RectangleLabels是因为Rectangle生成的区域不携带预选标签从而把 OCR 标注拆成先画区域 → 再打标签 → 后写文本三个独立步骤更符合 OCR 任务的操作习惯也便于回填模型预标注结果。strokeWidth3控制边框线条宽度。根据 Rectangle 标签参数文档该标签还支持opacity默认 0.6、fillColor填充色、strokeColor默认#f48a42、canRotate默认 true是否显示旋转控制、smart/smartOnly智能预标注工具以及snap吸附到图像像素等参数。5. Polygon绘制不规则文本区域Polygon namepoly toNameimage strokeWidth3/当文本区域不是规则的矩形例如倾斜的招牌、弯曲的段落、票据上的印章等时可以使用Polygon用顶点勾勒出任意形状。strokeWidth同样控制轮廓线宽度。该标签常用于需要精细边界的场景完整参数见 Polygon 标签文档。6. TextArea逐区域转录文本TextArea nametranscription toNameimage editabletrue perRegiontrue requiredtrue maxSubmissions1 rows5 placeholderRecognized Text displayModeregion-list /TextArea是本模板中承载文本转录的核心控制标签其各参数的语义如下参数值作用editabletrue允许标注人员在提交文本后再次编辑修改perRegiontrue使文本框与每个区域绑定而非针对整张图片每个区域对应一条独立转录文本requiredtrue强制每个区域都必须填写文本否则无法提交标注maxSubmissions1每个区域最多提交 1 条文本避免重复录入rows5文本框显示 5 行便于阅读长文本当rows1时可直接按 Enter 提交行数大于 1 时需点击 Add 或按 Shift EnterplaceholderRecognized Text标注人员编辑前在文本框内显示的提示占位文字占位符不可作为内容提交区别于value的预填值displayModeregion-list文本框以区域列表模式显示在 Regions/Outliner 面板中每个区域一个输入框便于逐区域对照修改以上参数均可在 TextArea 标签参数文档 中查到默认值与类型定义例如editable默认false、rows默认1、displayMode默认tag、required默认false。该文档还指出若配合transcriptiontrue文本域在提交后会继续保持可编辑状态而skipDuplicatestrue可以阻止重复文本提交。在 TextArea 标签文档 的 Region list TextArea fields 示例中给出了与本模板一致的 OCR 用法并强调displayModeregion-list时文本框会渲染在 Regions 面板而非标注画布上。理解标注结果结构从本模板的组合方式可以推断标注结果的组织形态画布上的每个矩形或多边形区域region携带一个labels数组记录Text或Handwriting类别以及区域几何坐标而perRegiontrue的 TextArea 产生的文本通过 region id 与对应区域关联形成区域 → 类别 → 转录文本的完整三元组。这种结构直接对应用例文档中text detection文本检测 text recognition文本识别的 OCR 任务拆解范式下游模型训练时可以分别消费几何信息和文本信息。标注操作流程在 Label Studio 标注界面中使用本模板完成一个 OCR 任务需要三步画区域并打标签先在左侧工具区选择一个标签例如 Handwriting然后用矩形或多边形工具在图像上框出文本区域打开 Outliner 面板如果 Outliner区域列表面板尚未打开请先将其展开——该面板通常位于界面左侧与模板配置中的displayModeregion-list配合使用每个区域在这里对应一个独立的文本输入框逐区域填写文本为每个区域输入识别出的文字内容。由于配置中设置了requiredtrue任何区域缺少转录文本时提交标注都会收到缺失文本的警告提示。模板变体与场景扩展该模板的设计骨架Image Labels Rectangle/Polygon perRegion TextArea可以低成本迁移到不同 OCR 子任务。仓库中已收录多个同源变体文档数字化见 OCR for Document Digitization将类别扩展为印刷文本、手写笔记、印章、签名四类适用于合同、医疗档案等文档的数字化归档教育评估见 OCR for Educational Assessment将类别改为 Multiple Choice、Essay、True/False、Matching 等题型用于扫描答卷的文本提取与题型归类发票/收据与医疗分别见 ocr_market 与 ocr_plates 用例发票预标注 NER见 OCR Invoices Pre-NER BIO Format在 OCR 转录基础上叠加 BIO 格式的命名实体标注支撑票据信息抽取流水线PDF 文档 OCR见 PDF OCR 模板面向多页 PDF 文档的文本识别标注。与 ML 后端集成用 EasyOCR 做预标注本模板先画区域再转录的形态天然适合模型预标注回填。仓库的 EasyOCR 模型连接教程 展示了标准集成方式启动 Label Studio ML 后端可通过docker-compose up启动并用curl http://localhost:9090/验证返回{status:UP}然后在项目设置的 Model 页面连接http://localhost:9090。EasyOCR 后端会自动在图像文本区域生成带转录内容的标注建议标注人员只需校对修正即可大幅减少从零标注的工作量。该教程同时提示当前 EasyOCR 连接实现要求图片可通过公网 URL 访问直接上传到 Label Studio 的图片暂不受支持。需要注意EasyOCR 教程中的配置将Image的value写为$image而本模板使用$ocr——两者只是字段名约定不同实际使用时需与任务数据字段保持一致。相关标签速查Image 标签渲染待标注图像Labels 标签定义区域类别集合Rectangle 标签矩形区域绘制工具Polygon 标签多边形区域绘制工具TextArea 标签区域文本转录输入框模板配置源文件仓库内置模板的原始配置与行业说明【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表