ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Tesseract 从零编译实战指南

Tesseract 从零编译实战指南 Tesseract 从零编译实战指南【免费下载链接】tesseractTesseract Open Source OCR Engine (main repository)项目地址: https://gitcode.com/GitHub_Trending/te/tesseractTesseract 是应用最广泛的开源 OCR 引擎之一。本文面向需要本地部署文字识别能力的开发者用四张任务卡带你从源码编译、安装语言数据到跑通第一次识别全程以 Ubuntu/Debian 系 Linux 为例。阶段你将得到的东西一句验证方式依赖就绪编译器与 Leptonica 等构建库齐备pkg-config --modversion lept能输出版本号编译安装tesseract 可执行文件与动态库tesseract --version显示 5.5.0语言数据eng 语言模型就位tesseract --list-langs列出 eng首次识别一张图片的识别文本终端输出与图中文字一致开始之前依赖与耗时清单本段把环境要求一次列清看完即可确认你的系统是否满足完整构建条件。项要求系统Ubuntu/Debian其他发行版请自行映射包名编译器支持 C17 的 g 或 clang核心依赖automake、autoconf、libtool、pkg-config、libleptonica-dev≥1.74.2图像库libpng-dev、libjpeg-dev、libtiff-dev、zlib1g-dev训练工具依赖可选libpango1.0-dev、libcairo2-dev、libicu-dev大致耗时10~30 分钟随 CPU 核数浮动任务一拉取 Tesseract 源码并核对版本本步拿到可编译的源码树完成后你拥有一个版本明确的源码目录。目标获取 Tesseract 源码并确认版本号。操作git clone https://gitcode.com/GitHub_Trending/te/tesseract # 拉取源码 cd tesseract # 进入项目 cat VERSION # 查看版本号检查点$ cat VERSION 5.5.0备注系统里若还装着旧的 tesseract 4.0x先卸载再编译避免新旧二进制互相干扰仓库内 INSTALL.GIT.md 有说明。任务二构建依赖一次装齐本步装齐全部编译依赖完成后你不再需要中途补装任何包。目标安装核心构建链并按需追加训练工具依赖。操作sudo apt-get update sudo apt-get install -y automake autoconf libtool pkg-config libleptonica-dev # 构建链 Leptonica sudo apt-get install -y libpng-dev libjpeg-dev libtiff-dev zlib1g-dev # 图像格式支持 sudo apt-get install -y libpango1.0-dev libcairo2-dev libicu-dev # 训练工具依赖纯推理可跳过检查点$ pkg-config --modversion lept 1.82.0 # 具体数值随系统而定≥1.74.2 即可备注官方构建文档要求 C17 编译器Ubuntu 20.04 起默认 gcc 已满足更老系统需升级编译器。任务三CMake 配置、编译并安装 Tesseract本步产出可执行文件与动态库完成后tesseract --version即可用。目标用 CMake 完成一次完整的配置—编译—安装。操作mkdir build cd build # CMake 禁止在源码目录内构建须用独立目录 cmake .. -DCMAKE_INSTALL_PREFIX/usr/local # 配置默认 Release make -j$(nproc) # 多核并行编译 sudo make install sudo ldconfig # 安装并刷新动态库缓存检查点$ tesseract --version tesseract 5.5.0 leptonica-1.82.0✅ 输出的主版本号与VERSION文件一致即通过。备注更习惯 Autotools 的话在源码根目录执行./autogen.sh ./configure --prefix/usr/local make其余步骤相同。常用 CMake 选项选项默认作用BUILD_TRAINING_TOOLSON是否编译 lstmtraining 等训练工具DISABLED_LEGACY_ENGINEOFF禁用旧版 OCR 引擎ENABLE_LTOOFF链接时优化BUILD_TESTSOFF编译单元测试INSTALL_CONFIGSON安装 tessdata/configs 下配置文件任务四安装语言数据并完成首次识别本步补齐运行期数据完成后你可以对任意图片跑通一次 OCR。目标让 Tesseract 找到语言模型并完成第一次文字识别。操作sudo mkdir -p /usr/local/share/tessdata # 语言数据目录 # 将 eng.traineddata 与 osd.traineddata 放入该目录从官方 tessdata 数据仓库单独下载 export TESSDATA_PREFIX/usr/local/share/tessdata # 指向数据目录 tesseract sample.png stdout -l eng # 任意清晰文字图结果直接输出到终端检查点$ tesseract --list-langs eng✅ 识别文本与图片内容一致即部署完成。备注只下载自己需要的语言文件官方文档提醒 tessdata 完整仓库超过 1.2 GB不要整体 clone。避坑清单编译与运行期常见错误以下五条覆盖从配置到运行的典型报错按现象查表即可。现象原因一行修复CMake generation is not possible within the source directory!在源码根目录内直接运行了 cmake删掉 CMakeCache.txt改在独立 build 目录重新 cmakeError opening data file eng.traineddataTESSDATA_PREFIX 指向的目录里没有语言文件设置 TESSDATA_PREFIX 并放入 eng/osd.traineddataconfigure 阶段提示找不到 Leptonica缺 libleptonica-dev 或版本低于 1.74.2sudo apt-get install libleptonica-devtesseract: command not found安装路径的 bin 目录不在 PATH把 prefix/bin 加入 PATH并执行sudo ldconfig识别行为异常、链接到旧库残留 tesseract 4.0x 与新版混装先卸载旧版再重新make install扩展菜单部署完成后的三个方向C/C 集成include/tesseract/提供 baseapi.h、capi.h 等头文件可把 libtesseract 链进自有服务。自定义训练用训练工具lstmtraining 等为特定场景训练专用 traineddata。性能调优结合 LTO、SIMD 加速选项与图像预处理提升大批量扫描件的处理速度。【免费下载链接】tesseractTesseract Open Source OCR Engine (main repository)项目地址: https://gitcode.com/GitHub_Trending/te/tesseract创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表