ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

公式截图不会自己变成 LaTeX?pix2tex 帮你 5 分钟搞定

公式截图不会自己变成 LaTeX?pix2tex 帮你 5 分钟搞定 公式截图不会自己变成 LaTeXpix2tex 帮你 5 分钟搞定【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR审稿意见里贴来的一张公式截图你想在自己的文档里复用它总不能一行行手敲吧。LaTeX-OCRpip 包名 pix2tex干的就是这件事丢给它一张公式图片它吐回对应的 LaTeX 代码——这就是「公式图片转LaTeX」最直接的实现方式也是目前用得最顺手的公式识别工具之一。什么情况下你会需要它几个特别高频的场景引用 PDF 里的公式你从文献里看中一个推导直接复制 PDF 文本大概率得到一串乱码而截图后用 pix2tex 跑一下几秒就能拿到可编辑的源码备课与写讲义做 beamer 或 Markdown 笔记时黑板上的公式拍照存档回头批量转成代码不用对着照片重打自动化流水线写脚本批量处理扫描版论文里的公式图片配合 Python 接口或 API 接口把人工录入变成一键生成适合谁写论文的研究人员、被公式输入折磨的学生以及需要把大量历史文档数字化排版的工程师。5 分钟装好 pix2tex先确认两件事Python 版本 ≥ 3.7系统里已有 PyTorch照着 PyTorch 官网指引装本文不展开。pip 方式多数人用这个就够pip install pix2tex[gui]首次运行时会自动下载模型 checkpoint网络通畅的话几分钟搞定。方括号里还可以按需换依赖[api]装 API 依赖、[train]装训练依赖、[all]全都要。Docker 方式不想污染本机环境docker pull lukasblecher/pix2tex:api docker run --rm -p 8502:8502 lukasblecher/pix2tex:api跑完这两条API 服务就挂在 8502 端口了。一条主流程从截图到拿到代码不管走哪个入口动作序列都是截图 → 送图 → 拿代码。截图可以保存成文件也可以直接留在剪贴板里。① 命令行最轻的入口装完就有一个pix2tex命令处理磁盘上的图片pix2tex path/to/formula.png不想先存文件直接读剪贴板里的图片即可终端里直接打印结果。② GUI最顺手的入口latexocr打开窗口后框选屏幕上的公式区域识别结果用 MathJax 实时渲染出来给你核对结果同时已复制到剪贴板回编辑器里粘贴就行。觉得这次结果不对点 Retry 重新跑一次。③ API适合批量和远程前面用 Docker 起的服务或本机执行python -m pix2tex.api.run都会暴露一个 HTTP 接口把图片 POST 到/predict/返回的就是 LaTeX 字符串。写个循环批量调用扫描版论文里的公式可以整本转。④ Python 集成嵌进自己的项目只有四行代码拿到LatexOCR对象后对图片对象调用一下返回的就是 LaTeX 字符串方便你接后处理逻辑比如自动校验括号配对。四个入口只是送图方式不同模型和预处理逻辑是同一套。让识别更准的几个操作框紧公式主体→ 截图范围里只留公式本身少带文字和装饰线识别干扰更小保持底色干净→ 白底黑字最稳复杂背景上的公式容易认错上下标别把图拉得巨大→ 项目内置了一个小网络自动预测最优分辨率并缩放输入见 pix2tex/model/settings/config.yaml 中的max_width/max_height上限但原始图过大仍可能处理不理想调 temperature→ 模型不确定时会每次输出不同结果temperature 调低如 0.2让多次识别结果趋于一致调高则增加多样性多按几次 Retry→ 同一张图重复采样几次交叉对比能暴露哪些 token 是摇摆的顺带一提官方公布的测试数据BLEU 0.88、归一化编辑距离 0.10、token 级准确率 0.60——意味着复杂公式仍有约四成 token 可能对不上最后一步人工核对省不掉。常见坑与应对模型下载失败或卡住现象首次运行长时间无输出。 原因checkpoint 体积较大网络不通或被墙。 解法手动把权重文件下载到~/.cache/pix2tex/对应目录再运行。识别结果和原图对不上现象下标、分式位置错乱或符号缺失。 原因多为截图范围过大、分辨率过高或图像模糊。 解法重新框选更紧的区域、把原始截图分辨率降下来再试仍不对就用--no-resize关掉自动缩放跑一遍对比。Linux 上 GUI 截图功能不可用现象latexocr窗口里区域截图点击没反应。 原因不同桌面环境的截图工具兼容性差异X11 用 gnome-screenshotwlroots 系 Wayland 需要 grim/slurpKDE 用 spectacle。 解法设置环境变量SCREENSHOT_TOOL指到当前桌面实际支持的工具如grim或spectacle。速度太慢现象CPU 上跑一张图要等好几秒。 原因没有可用 GPU或图片被放得太大。 解法低配机器可传--no-cuda强制走 CPU 路径并接受慢速同时把输入图缩小到公式本身。收尾一张截图换一段能直接编译的 LaTeX 源码pix2tex 把公式重录这个最枯燥的环节压到了几秒钟——装一次用很久。更多细节可查官方文档docs/installation.md模型参数参考 pix2tex/model/settings/config.yaml。【免费下载链接】LaTeX-OCRpix2tex: Using a ViT to convert images of equations into LaTeX code.项目地址: https://gitcode.com/GitHub_Trending/la/LaTeX-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表