
字号不再靠目测深挖image-to-editable-ppt-skill的OCR测量驱动文字还原机制【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill把一张幻灯片图片转成可编辑 PPT最难的不是字认得对不对而是字号和位置还原得像不像——靠 AI 目测猜字号标题和副标题差 2 号、正文忽大忽小几乎是必然。image-to-editable-ppt-skill 用一套OCR 测量驱动的文字还原机制解决了这个问题先把源图里每一行文字量出真实的墨迹高度再换算成标准字号并自动分组AI 按测量值还原文本文字不再依赖目测。为什么目测字号会翻车传统的图片转 PPT 思路是让视觉模型看图写字模型大致估算文字位置凭感觉选字号。问题在于同级文字不一致同一层级的正文模型可能一会儿给 18pt 一会儿给 20pt页面观感立刻劣化整体偏小构建器为了保证文字不溢出文本框通常会做保守缩排文字系统性地比源图小位置漂移框的坐标也是估的放大缩小后更容易错位。image-to-editable-ppt-skill 的做法是测量值优先。在写页面清单manifest之前先为每一页生成文字标注——每行文字的框坐标 字号 字号分组模型只负责按测量值填字。这套机制的核心代码在 skills/image-to-editable-ppt/cli/editppt/runtime/text_hints.py。以一张典型的信息图为例原图里标题、副标题、正文、脚注分属不同字号层级还原时最容易乱三步测量流程从源图墨迹到标准字号测量管线完全确定性不依赖大模型分三步第一步局部二值化 XY-Cut 切出文字行页面被切成 96×96 的小块每块用 Otsu 阈值化得到墨迹掩码。局部阈值化能同时适应深色卡片和浅色背景对照片、渐变这类不可靠区域直接不参与。随后递归 XY-cut 沿行、列空隙不断切分直到切出一个个叶子区块再用实心度、宽高比等规则过滤掉照片、色块、分隔线剩下的才是疑似文字行见 text_hints.py#L41-L100。第二步墨水实测算出真实字形高度每个候选区块回到灰度原图上重测把墨迹按行投影切分成行带过滤掉 4px 以下的细线分隔线、下划线取行带高度的中位数作为字形高度px。这套共享的墨迹分析工具在 page_text_metrics.py连黑底白字 / 白底黑字都对称处理。第三步字号聚类分组同级文字统一字号拿到每行的字形高度后按相对跳跃幅度≥5%把相近值聚成字号组同一层级文字在设计中本就只用一个字号实测误差在 3% 以内层级间落差通常 ≥8%所以分组非常稳定。再结合 CJK/拉丁字形与 em 方框的标定比例page_text_metrics.py#L221-L242把像素高度换算成font_pt_if_cjk/font_pt_if_latin两套标准字号。每页的产物是两个文件text_hints.json每行的box_px、glyph_height_px、size_group、字号和text_hints.png源图上画出红框并标注行号 字号的叠加图AI 对照叠加图逐行核对即可。双后端 OCR 机制离线检测与 PaddleOCR-VL 云校正测量流程提供两个后端由 deck_text_hints.py 在editppt prepare阶段自动选择后端工作方式能力内置离线检测builtin-ink纯本地像素分析无需网络知道文字在哪、多大但不识别内容PaddleOCR-VL 云校正paddleocr-vl整份输入提交一个批量 OCR 任务paddle_text_hints.py在文本块定位基础上仍用本地墨迹指标重新实测字号保证像素级精度并附带识别文字内容两个细节值得注意降级兜底没有 Token 或云服务失败时自动回退离线检测每页照样有测量结果互相纠错密集图表页有时会把整页当成图片导致 OCR 几乎无输出此时系统比较两者结果量自动采用离线检测的版本deck_text_hints.py#L156-L169。配置 Token 只需在百度 AI Studio 免费申请 Access TokenAI 会在执行时引导写入用户级配置一次配置长期生效详见 README.md 的「文字校正与 OCR Token」一节。测量结果如何落地三条使用规则测量结果被明确标注为advisory参考值页面重建者按 page-decision-tree.md#L163-L169 中的规则使用对照叠加图逐行匹配把实测的box_px和对应字号列抄进文本框清单给测量出的框加标记font_size_source: measured——确定性构建器看到该标记就信任测量值不再执行保守缩排这是文字不再偏小的关键同级文字严格同字号共享同一size_group的行必须用完全相同的字号手动补的文字也要归入对应层级漏检的行由 AI 自己读源图补齐漏检不等于可以丢字。这套规则让确定性测量 AI 语义补全各司其职字号一致性从模型感觉变成硬约束。转换效果对比字号还原实测下面两张来自同一页的转换前后对比——多级标题与正文的字号层级、位置关系都被完整还原文字框和形状彼此分离可独立编辑对应的更多案例原图可见 README.md 的「转换效果示例」表格如 showcase-origin-investment-platform.png。快速上手安装与免费 OCR Token 配置安装仓库是只读的需要 clone 时使用 https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill 然后把安装 image-to-editable-ppt 这个 skill的指令交给你的 AI agent建议 Codex 并授予完全访问权限后续检查与配置均由 AI 代劳。调用在对话框里直接发送图片 / PDF / 图片版 PPT并指明转成可编辑 PPT即可。OCR Token强烈建议申请免费的 PaddleOCR-VL Token百度 AI Studio能拿到识别内容 更干净的文本块边界文字还原质量明显更好不申请也能跑只是退化为纯几何测量。小结 image-to-editable-ppt-skill 的文字还原机制可以概括为一句话用确定性像素测量锁定文字在哪、多大用 OCR 云校正补上文字是什么用字号分组强制同级一致。对新手来说你只需要申请一个免费 Token剩下的测量、分组、换算全自动完成——字号不再靠目测这是图片转可编辑 PPT 项目里最能体现工程巧思的部分。更多流程细节可参考 docs/workflow.md、docs/prompts.md 与 skill 内的 SKILL.md。【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考