
Claude Vision 重建几何AI 学术配图生成器 FigureSpec V2 富化技术深度解析【免费下载链接】academic-figure-generatorAI 驱动的学术论文配图生成平台。上传论文 → AI 分析内容生成 Prompt → 一键生成高质量科研配图还有配套的skill可在主流agent中使用项目地址: https://gitcode.com/gh_mirrors/ac/academic-figure-generatorAcademic Figure Generator是一个 AI 驱动的学术论文配图生成平台上传论文 → AI 分析内容生成 Prompt → 一键生成高质量科研配图。但 AI 生成的 PNG 图片有个致命短板——看得见却改不了。本文深度解析它的 Phase 2 核心技术如何用 Claude Vision 把语义级的FigureSpec V1富化为带像素坐标的FigureSpec V2最终把 AI 配图重建为可编辑的 SVG 和 draw.io 矢量文件。痛点AI 生成的配图为什么需要重建几何先看一张由本平台实际生成的网络架构图 这样的图很美但它是光栅图片PNG/JPEG。对照 phase2-requirements.md 中列出的真实场景痛点非常具体痛点场景影响无法修改文字Reviewer 要求修改术语、修正 typo必须重新生成整张图无法微调布局某个模块位置不理想只能重新描述无法局部调整无法适配排版双栏改单栏、调整 DPI光栅图缩放后质量下降无法精确配色需要完全匹配期刊色板AI 配色接近但不精确解决方案不是把 PNG 矢量化那样得到的是不可编辑的描边路径而是让 AI 把图读懂用结构化数据重建一遍——这就是 FigureSpec V2 富化技术要做的事。FigureSpec V1语义级描述学术配图的蓝图在 Phase 1 中Claude 分析论文时会同步产出一份FigureSpec V1它以 JSONB 形式存储在prompts表的figure_spec列中Prompt 记录结构见 prompt.py。V1 是语义级的——它描述这张图应该长什么样用的是文字而非坐标。这与 system_prompt.py 中定义的 4 层分解方法论一一对应V1 层内容举例Layer 1 全局画布比例、面板数量与排布16:93 列网格左到右阅读Layer 2 区域每个面板的位置、内容、子元素左侧 40% 区域输入模块Layer 3 标注跨区域的箭头、图例、维度标注箭头编码器 → 解码器Layer 4 样式字体、线宽、语义色映射primary 色用于关键模块边框平台内置的 5 大类学术图类型总体框架图、网络架构图、模块细节图、对比消融图、数据行为图定义在 figure_types.py 中每种类型都有默认比例、典型论文章节和配色建议。问题在于光靠 V1 的文字描述渲染端人或代码都无法确定精确的像素位置——左侧 40% 区域到底是 x100 还是 x150Claude Vision 富化从语义到像素级坐标Phase 2 的灵感很自然既然 AI 生成的那张 PNG 就摆在那里让另一个 AI 看着原图把 V1翻译成 V2。完整的 V1 → V2 转换由 Claude Vision 完成输入三样东西️ 一张光栅原图base64 PNG让模型亲眼看见布局 FigureSpec V1 JSON语义级描述提供结构先验✍️ 原始生成 Prompt补充意图Enrichment 系统提示词把 Claude 定义为一台学术图形布局引擎核心指令包括设计见 phase2-technical-design.md 第 4 节仔细观察原图中每个模块的位置、大小、形状、颜色分配精确的x, y, width, height从 12 种几何形状中识别模块类型rect、circle、diamond、cylinder、cloud……提取填充色/边框色统一为#RRGGBB识别所有箭头与连接线选择正确的锚点记录拐点waypoints遵守坐标规则原点在左上角、元素间距 ≥ 20px、连接线不穿过其他元素如果还没生成光栅图用户也可以直接从 Prompt 导出——此时 Claude Vision 仅基于 V1 Prompt 富化无图参考流程同样成立。图解 FigureSpec V2一张图的结构化基因富化的产物就是FigureSpec V2——一份包含精确像素坐标的几何描述。用上面那张架构图对应的 V2 片段示意{ version: 2.0, figure_type: network_architecture, canvas: { width: 1600, height: 900 }, elements: [ { id: encoder_block, type: rounded_rect, x: 100, y: 200, width: 300, height: 400, fill: #E8F4FD, stroke: #2196F3, label: { text: Encoder, font_size: 16 } } ], connections: [ { id: conn_1, from_element: encoder_block, to_element: decoder_block, type: arrow, label: Feature Maps B×512×H×W } ] }V2 由 Pydantic Schema 严格校验FigureSpecV2定义在设计文档 第 3 节包含五类核心对象V2 对象职责关键能力elements视觉模块12 种几何形状、children子元素嵌套connections箭头/连接线5 种类型实线/虚线/双向、锚点、拐点text_blocks独立文字标题、脚注的精确位置与字号legends图例颜色-标签对列表canvas画布宽高与背景色与 V1 对照富化完成的正是文本 → 几何的质变V1 字段V2 对应变化本质layer1_global.panel_arrangement各 element 的 x/y 坐标文本描述 → 坐标layer2_regions[].content_descriptionelements[].label.text语义 → 具体文字layer3_annotations[]connections[]抽象连接 → 带锚点的具体连线layer4_style.color_mapping各 element 的fill/stroke语义颜色 →#RRGGBB一次富化两次编译SVG 与 draw.ioV2 是格式无关的中间表示——同一份 V2 可以编译成任意目标格式。这正是富化技术的最大收益 SVG 导出基于svgwrite纯 Python 生成V2 的形状类型一一映射为 SVG 标签diamond→polygon、cylinder→path、圆角矩形→rx/ry箭头用marker渲染每个模块是独立g分组文字是原生text元素——在 Inkscape / Illustrator 中可直接选中、改字、换色。draw.io 导出纯 XML 模板生成 mxGraph 格式。亮点是容器嵌套——子元素通过parent属性挂在父模块下坐标自动转为相对坐标移动父模块时子元素与连接线全部跟随。整个导出是异步的点击按钮 → 创建 Export 记录pending→ Celery 后台任务执行「下载原图 → 加载 V1 → 富化/复用 V2 → 校验 → 导出 → 上传存储」→ 前端轮询到 completed 后自动触发浏览器下载单张图目标耗时 30 秒。缓存策略第二次导出零 API 成本每次富化都要调用 Claude Vision单次约 $0.03–0.05。为此系统设计了V2 缓存以prompt_id 画布尺寸为键同一 Prompt 第一次导出 SVG 时调用 Claude第二次导出 draw.io 时直接复用已缓存的 V2零 API 成本——富化做的是几何与目标格式无关天然可复用。配套的风险控制也有见 phase2-requirements.md坐标不准 → Pydantic 严格校验 边界检查复杂图类型质量波动 → 按图类型定制 enrichment prompt调用失败 → 标记 failed 并支持重试。写在最后FigureSpec V2 富化技术给 AI 配图工作流补上了关键一环光栅图负责好看结构化几何负责好用。上传论文 → 生成配图 → 一键导出可编辑矢量文件学术写作中写完论文还要画图的痛点被压缩成了三步流程。后续规划中还有 PPTX 导出、浏览器内 SVG 在线编辑与 draw.io 编辑器内嵌见 phase2-requirements.md值得期待。如果不想部署完整平台仓库还附带了独立的 AI Agent Skill可在 Claude Code / Gemini CLI 等主流编程助手中直接生成顶会级配图提示词说明见 SKILL.md。【免费下载链接】academic-figure-generatorAI 驱动的学术论文配图生成平台。上传论文 → AI 分析内容生成 Prompt → 一键生成高质量科研配图还有配套的skill可在主流agent中使用项目地址: https://gitcode.com/gh_mirrors/ac/academic-figure-generator创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考