ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

scientific-agent-skills 智能迭代精修指南:信息图生成中的「生成-评审-精修」循环与 CLI 全参数解析

scientific-agent-skills 智能迭代精修指南:信息图生成中的「生成-评审-精修」循环与 CLI 全参数解析 scientific-agent-skills 智能迭代精修指南信息图生成中的「生成-评审-精修」循环与 CLI 全参数解析【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills导读本文聚焦 scientific-agent-skills 仓库中 infographics 技能的核心机制 ——Smart Iterative Refinement智能迭代精修由 Nano Banana Pro 生成信息图由 Gemini 3.6 Flash 按五维评分标准做质量评审只有当评分低于文档类型阈值时才触发重生成从而以最少的 API 调用获得满足质量门槛的成品。读完本文你将掌握该 generate-review-refine 循环的完整工作流、五维质量评审标准、Review Log 日志结构以及 generate_infographic.py 的全部命令行参数与配置方式并能结合源码理解提前停止early stop、评分解析等底层实现原理。一、Smart Iterative Refinement生成-评审-精修循环infographics 技能的核心并非一次生成而是闭环校验。其完整流程如下┌─────────────────────────────────────────────────────┐ │ 1. Generate infographic with Nano Banana Pro │ │ ↓ │ │ 2. Review quality with Gemini 3.6 Flash │ │ ↓ │ │ 3. Score threshold? │ │ YES → DONE! (early stop) │ │ NO → Improve prompt, go to step 1 │ │ ↓ │ │ 4. Repeat until quality met OR max iterations │ └─────────────────────────────────────────────────────┘每一步在源码中都有对应实现见 generate_infographic_ai.py 的InfographicGenerator.generate_iterative()第 1102 行起生成generate_image()携带完整设计指南调用 Nano Banana Proself.image_model google/gemini-3.1-flash-image第 434 行请求modalities[image, text]评审review_image()将已保存的迭代图片转成 base64 data URL连同评审提示词交给 Gemini 3.6 Flashself.review_model第 436 行做视觉质量打分决策比较得分与doc_type对应的质量阈值not review.needs_improvement即提前停止精修若分数低于阈值且未耗尽迭代次数improve_prompt()会把评审意见critique注入下一轮生成提示词要求修复评审中提到的全部问题、保持类型与风格、达到出版级质量。每轮迭代产出的图片保存为{base_name}_v{i}{extension}如figures/exercise_v1.png、exercise_v2.png最终达标版本会被复制到-o指定的输出路径因此版本化图片与最终成品会同时保留。提前停止Early Stop的收益从 SKILL.md 的 Smart Iteration Benefits 一节可以看到该机制的设计动机首轮生成即达标时节省 API 调用不再空转营销材料要求更高门槛质量有保障草稿/内部用途门槛更低周转更快每种使用场景获得恰好合适的质量而不是一刀切。代码层面的关键证据results[early_stop] True只在not review.needs_improvement分支触发generate_infographic_ai.py且提前停止时输出Iterations Used: N/M (early stop)。二、五维质量评审标准Gemini 3.6 Flash 在每一轮迭代中会以评审提示词源码第 901-959 行对信息图从五个维度打分每个维度 0-2 分总分 0-10 分维度分值评审要点1. Visual Hierarchy Layout视觉层级与布局0-2清晰的视觉层级、逻辑阅读流、平衡构图、充足留白2. Typography Readability字体与可读性0-2文本可读且字号合适、标题醒目、无重叠拥挤、字体统一3. Data Visualization数据可视化0-2数字与统计醒目、图表/图标清晰准确、数据一眼可懂、标签齐全4. Color Accessibility色彩与无障碍0-2配色和谐专业、对比度足够、色盲友好、色彩支撑内容层级5. Overall Impact Professionalism整体效果0-2专业精致、有吸引力、无视觉瑕疵、达成沟通目标评审模型被要求以严格格式输出便于程序解析SCORE: [total score 0-10] STRENGTHS: - [strength 1] ISSUES: - [issue 1] SPECIFIC_IMPROVEMENTS: - [specific improvement 1] VERDICT: [ACCEPTABLE or NEEDS_IMPROVEMENT]源码中的评分解析细节从 generate_infographic_ai.py 顶部的解析器可以看到几个工程化细节_normalize_review_text()用正则[*_#]剥掉模型常见的 Markdown 装饰Gemini 常输出SCORE:8.5而非裸的SCORE: 8.5避免因格式不符而误判_parse_score()同时匹配SCORE模式与宽松模式(score|rating|quality)\s*[:\s]\s*(\d(?:\.\d)?)(?:/\s*10)?且只接受 0.0-10.0 区间内的数字——超出该范围说明匹配到的是百分比、迭代号等干扰项返回None而非猜测一个分数_parse_verdict()锚定行首匹配VERDICT: ACCEPTABLE|NEEDS[_ ]?IMPROVEMENT防止评审模型复读指令导致的误判关键设计评审失败绝不虚构分数。ReviewResult中scoreNone表示未测量而非通过未产生可用分数的评审不会伪装成达标源码第 39-51 行的 docstring 明确说明这一点。按文档类型的质量阈值不同使用场景对应不同阈值定义于QUALITY_THRESHOLDS源码第 356-364 行与 SKILL.md 表格一致文档类型阈值适用场景marketing8.0/10营销材料必须足够有说服力report8.0/10商务报告专业质量presentation7.5/10幻灯片、演讲清晰且有吸引力social7.0/10社交媒体内容internal7.0/10内部使用draft6.5/10工作草稿最低门槛default7.5/10通用默认注意CLI 脚本--list-options输出中 marketing 标注为 8.5/10而源码QUALITY_THRESHOLDS字典与 SKILL.md 表格均为 8.0/10实际生效阈值以 generate_infographic_ai.py 中的字典为准。三、Review Log每次生成的审计日志每一轮完整生成都会在输出目录产生一个 JSON 评审日志文件{base_name}_review_log.json其结构与文档给出的示例一致{ user_prompt: 5 benefits of exercise..., infographic_type: list, style: healthcare, doc_type: marketing, quality_threshold: 8.5, iterations: [ { iteration: 1, image_path: figures/exercise_v1.png, score: 8.7, needs_improvement: false, critique: SCORE: 8.7\nSTRENGTHS:... } ], final_score: 8.7, early_stop: true, early_stop_reason: Quality score 8.7 meets threshold 8.5 }对照源码generate_iterative()中results字典的初始化第 1146-1165 行日志字段还包括research_enabled、research_data、context_images记录是否启用研究阶段、研究数据与参考图上下文final_image、final_reviewed、success最终产物路径、是否经过有效评审、是否成功每轮iteration_result中还包含prompt_length、reviewed、review_error等字段第 1246-1256 行。日志的意义在于分数、评审意见、提前停止原因全部留痕用户可据此判断该信多少以及是否需要手动复核。此外启用--research时还会额外生成{name}_research.json保存原始研究数据与来源SKILL.md Research Output 一节。四、命令行参考CLI 全参数统一入口是仓库根目录下的 generate_infographic.pypython skills/infographics/scripts/generate_infographic.py [OPTIONS] PROMPT Arguments: PROMPT Description of the infographic content Options: -o, --output PATH Output file path (required) -t, --type TYPE Infographic type preset -s, --style STYLE Industry style preset -p, --palette PALETTE Colorblind-safe palette -b, --background COLOR Background color (default: white) --doc-type TYPE Document type for quality threshold --iterations N Maximum refinement iterations (default: 3) --api-key KEY OpenRouter API key -v, --verbose Verbose output --list-options List all available options除文档列出的参数外源码还支持两个扩展参数generate_infographic.py-r, --research先用 Perplexity Sonar 研究主题、收集准确数据再生成--context-image仅generate_infographic_ai.py直接入口可重复指定把品牌图、图表等参考图作为视觉上下文附带给 Nano Banana Pro。列出全部可选值python skills/infographics/scripts/generate_infographic.py --list-options该命令输出带格式化的完整清单涵盖10 种信息图类型--typestatistical、timeline、process、comparison、list、geographic、hierarchical、anatomical、resume、social常量定义于源码第 25-28 行各类型的生成准则见 generate_infographic_ai.py8 种行业风格--stylecorporate、healthcare、technology、nature、education、marketing、finance、nonprofit每种风格内置具体十六进制配色如 healthcare 为#0077B6 / #00B4D8 / #90E0EF见源码第 287-328 行3 种色盲安全调色板--palettewong7 色最广泛推荐、ibm8 色、tol12 色定性调色板具体色值与 RGB 见 color_palettes.md**7 种文档类型--doc-type**及各自阈值。参数校验与转发逻辑从 generate_infographic.py 源码可确认prompt与--output为必填项缺失时报错退出第 229-232 行--type、--style、--palette、--doc-type均为choices约束的枚举参数非法值会被 argparse 直接拒绝该脚本本身是薄封装校验通过后它把参数转发给同目录下的generate_infographic_ai.py子进程第 255-283 行并通过build_subprocess_env()构造最小化环境变量FORWARDED_ENV_VARS第 45-53 行——只传递 PATH、代理、TLS 证书等必要变量避免把调用 shell 中无关的敏感环境变量泄露给子进程API Key 则单独注入。五、配置API Key 的三种注入方式模型调用统一走 OpenRouter API因此需要配置 API Key。文档给出的基础方式是环境变量export OPENROUTER_API_KEYyour_api_key_here源码中的resolve_api_key()/_resolve_api_key()两处实现一致见 generate_infographic.py实际支持三级解析优先级--api-key KEY命令行显式传入环境变量OPENROUTER_API_KEY.env文件从当前工作目录逐级向上查找最后回落到脚本自身所在目录解析时跳过#注释行、剥离引号第 72-88 行。这意味着在项目根目录放一个.env文件即可无需 python-dotenv 依赖。若三者都未命中脚本会输出错误提示并退出第 236-244 行。SKILL.md的元数据也声明了该技能的可选环境变量为OPENROUTER_API_KEYprimaryEnv无 Key 时仅影响依赖 LLM 的生成步骤。文档中的提示 Get an API key at: https://openrouter.ai/keys 是获取 Key 的官方渠道实际请求通过https://openrouter.ai/api/v1/chat/completions发出源码第 429 行。六、快速上手从零生成一张达标信息图将以上机制串起来的典型调用如下示例均来自 SKILL.md 的 Quick Start# 1. 列表型信息图使用默认阈值 7.5/10 python skills/infographics/scripts/generate_infographic.py \ 5 benefits of regular exercise \ -o figures/exercise_benefits.png --type list # 2. 营销场景最高门槛 8.0/10 python skills/infographics/scripts/generate_infographic.py \ Product features comparison \ -o figures/product_comparison.png --type comparison --doc-type marketing # 3. 企业风格时间线 python skills/infographics/scripts/generate_infographic.py \ Company milestones 2010-2025 \ -o figures/timeline.png --type timeline --style corporate # 4. 色盲安全配色的统计图 python skills/infographics/scripts/generate_infographic.py \ Heart disease statistics worldwide \ -o figures/health_stats.png --type statistical --palette wong # 5. 启用研究阶段确保数据准确、时效 python skills/infographics/scripts/generate_infographic.py \ Global AI market size and growth projections \ -o figures/ai_market.png --type statistical --research运行期间控制台会打印每轮的阈值、得分、是否提前停止及最终评分源码第 1167-1178、1239-1317 行结束后输出目录中将出现exercise_benefits_v1.png与exercise_benefits_review_log.json等文件。结合提示词技巧提高命中率内容具体化5 benefits of meditation: reduces stress, improves focus, better sleep, lower blood pressure, emotional balance远好于meditation infographic给出数据点Market growth from $10B (2020) to $45B (2025), CAGR 35%而非market is growing明确视觉元素Timeline showing 5 milestones with icons for each event完整提示词模板与 10 类信息图的示例 Prompt 可参考 infographic_types.md设计规范视觉层级、60-40 图文比、留白、字体、对比度等见 design_principles.md。七、常见问题排查问题解决方案图中文字不可读精简文本量并用--type明确布局类型颜色冲突或无障碍不足使用--palette wong色盲安全配色质量分始终偏低增大--iterations 3给出更具体、带数据的 Prompt生成类型不符预期始终显式指定--type保证结果一致出现 OPENROUTER_API_KEY not found依次尝试--api-key、环境变量、项目根目录.env文件评审未产生分数Score unavailable该轮图片仍会保留并停止迭代代码刻意不虚构分数建议人工查看图片与日志确认质量八、小结Smart Iterative Refinement 的本质是把一次生成碰运气升级为生成-评审-精修的闭环用 Gemini 3.6 Flash 的五维评分客观度量质量用文档类型阈值控制标准用 early stop 控制成本。理解 iterative_refinement.md 中描述的循环、评审标准、Review Log 与 CLI 参数再对照 generate_infographic.py 与 generate_infographic_ai.py 的源码实现你就可以精确掌控每一次生成的迭代次数、质量门槛与成本开销稳定地产出专业级信息图。【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表