
Mantis模型选型清单15个阶段该用哪档大模型成本与效率的平衡实战指南【免费下载链接】mantisA modular, stack-agnostic toolkit for AI coding agents to autonomously find, reproduce, and patch vulnerabilities.项目地址: https://gitcode.com/gh_mirrors/mantis17/mantisMantis 是一套模块化、与具体技术栈无关的工具包让 AI 编码代理自主发现、复现并修补代码中的安全漏洞。用它做完整扫描时影响成本与效率最大的变量就是 15 个流水线阶段分别用哪一档大模型。这篇 Mantis 模型选型清单带你逐阶段定档把钱花在刀刃上 。为什么哪档模型是成本的最大变量Mantis 的参考流水线默认带着两道硬性天花板12 小时墙钟时间1000 万 token预算见 reference/workflow.json 的budget段与 reference/core/budget.py而实测中单个 campaign一次针对某个文件或目录的扫描的种子成本约50 万 token——这意味着 10M 预算在每档模型都按默认配置跑的情况下只能覆盖几十个 campaign。换句话说模型档位直接决定你的预算能买到多少代码覆盖率。成本账本会在 reference/core/cost.py 中逐 campaign 记录真实花费并优先用你自己跑出来的观测值替代估算值。 新手建议先用小仓库跑通一轮看 spend ledger 里每个 campaign 的真实 token 消耗再决定下一轮给哪些阶段升档模型。15 阶段全景谁在干重活Mantis 的默认深度审查流程定义在 reference/workflow.json 中15 个代理阶段按职责可以分成三档档位阶段Stage参考配置中的模型reasoning_effort轻量档history历史漏洞回顾、structural_index结构索引、deduplicator去重gemini-3.5-flash-litelow均衡档architect、threat_modeler、planner、researcher研究、reviewer、calibrator定级、reflector、reporter默认 gemini-3.7-flashmedium重火力档critic对抗评审、reproducer复现、chainer漏洞链、patcher打补丁默认模型high这个设计的逻辑很清晰前半程是读懂代码后半程是证明漏洞和修好漏洞。读代码、建索引、去重属于模式匹配型任务便宜模型完全够用而 critic 要对抗式驳斥幻觉发现、reproducer 要真的把利用链跑起来、patcher 要在对抗循环里验证补丁这些环节模型能力不足时会直接产出一堆假阳性——省下的 token 远不抵人工复核的代价。官方维护的推荐模型目录在 reference/core/config.py 的RECOMMENDED_MODELS中包括gemini-3.7-flash、gemini-3.5-flash-lite、claude-opus-5、glm-5.2-maas等均提供vertex_ai/前缀的 Vertex 路由变体。模型选型清单15 个阶段逐一定档 ✅如果你只记住一句话就是这条黄金法则便宜的模型扫全场贵的模型守关隘。具体操作建议轻量档history / structural_index / deduplicator保持 flash-lite 级模型。它们每个 campaign 都会被调用是 token 消耗的大头但任务对推理深度不敏感。均衡档architect / threat_modeler / planner / researcher / reviewer / calibrator / reflector / reporter默认中档模型即可。researcher 是发现漏洞的主力若你的目标是深度审计可单独给它升一档模型其余保持 medium。重火力档critic / reproducer / chainer / patcher给最高档模型 reasoning_effort: high。这四个阶段只有在前序阶段确认发现后才会被触发调用频率低、单次价值高是整条流水线最值得投入的地方 。reasoning_effort是隐藏开关每个节点可单独设置 low / medium / high参考配置中 critic、patcher 等均为 high。同一模型下调低 effort成本能省一大截适合对结果确定性要求不高的阶段。想验证不同模型档位的实际效果差异官方评测脚本 reference/evals/run_eval.py 内置了从 flash-lite 到 flash 的多组模型 × 推理档位对照实验可以直接借用来给自己的项目做选型基线。如何配置3 步完成模型切换全局默认运行配置向导python3 scripts/configure.py --auto逻辑在 reference/scripts/configure.py会把default_model写入配置。按节点覆盖在 reference/workflow.json 中任何节点都可以加model字段单独指定模型未指定则回退到全局默认该回退逻辑在 reference/core/graph_loader.py 中实现。预算兜底用--token-budget、--max-llm-calls等参数给运行加上限预算触顶时 Mantis 会优雅暂停并打印一条可直接复制的--resume续跑命令实现见 reference/core/budget.py配合--resume可以分多次、跨天完成大型仓库扫描。上手与注意事项克隆仓库后在reference/目录下执行./install.sh再用./run.sh path/to/code发起扫描即可。两条来自 README.md 的重要提醒请务必遵守⚠️ Mantis 会自主生成并执行代码只应在隔离、受限的环境中运行切勿接入生产系统。 AI 模型可能产生幻觉所有发现必须由安全专家人工复核后才能上报。一句话总结Mantis 的 15 个阶段里前 3 个读代码阶段用轻量模型省大钱中间 8 个分析阶段用默认中档模型保质量后 4 个证明与修复阶段用顶级模型守质量——把模型档位当成流水线参数来调就是你平衡成本与效率的最优解。【免费下载链接】mantisA modular, stack-agnostic toolkit for AI coding agents to autonomously find, reproduce, and patch vulnerabilities.项目地址: https://gitcode.com/gh_mirrors/mantis17/mantis创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考