
上线前必查的16项清单agents-best-practices的Agent Harness生产就绪终极检查表【免费下载链接】agents-best-practicesProvider-neutral Agent Skill for Codex, Claude Code, and agentic harness design.项目地址: https://gitcode.com/gh_mirrors/ag/agents-best-practices如果你正准备把 Agent 上线先别急着发版。开源项目agents-best-practices提供了一套供应商中立的 Agent Skill帮助 Codex、Claude Code 等智能体运行时完成 Harness运行时外壳的设计、审计与生产就绪检查核心文档 references/checklists.md 正是本次 16 项检查表的来源。Harness 是包裹模型的那层控制平面模型只负责提案验证、授权、执行、记录都发生在运行时。安装很简单把技能克隆到用户级技能目录即可git clone https://gitcode.com/gh_mirrors/ag/agents-best-practices.git ~/.claude/skills/agents-best-practices一、循环与预算别让 Agent 无限跑下去这是 references/agentic-loop.md 与 references/planning-and-goals.md 的共同结论长任务的失控几乎都源于没有预算。1. 设定硬预算steps/tools/time/tokens/cost循环必须有步数、工具调用次数、时长、token 与成本五类硬上限以及明确的终止原因而不是看起来差不多了。2. 每个工具调用都必须有结构化结果拒绝、超时、参数错误、中止——这些都是观察值必须返回结构化结果而不是让模型猜发生了什么。3. 规划模式先锁住副作用高风险或模糊任务进入规划模式时变更类工具应被屏蔽直到审批通过。计划工件目标、范围、风险、步骤、回滚、完成条件要存在提示词之外的持久化存储中。二、权限与工具草稿和提交是两回事这一部分对应 references/tools-and-permissions.md也是 checklists.md 中Tool checklist / Permission checklist的核心。4. 工具注册表保持最小化每个工具都要有具体且领域相关的命名、严格输入 schema、结构化输出、超时、结果大小限制、重试与审计策略。不要暴露send_message、write_database、run_command这类万能大锤。5. 权限矩阵覆盖全部风险等级读、草稿、写、外发、财务、破坏性、特权操作——七类动作各走各的授权路径矩阵必须写在代码里强制执行而不是靠提示词约束。6. 危险操作草稿/提交分离高风险副作用先产出草稿再走独立提交流程审批记录要持久化且模型永远不能批准自己的动作。三、上下文与记忆压缩不是删聊天记录依据 references/context-memory-compaction.md 的上下文检查清单7. 可信指令与不可信数据严格分离检索内容必须标注来源与信任级别外部内容只能当数据绝不能当指令。8. 上下文压缩后能恢复活跃状态自动压缩的摘要格式与再水合rehydration规则要提前定义压缩后活跃计划、目标、审批状态、待办必须重新挂回而不是只留下一段聊天摘要。9. 密钥不进上下文密钥、PII 一律不放入提示词大输出要么摘要、要么外置存储由模型按需取回。四、安全、观测与上线门16 项中的最后 6 项这部分来自 references/security-observability.md 的 Launch gates 与 references/evals.md 的上线标准。10. 事件轨迹Trace先于上线启用记录模型输出 → 工具调用 → 观察的完整链条能回答谁批准了这次变更、为什么停止、能否安全重放。11. 提示词注入与审批绕过测试通过评测套件必须包含注入攻击、工具误用、审批绕过、连接器故障等对抗用例且要在当前自主级别下安全地失败。12. 成本与延迟符合产品预算质量、安全、单次任务成本、端到端延迟、人工介入率共同构成上线门槛不能只看任务做完了。13. 回滚与事故路径已文档化出事故时先暂停高风险工具 → 保全轨迹 → 定位是指令/工具/连接器/模型的问题 → 修补策略 → 补回归评测 → 逐步恢复。这套流程上线前就要写好。14. 首次发布采用受限或影子模式MVP 清单的最后一项首个灰度必须是小范围、可监控、可影子运行的而不是全量放开。15. 把重复失败变成运行时特性如果你在提示词里反复叮嘱同一件事说明该把它变成校验器、工具、文档或评测。机械强制永远优于口头强调。16. 用评测门禁决定能否扩大自主权每次想给 Agent 更多自主权之前先跑一轮回归评测。评测通过是扩大自主范围的唯一通行证。快速对照表#检查项出处文档1硬预算与终止原因references/agentic-loop.md2工具调用必有结构化结果references/agentic-loop.md3规划模式阻断副作用references/planning-and-goals.md4最小化 typed 工具注册表references/tools-and-permissions.md5七类风险权限矩阵references/tools-and-permissions.md6草稿/提交分离 审批留痕references/checklists.md7指令/数据信任边界references/context-memory-compaction.md8压缩后状态再水合references/context-memory-compaction.md9密钥不进上下文references/context-memory-compaction.md10Trace 全链路日志references/security-observability.md11注入/审批绕过评测references/evals.md12成本延迟达标references/prompt-caching-and-cost.md13回滚与事故响应references/security-observability.md14受限/影子首发references/checklists.md15失败转运行时特性references/checklists.md16评测门禁控自主权references/evals.md结语保持循环简单让运行时严谨agents-best-practices 反复强调一句话Keep the loop simple and make the runtime rigorous. 这 16 项清单不是让你一次全部做到完美而是给出一个逐项打勾、逐项追责的路径先跑通最小安全循环再靠评测证据逐步放大自主权。建议把 references/checklists.md 直接放进你的发布流程作为每个版本上线前的门禁。【免费下载链接】agents-best-practicesProvider-neutral Agent Skill for Codex, Claude Code, and agentic harness design.项目地址: https://gitcode.com/gh_mirrors/ag/agents-best-practices创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考