
Harness工程是Agent的运行环境负责工具权限、任务状态、检查、运行轨迹和预算而非模型本身。通过优化外围配置可显著提升大模型体验。文章以Claude Code为例说明模型未变时配置调整导致体验差异。重点介绍Harness工程五个关键要素权限与确认、独立检查、状态管理、追踪记录和预算控制并提供个人开发者小时级实施方案强调按风险而非层数构建运行环境。Harness 不是一轮新的概念包装。它是 Agent 的运行环境在模型之外接住工具权限、任务状态、独立检查、运行轨迹和预算。模型没换这些外围配置一变体验照样会变。/ / /先看图别急着记新名词图上只有三组醒目的词Prompt Engineering、Context Engineering、Harness Engineering。提示工程、上下文工程与 Harness 的三阶段演进提示决定如何表达上下文决定模型此刻知道什么Harness 负责工具、状态、检查与运行控制图中比例只作概念示意不是实验数据原作者想表达的演进并不复杂从琢磨“问题怎么问”到准备“模型该知道什么”再到处理“它真要动手时系统如何接住”。原图出现的比例是视觉示意不是经过测量的性能数据。这条边界得先钉住否则又会滑向一个漂亮但空心的行业故事。我更愿意把 Harness 译成“Agent 的运行环境”。它不是更长的 prompt也不只是给模型套一个 API wrapper。模型负责理解任务、规划下一步、提出工具调用运行环境负责校验参数、判断权限、执行动作、保存状态再把结果以稳定格式送回去。后者做得差模型再聪明也会在脏输出里猜、在长对话里忘、在失败后反复撞同一堵墙。短一点说模型决定“想做什么”Harness 决定“这件事怎样被允许发生”。没有 Harness 时模型直接碰工具且结果散落有 Harness 后工具调用依次经过 schema 校验、权限判断、受控执行和日志记录再把结构化 observation 返回模型这里也要防一个新误区Harness 目前不是一套有统一边界、统一层数的行业标准。有人把它画成七层有人画成网关、运行时和策略面还有人只把工具执行器叫 Harness。名字可以争工程问题倒是很具体——Agent 能碰什么忘了什么谁来检查出了偏差能不能还原花到哪里必须停这些问题营销词替你答不了。/ / /Claude Code 的复盘证明了外围配置有多要命2026 年 4 月Claude Code 用户集中感到质量变差。最容易讲的故事是“模型偷偷降级了”但 Anthropic 后来的官方复盘给出了更细的答案问题出在三处产品配置与实现而不是 API 或模型推理层更换。一处是默认reasoning effort被调低一处是清理历史思考时的缓存 bug错误丢掉了本该保留的信息另一处是限制verbosity的系统提示让复杂任务中的解释与执行受到影响。相关修复在 4 月 20 日进入 Claude Codev2.1.1164 月 23 日发布复盘。模型没换。体验还是掉了。这件事为什么适合拿来讲 Harness因为三处变化分别打在推理配置、上下文保留、系统指令上都是模型外围的运行条件。用户并不会先看到某个抽象 benchmark 下降他们先看到的是 Agent 开始绕圈、漏掉约束、解释变薄或者做复杂任务时没以前稳。我认为这是整篇最硬的一块证据同一个模型放进不同的运行环境可以表现得像两个产品。 当然它不能反推“所有 Agent 问题都与模型无关”。模型能力仍然重要。只是把所有退化都归因于模型工程上太省事了也太容易误诊。顺手再补一刀。系统提示、缓存策略、默认档位这些东西看起来只是配置一旦它们参与真实执行就已经是产品行为。配置不是附录。/ / /七层图能用但别把它当施工规范原文把 Harness 拆成七块工具编排、验证、上下文与记忆、护栏、可观测性、模型路由、反馈改进。这张地图的价值是帮你找遗漏它的问题是很容易让人误以为“少一层就不配叫 Agent”。作者的七层 Harness 启发式与个人开发者最小五件套对照七层用于扫描失败面实际起步聚焦权限与确认、任务状态、独立检查、trace 和预算别这么建。一个只读的本地资料整理 Agent没必要先搭完整网关、长期记忆和多模型路由一个能发邮件、改数据库、执行部署的 Agent即使任务很短也不能省掉确认、审计和停止条件。落地顺序应该跟风险走不该跟层数走。对个人开发者我会先做五件事权限与确认、任务状态、独立检查、trace、预算。这五件也不是黄金标准只是一个最小骨架不是完整平台。任务越低风险越可以减外部影响越大越要加。1. 权限与确认把“能调用”和“可执行”分开最小权限表不用复杂。先把工具分成三类只读读文件、查文档、获取公开信息。默认可自动执行但仍限制目录、域名和凭据范围。可逆写入改工作区文件、生成草稿、创建临时记录。允许执行提交前跑检查保留 diff 或回滚点。外发或不可逆发消息、删资源、写生产库、付款、部署。先生成候选动作明确展示目标与影响再由人确认。OpenAI 的构建 Agent 实践指南也建议根据读写性质、可逆性、账号权限和财务影响给工具分级并让高风险功能进入人工介入。关键不是每次都弹窗。那会把人烦到闭眼点同意。关键是把确认留给真正会改变外部世界的动作。比如“读取仓库里的测试日志”和“把修复推送到远端”都可能只需一次工具调用但风险完全不是一个级别。路由条件里必须有动作风险不能只看任务难不难。2. 独立检查第二双眼睛不一定是第二个模型Maker–Checker 很容易被写成“再起一个 Agent 审一次”。这不够准确。很多检查根本不需要模型代码能不能编译、测试是否通过、JSON 是否符合 schema、diff 有没有碰到禁区确定性工具通常更便宜也更诚实。Maker–Checker 分工生成 Agent 负责产出独立检查器运行 tests、lint、schema 与范围检查失败时指出具体缺陷并退回人工保留最终决定权只有遇到命名是否清楚、方案是否偏离需求、文本是否泄露隐私这类需要判断的任务才值得引入独立指令、另一上下文或另一个模型。NIST 的 AI RMF Core也强调让未参与一线开发的人或独立评估者参与评估有助于减少内部偏差。它支持“评估要分离”不等于“第二个模型必然正确”。我甚至会优先相信失败的单元测试而不是一段措辞很自信的“复核通过”。这听着不浪漫却是工程判断。3. 状态别指望一段长对话替你守住任务Agent 做三步小任务时对话历史就是状态。做到几十步、跨会话、多人接力状态还只住在聊天窗口里就开始危险了。一个够用的STATE.md写四类信息就行当前目标、已完成项、下一步、阻塞与待确认。长期不该丢的约束——比如“不得修改 CI 配置”“只能写工作区”“外发前必须确认”——放到独立规则文件并在每次启动时重新加载。上下文该留与该丢窗口内保留当前目标、有效约束、相关工具结果和最近检查反馈窗口外持久化状态与规则已解决的工具输出可压缩或丢弃上下文压缩也不是越狠越好。已经解决的报错堆栈可以扔最终采用了哪条方案不能扔重复的工具回显可以压缩权限边界不能被“顺便总结掉”。Claude Code 那次缓存 bug 已经把代价示范得很清楚错误地遗忘比窗口变长更麻烦。上面这句我收回一半。窗口无限变长同样会出问题。更准确的说法是该丢的要敢丢该守的必须落盘。扯远了回到运行环境。4. Trace日志不是仓库是一条可还原的路径Agent 返回一句“完成了”不等于你知道它完成了什么。最小 trace 至少回答这些问题收到的任务是什么使用了哪个模型与配置版本提出过哪些工具调用权限判断是什么执行结果、耗时和重试次数是多少最终产物有没有通过检查。端到端可观测性示意从请求、模型与风险路由、权限判断到推理、工具执行、独立评估再汇总延迟、成本、失败原因和有效结果不要无脑记录全部原始内容。日志可能带着用户数据、文件片段甚至凭据记录本身也要做脱敏和访问控制。OpenAI 在安全运行 Codex的说明里把受控执行、网络策略、批准决定和工具结果放在同一套可审计运行思路中。目的不是收集更多而是出了偏差后能解释它看到了什么获准做了什么具体在哪一步走歪。所以一次任务的 trace ID 比一句“相信我已完成”有用得多。5. 预算自动化必须知道什么时候停预算不只有 token 和金额。总耗时、工具调用次数、连续失败次数、同一动作的重试次数都应该有上限。触发上限后Agent 要暂停写回当前状态说明已尝试路径和最后一个错误再把决定权交回来。没有停止条件的自动化不叫自治叫失控。预算也别从网上抄一个神奇阈值。资料里常见的固定比例、固定重试轮数脱离任务类型几乎没意义。格式清洗和线上部署不该共享同一预算一次可回滚的本地改动也不该与一次外部付款共用相同确认策略。/ / /模型路由之外再加一条风险路由很多 Agent 框架已经会按任务难度选模型分类、格式转换交给较快模型规划、架构审查交给更强模型。这能控制成本却只解决了一半问题。另一半是风险。模型路由与风险路由双轴按任务复杂度选择模型同时按只读、可逆写入、外发或不可逆操作决定自动执行、加强检查还是人工确认“总结一份公开文档”可能推理难度高但执行风险低“给客户群发一句话”推理难度不高外部影响却很大。前者可以调用强模型后自动产出草稿后者即使由便宜模型完成也要卡在人工确认前。这就是我喜欢风险路由的原因它把“聪明程度”和“行动权限”拆开了。强模型不自动获得高权限简单任务也不自动等于低风险。模型选择服务于质量权限选择服务于后果。 两条线交叉判断比“所有任务都上最强模型”靠谱得多。/ / /给个人开发者的一小时版本如果你已经有一个能调用工具的 Agent不必停工去造平台。抽一小时把下面这些补上前 10 分钟列出当前工具给每个工具标记“只读 / 可逆写入 / 外发或不可逆”并写清作用范围。接着 10 分钟创建STATE.md固定目标、进度、下一步、阻塞四个字段把不可丢的权限约束放进独立文件。再用 15 分钟挑一条最便宜的独立检查命令例如 tests、lint、schema 校验或 diff 范围检查让“完成”依赖检查结果。再用 15 分钟为每次任务生成 trace ID记录模型配置、工具调用、权限决定、结果状态、耗时和重试。剩下 10 分钟写明 token、总耗时和连续失败的停止条件并测试一次“超过上限后是否真的会停”。个人开发者一小时 Harness 清单工具权限表、STATE.md、独立测试或 lint 检查门、结构化 trace以及 token、耗时和重试预算时间只是建议分配不是性能承诺。你也可能一小时只把权限表写清楚——这完全可以。重要的是留下一个能运行、能验证、能继续改的最小版本而不是画出一张宏大的七层架构图然后什么都没接进真实任务。还有一条我觉得该写在清单外每次只根据真实失败补一个能力。Agent 从没跨会话就先别建复杂记忆库它一旦能发消息就先把确认做好它开始并行调用工具再补并发限制和幂等。风险先出现在哪里工程量就花在哪里。/ / /写在最后Harness 没有取代提示工程也没有取代上下文工程。它只是把一个长期被忽略的事实摆上桌面Agent 不是一段孤零零的模型调用而是一套会读取、判断、行动、失败并消耗资源的运行系统。提示写得好模型更容易理解你上下文准备得好模型更容易知道该做什么运行环境做得好它才有机会在真实世界里安全、稳定地把事做完。三者是包含关系不是热词淘汰赛。我的判断很克制接下来 Agent 产品的差距当然还会来自模型但也会越来越多地来自模型之外——权限是否自然状态是否可靠检查是否独立trace 是否可还原预算是否真能刹车。先做最小版本。别急着盖七层大楼。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取