ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

长文案例分享:Agent 上线用不了,除了模型问题,别忘了检查 harness

长文案例分享:Agent 上线用不了,除了模型问题,别忘了检查 harness 有了MCP后企业内部的科技部门有想法都会选择做企业内部的agent平台一个入口打通下游多个业务系统让用户不用频繁切换系统还可以基于自然语言完成跨系统的任务比如一句话基于crm里的订单写一封邮件。我跟几个做内部 Agent 平台的朋友交流发现项目容易卡在同一个地方。MCP 早就把邮件、OA、ERP 接上了演示起来也顺用户问报销走到哪一步Agent 去 OA 把节点捞回来问供应商合同的邮件它翻邮箱给出结果问库存ERP 那边也通。业务同学看完自然想马上用起来赶紧上线但是项目的朋友知道Demo 和可以交付上线的产品差距太大了。因为真实场景里不会只有简单的查询。往外发邮件、发起审批、建 ERP 单据、读附件、导数据、跨系统连着跑这些才是家常便饭。再加上用户身份不一样、权限不一样、话说得含糊程度不一样出了事该找谁也算不清楚。如果项目团队这时候还在换更强的模型、调 Prompt、把 MCP 的工具描述翻来覆去地改那大概率还是不敢上线。对于这种打通下游多个系统的企业级agent平台的项目我认为MCP 只能搞定的是「连不连得上」但更关键的是harness因为它决定了「敢不敢上线」。模型当然非常重要但在企业里真正决定产品能不能放行的是模型外面那层运行时权限、状态、预算、兜底、日志、评估都归它管。一、harness 到底是什么很多人一说到 Agent 平台一想到的框架就是「模型 工具调用」模型负责想MCP 负责把邮件、OA、ERP 接进来中间塞个编排器可以上线了。但这思考框架只能解决基础能用但能交付上线却少了关键的一环。harness 呢模型是那颗会推理的大脑MCP 是把企业系统接进来的标准接口。harness 是套在大脑外面的运行时和控制系统。模型能看见什么、能调用什么、调用时用谁的身份、最多跑多久、失败了怎么办、过程怎么记、上线前怎么评估全归它说了算。打个比方它像一台企业设备的整机框架。模型出智能MCP 出接口harness 负责装保险丝、电闸、仪表盘、刹车、黑匣子还有应急预案。所以检查harness 的时候产品经理要问的从来不是「模型这次答得好不好」而是下面这些这个任务能不能让 Agent 发起发起前需要谁的授权调用下游时用用户身份还是平台服务身份参数范围有没有收敛如果接口超时会不会重复发邮件、重复建单任务中断后状态算失败、降级还是待人审用户、平台运营和系统管理员分别看到什么有没有证据链证明它没有越权这些问题没一个跟模型聪不聪明有关可每一个都能把上线卡死。内部 Agent 平台的harness 至少要解决几个关键问题能力分级、终态设计、兜底链、预算闸门、权限沙箱、观测与评估。它们一起构成模型外层的护栏。Demo 只要证明模型能做对一次就够了。生产系统要证明的是另一件事它绝大多数时候能做对偶尔做错的时候系统知道该在哪儿停、怎么降级、怎么留下证据、怎么叫人接手。二、能力分级邮件、OA、ERP 里的动作不能一样做内部 Agent 平台最常见的一个错误就是把所有 MCP 工具当成同一种能力。你看平台上列着 search_email、send_email、query_oa_process、create_oa_approval、query_erp_inventory、update_erp_record在工程眼里它们都是工具调用长得一模一样。但在产品眼里这几行的风险差得远。同样是邮件查一封和群发一千封完全是两码事。同样是 OA查个制度和替主管签字审批也差着十万八千里。ERP 就更不用说了库存数字查错了再查一遍就行采购单一旦建错后面一串流程都得跟着遭殃。所以产品经理别只列「Agent 有哪些工具」还得给每个动作标上风险等级。我的建议是至少分三级。L0只读动作。查邮件、查制度、查流程状态、查库存都算。这类动作一般可以自动跑但数据范围得盯住。能查自己的邮件不代表能翻全公司的邮件能看商品库存不代表能导出成本和供应商明细。L1低风险、能回滚的动作。比如建邮件草稿、建个人提醒、发起员工本人的低敏申请、存个临时工作区。这类可以放手让 Agent 自动做完但必须留痕该提醒的时候告诉用户一句「我已经做了什么」。L2外发、写系统、不可逆、高影响的动作。往外发邮件、群发通知、建 ERP 单据、改订单状态、删数据、撤回审批、代表别人审批都归这里。这类默认要人工确认或者只在极小的范围里灰度有些动作干脆就该永久禁掉。这里有个容易被忽略的产品细节别把所有工具都设成「每次调用都要确认」。查个制度要确认查个库存也要确认用户点两天就麻了闭着眼无脑点「同意」。确认机制该留给高风险动作低风险的靠权限范围和日志来兜。所以交付物不是一张工具清单而是一张风险矩阵动作是什么读数据还是写数据影响范围是个人、部门还是全公司是否可回滚是否涉密是否外发谁有权确认确认后要留下什么证据MCP 的工具描述也别只写「发送邮件」四个字。至少得交代清楚发给谁、能不能发外域、能不能带附件、一次最多发给多少人、要不要确认、失败了怎么回状态。后面做预算、沙箱、审计都得先靠这张表找抓手。三、终态设计每一次请求都必须有明确结果企业用户对 Agent 的耐心比 C 端用户低得多。员工问 Agent「我上周提交的报销到哪一步了」Agent 回一句「我已经帮你去查了」然后就没了下文。信任当场就没了。写操作更麻烦。Agent 说「正在为您发起报销」可 OA 里到底建没建这个流程要是建失败了平台知道吗要是卡在某个下游系统业务同学是接着等 Agent还是自己回 OA 补录这些问题本质都是任务没有终态。Agent 的每一次请求最后都该落进下面四种状态里的一种。放行。动作按规则执行完了系统给出明确结果。比如「已查到报销单 2026-0912当前在财务复审节点」。降级。主路径挂了或者数据不全但系统还是给出部分结果和替代办法。比如「实时查询 OA 超时这是你上次查到的流程状态你可以点重新查询或者转人工」。拒绝。请求越过了权限、预算、风险边界或者规则。比如「我不能代表主管审批也没有权限导出全员工资数据」。待人审。动作 Agent 已经准备好了但必须由人来拍板。比如「我已起草致供应商的合同邮件附件和收件人如下请确认后发送」。「待人审」不等于把任务挂半空。它照样得有明确的字段等谁审、等多久、超时了怎么办、用户能不能看到当前责任人、确认之后任务状态怎么回写。四种终态还要拆成三层去看用户看到什么要有具体结果、失败原因和下一步动作不能只给「操作失败」。平台运营看到什么要有任务 ID、失败原因码、工具调用链、重试次数、是否需要人工接管。下游系统看到什么要有业务状态、幂等键、审批记录和最终业务单据的关联关系。一个没有终态的 Agent看着忙忙碌碌其实是把不确定性一股脑甩给了用户。时间一长业务部门宁可回 OA 手工点流程也懒得再打开 Agent。四、兜底链模型或 MCP 失败业务不能跟着卡死企业系统一定会出错这一点没有例外。邮件服务会超时OA 接口会甩回一个权限不足ERP 查询慢得像蜗牛模型还可能把「查报销」听成「发起报销」。上线产品既不能天真的认为大模型永远稳定也不能100%保证 MCP 服务永远稳定不出错。主路径之外harness 必须制定兜底机制。LLM 主路径之外先接一层规则、缓存和模板。「报销制度在哪」「请假入口是什么」「报销单一般有哪几个节点」这类高频问题不必次次都让模型自由发挥。查流程状态失败的时候也可以先吐一个缓存结果但一定要标清楚「非实时」。再往后就是人工接管。高风险动作、意图置信度低的、跨系统的写操作还有用户情绪明显已经上火的都得能一键转成工单或者人工客服。这里有个地方要格外小心重试。查询类接口可以适当重试写操作绝不能闭着眼重试。发邮件超时了系统得先弄清楚这封邮件到底发出去没有建 OA 流程超时了也要先查下游有没有已经建单再决定要不要重试。不然会出现比失败更糟的结果用户收到三封一模一样的邮件OA 里躺着两个相同的报销单。所以写操作必须带幂等键同一个任务 ID 只该产生一次业务影响。重试要配超时和指数退避1 秒、2 秒、4 秒、8 秒地拉开间隔而不是让模型一口气往下游连打十次。某个 MCP 工具连续失败还该有熔断。先把它标成不可用隔一小会儿再用小流量探一探探通了才恢复探不通就继续降级。接下来轮到产品经理要确认哪些场景可以自动降级哪些场景必须转人工降级文案怎么写才不会让用户误以为任务已经成功人工接手的同学能看到哪些上下文高风险写操作失败后是否默认生成工单用户能接受「系统现在查不到」但很难接受一句「抱歉请稍后再试」之后就再没下文了。六、预算控制限制轮数、token、时间和业务代价Agent 有个天然的毛病只要任务没完成它就会一直想、一直调工具停不下来。比如用户就撂下一句「帮我看看最近的报销有什么问题。」这诉求太模糊了。Agent 可能一头扎进去查制度、查流程、读附件、查 OA 状态、翻 ERP 单据然后回头问你「你说的是哪个部门」「哪个时间范围」「哪一类报销」。没人拦着的话它能跑几十轮、调一堆下游接口最后愣是没给出一个结论。代价不只是 token还有用户在那儿干等的每一分钟和下游系统承受的压力。预算闸门至少得有四类。轮数限制。单个任务最多循环多少轮。简单查询 5 轮内必须出结果复杂分析封顶 15 轮或 25 轮。token 累计限制。单任务、单用户、单工作区都设个累计上限免得一个复杂任务把模型资源吃出个窟窿。墙钟时间限制。不能让用户无限期地等。前台会话类任务得有响应时间上限后台批处理也得设个最大执行时间。业务代价限制。这一层在企业里尤其重要。单个任务最多读几封邮件附件、最多查多少条 ERP 记录、最多发几封邮件、最多建几个单据、能不能碰跨部门数据都得有数。撞了顶不能只在 Prompt 里提一嘴「请注意预算」。Prompt 是软约束模型照样绕圈。预算闸门必须是硬的到了阈值就停、就降级、就转人工没得商量。产品经理可以按任务风险配不同的预算L0 查询轮数少、时间短允许自动重试。L1 低风险写入轮数适中写操作必须可追踪。L2 高风险动作预算更紧任何外发或写系统动作都先进入确认。撞顶之后的话术也得设计好。可以这么说「这个问题得把范围收窄一点。A 和 B 我已经查到了你是想让我接着看部门 X还是先把当前结果整理给你」这比甩一句「任务超时」强太多也比没完没了地跑下去安全。预算真正要回答的是这么个问题Agent 做到哪一步就必须停下来问人。六、权限与沙箱审批管「执行边界」沙箱管「数据范围」内部平台最容易就栽在这儿。有些团队为了快点跑通给 MCP 服务配了个高权限账号。模型能查邮件也能读附件能查 OA也能建审批能查 ERP也能写 ERP。Demo 是顺了但权限太大太危险了。上线前必须拆分。先拆工具权限。Agent 能访问 search_email不代表它能碰 export_all_mailbox能访问 query_erp_inventory也不代表它能碰 update_erp_record。身份也得拆。查用户自己的流程就用用户授权后的身份平台跑后台汇总任务用受限的服务身份碰到高风险动作还必须留下确认人的身份记录。数据范围不能光跟着工具走。同样是「查邮件」普通员工只能查自己有权限的那部分HR 助手也只能查跟任务相关的数据不能一上来就默认能看全公司的薪酬。执行环境还得隔离。附件处理丢进隔离目录别让 Agent 随便翻文件系统临时文件任务一结束就销毁出网请求走白名单不能因为附件里夹了个链接就把内容往外部服务上送凭证要短时效、最小权限不能长期有效。审批和沙箱是两回事。审批回答的是「该不该做」比如这封外部邮件能不能发、这张 ERP 单据能不能建。沙箱回答的是「万一做错了影响能不能被圈住」比如附件不许外传、凭证只能用 5 分钟、服务只能访问指定域名、临时文件任务结束就销毁。产品经理设计权限之前先问自己一句这个动作要是被误执行了影响是什么是影响一个用户还是伤一个部门是能撤回还是不可逆是数据泄露还是资金和业务单据跟着变这个答案直接决定权限粒度、确认流程和沙箱要做到多严。做到这一步模型才算是在边界里干活。七、做好数据链记录方便问题分析和日志审计上线之后一定有人来问「Agent 为什么发了这封邮件」「它到底访问了哪些数据」「这个 ERP 单据是不是它创建的」「为什么昨天开始很多报销查询都失败了」光靠聊天记录这些问题一个都答不上来。聊天记录里只有用户和 Agent 的对话看不到完整的执行链。企业 Agent 平台需要一套观测三件套。Trace单次任务回放。把一次任务里的用户输入、模型推理、工具调用、入参、出参、重试、耗时、终态全记下来。出了问题能还原「它为什么这么做」。Audit责任和授权链。记谁发起的任务、谁授权确认、用哪个身份访问了哪个系统、造成了什么业务影响。出了争议能回答「谁批的、做了什么、影响是什么」。Metrics整体健康度。盯端到端成功率、失败原因分布、人工接管率、MCP 工具错误率、延迟、成本、高风险动作数量还有重复循环率。这三样不能揉进同一个日志文件里。Trace 给工程师排障用Audit 给合规和管理员追责用Metrics 给产品经理判断该不该继续扩大开放用。看板上最该死死盯住的是端到端任务成功率。别只看「模型回答看着还行」也别只看「工具调用都返回 200」。得看用户那个原始任务到底完成没有。比如「查报销状态」有没有查到正确的单据「起草邮件」有没有生成一份能直接用的草稿「发起审批」有没有建出一个状态正确、不用人工再补录的 OA 流程。平均执行步数也值得盯。要是某类任务的步数突然变长八成是 Agent 在绕圈同一个工具反复查、参数反复纠正、失败的接口反复重试。还有需要考虑不同角色看版的内容是有差异的员工关心任务状态和下一步动作。业务负责人关心成功率和人工接管率。平台团队关心 MCP 延迟、错误率和成本。安全合规关心高风险动作、越权尝试和数据外发。观测要是等上线之后才想起来补业务方第一次出问题平台就已经说不清了。八、哪怕一个小的修改都要整体性考虑和整体回归分析很多 Agent 项目都藏着一个隐蔽的风险每一次小改动看起来都挺安全。改一句工具描述能有什么事换个小参数不至于吧优化一版 Prompt测试集分数还涨了。可企业 Agent 是条长链路。一个看着不起眼的改动可能先改了意图判断接着改了工具选择最后一脚踩出个高风险动作。举个例子。用户说「帮我处理一下报销。」旧 Prompt 把「处理」理解成「查询报销状态」。新 Prompt 为了显得更主动把「处理」理解成了「帮忙发起报销」。单轮的语言质量评估可能还涨了分但端到端的业务风险反而大了因为它可能建出一个根本不该建的 OA 流程。再比如MCP 工具参数从 process_id 改成了 process_code工具描述忘了同步模型可能还在传旧字段。单次测试未必看得出来可一旦批量跑常见流程OA 创建成功率就悄悄往下掉。所以评估不能只评模型回答得评端到端任务。上线之前至少要做好三点第一道是离线金标集。把邮件、OA、ERP 的常见流程和高风险边界都覆盖进去模糊表达、权限不足、数据不存在、附件解析失败、上下游字段变更、诱导性输入这些场景一个都别落下。过了离线这一关再跑回归。改 Prompt、换模型、更新工具描述、升级 MCP 版本、调整下游接口之后都必须重跑一遍。结果别光打个分要老老实实记下「完成 / 未完成 / 错误动作 / 需要人审」。最后是小流量灰度。先放给平台团队自己用再放给一个低风险部门盯着真实成功率、人工接管率和失败原因看稳了再慢慢铺开。针对读写的操作我建议单独测试凡是涉及外部发送、群发、ERP 写入、代表他人审批的测试用例必须全过而且每一次执行都得能追到授权记录。只要挂了一条流量就不许再扩。测试团队必须回答以下问题评估集包含哪些业务流程哪些场景必须 100% 通过端到端成功率高于多少才能灰度人工接管率升高多少要回滚谁有权批准扩大权限和流量有了测试和验证平台团队才敢拍胸脯说这次改动我验证过了知道它会碰到哪几条业务路径。九、别重复造轮子把企业系统的老经验接进 Agent 平台这些其实都不新鲜。邮件、OA、ERP 早就把权限、审批、审计、限流、幂等、降级这些事处理过一遍了。Agent 平台犯不着另起炉灶先把这些成熟经验接进 harness 就行。传统企业系统能力Agent harness 中的产品含义幂等同一个任务 ID 重复调用不产生重复邮件、重复单据重试与退避超时后按间隔重试写操作先确认是否已执行限流限制轮数、token、调用频率、外发数量和数据导出量熔断某 MCP 工具连续失败时暂停调用避免拖垮业务降级LLM 失败后转规则、缓存、模板或人工审批L2 动作必须明确确认人、确认时间和授权范围审计保留可回放、不可篡改的执行和授权证据最小权限只给任务需要的 MCP 工具、数据范围和短时效凭证灰度发布新 Prompt、新模型、新工具先小流量验证再扩大企业系统过去不会因为一个员工着急就跳过审批Agent 平台也不该因为模型能力强就绕开权限和确认。比如业务负责人问「能不能让 Agent 自动发邮件」产品经理不能就回一句「可以」或者「不行」得把它拆开发给内部还是外部单发还是群发有没有附件附件能不能外发发送前谁确认发送失败怎么处理如何防止重复发送用户投诉时能否还原证据这些答案凑到一起就是「发邮件」这件事的 harness 规则。十、harness 决定内部 Agent 平台能被多少人用绕回标题那句话Agent 上线用不了除了模型问题别忘了检查 harness。这不是说模型不重要。模型决定 Agent 能飞多高harness 决定企业敢把多少权限交到它手里。模型再强要是连任务失败后该落什么状态都不知道平台也不敢放开写操作。MCP 再标准要是工具权限不拆、凭证长期有效、执行没有审计安全团队也不会点头接 ERP。一个内部 Agent 平台要上线我会先问三件事Agent 在邮件、OA、ERP 里哪些动作是永远不能自动执行的每个任务失败的时候用户、平台运营和系统管理员分别看到什么有没有端到端评估和证据链能证明它可以继续扩权限、扩流量这三个问题答得上来才谈得上逐步开放。稳妥的节奏是先放 L0把查询类能力跑起来等观测和评估稳住了再放 L1L2 默认人工确认等证据攒够了再在极小的范围里试一试更高的自动化。内部 Agent 平台的产品价值从来不是「我们接了多少 MCP 工具」而是「我们能在多大的范围里安全放行」。模型负责一次又一次把事做对harness 负责让业务敢把系统交出去。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表