ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一次“每分钟烧 10 块钱”的事故复盘:你的 Agent 平台把钱花在你看不见的地方

一次“每分钟烧 10 块钱”的事故复盘:你的 Agent 平台把钱花在你看不见的地方 周一早上九点半同事打开后台瞄了一眼账单整个工位安静了大概三秒钟。一个前两天刚上线的冒烟测试任务——就是那种用来验证“Agent 能不能正常跑通”的小任务——在刚刚过去的周日夜里安安静静跑了 15 个小时烧掉了小一万块费用。没有人加班没有人值班它就是自己跑着自己花钱。这篇文章把这次事故完整拆给你看它是怎么发生的为什么市面上的 Agent 平台几乎都躲不开这类坑以及我们为此补上的两层治理。如果你也正在把 Agent 往生产里放建议看完。事故还原一个任务的“自助烧钱之旅”事情并不复杂。为了验证一条新接入的业务链路我们部署了一个冒烟测试任务按设计它只该在上线时跑一遍。但因为一处调度配置的疏忽它变成了每分钟执行一轮完整链路拉起 Agent检索知识库调用大模型写回结果然后周而复始。单轮全链路的模型消耗折算下来约 10 块钱——每分钟 10 块一小时 600 块就这么匀速地往外流。23 点任务准时上线。凌晨两点十四分账户余额耗尽模型服务返回了 402——余额不足。按理说故事到这里就该结束了但当时的重试策略不认识 402它把这种“怎么重试都不会成功”的终态错误当成了一般的网络抖动按 4 次尝试 × 3 次重试的节奏反复撞墙。更巧的是那晚有人顺手给测试账户充了值。任务立刻“复活”接着烧。直到第二天下午两点才有人在例行巡检里发现异常——此时距离任务上线已经过去了 15 个小时。图 1从上线到止损15 个小时里没有任何系统级的拦截复盘真正让人后背发凉的三个盲区复盘会上我们把这次事故拆开看发现“配置写错了”只是表层。真正的问题是整条链路上没有任何一环设计过“花钱这件事该怎么被看见、被管住”。第一个盲区花钱看不见。账户层面只有一个不断变小的余额至于每一分钟的钱花在了哪个 Agent、哪次调用、哪个环节没有任何记录。如果不是这次烧得够狠我们可能根本不会注意到。第二个盲区错误被误读。402 的含义是“余额不足”重试一百次也不会有奇迹。但不少框架把所有错误一视同仁地丢进重试队列——钱花了事没成还把失败包装成了“正在努力”的假象。第三个盲区出事没人踩刹车。从凌晨两点到下午两点将近 12 个小时系统里没有一道防线把它拦下来。没有熔断没有告警甚至没有一个“消耗速率异常”的判断。后来我们和几个同样在做 Agent 的团队交流发现这不是我们独有的倒霉。Demo 阶段没人在乎几块钱可一旦 Agent 接上生产业务、定时任务和批处理流程账单就会在你注意不到的地方持续生长——“成本黑盒”几乎是这个阶段的行业通病。解药一层让它“看得见”一层让它“刹得住”那次复盘之后我们给平台加了两层治理。思路很朴素先把账记清楚再让系统能在出事的第一时间自己停下来。第一层计量对账。每一次 LLM 调用的 Token 用量和成本都逐条落库——不是月末汇总是每一笔都有流水。在此基础上按日、按 Agent、按模型出报表谁在花钱、花在哪、花得多快排行一眼现形点进去还能一路下钻到单次调用。上周哪个 Agent 是“烧钱王”不用等财务月底对账当天下午就能看到。第二层自动熔断。错误分类器先分清错误的“脾气”网络超时可以重试参数错误重试也没用而 401 / 402 / 403 这类终态错误直接短路一次都不多花。在此之上连续失败达到阈值就自动熔断停跑同时把告警推到群里。像我们那次事故凌晨两点十四分第一次 402 出现的瞬间钱就该停住人也该被叫醒。图 2两层治理——上面一层记清每一笔账下面一层在出事时自动止损两件事单看都不炫技组合起来却是一场质变。同样是“任务半夜抽风”两种平台的结局可能长这样图 3同一类事故糊涂账和明细账的两种结局更大的图景把“生产命门”攥在自己手里这次事故也让我们下了一个决心编排可以借力可靠性的内核必须自持。市面上的编排框架解决的是“怎么把 Agent 跑起来”这个它们做得很好。但从 Demo 到生产之间还隔着一段没人替你走的路成本要对账事故要熔断敏感操作要审批出了问题要能回放现场多节点部署要能断点恢复。这些能力不在任何一个编排教程的目录里却恰好是企业上线时被追问最多的部分。所以我们自研了执行引擎把检查点续跑、跨节点恢复、审批与澄清、终态错误治理、幂等执行这些能力做进了内核再配一层企业级工程框架管多租户隔离、知识库、技能版本和私有化部署。跑得快的事交给生态跑得稳的事自己扛——这是我们用一晚四位数的学费换来的结论。图 4泱穹 Agent 平台全景——自研引擎内核 企业级工程框架 可观测治理写到这里给三类读者各留一句话。如果你是老板或高管先别急着问“我们用上 Agent 了吗”先问三个问题我们的 Agent 花了多少钱谁花的出事了谁踩刹车三个都答不上来说明你的平台缺的不是一个功能是一层底座。如果你是技术负责人把“成本逐笔落库”和“连续失败自动熔断”列进 Agent 上线检查清单。为这两件事投入的成本远低于一次深夜事故。如果你是工程师欢迎直接看实现。错误分类器怎么区分终态错误、计量数据怎么逐条落库、熔断阈值怎么设计代码全部开源。关于泱穹 AIyangqiong-ai一个开源的企业级 Agent 工程平台自研执行引擎检查点续跑、审批澄清、成本熔断、运行回放 企业级框架多租户、知识库、技能治理支持全栈私有化部署。社区版提供一键启动包——解压即用十分钟就能在本机跑起你的第一个企业级 Agent。GitHub 仓库与社区版下载yangqiongai (泱穹AI) · GitHub发布时替换为实际地址一键启动包在仓库 Release 页获取。 下一篇预告《Agent 调用一次 402为什么你的平台会重试 12 次》——把错误分类器和终态短路的实现拆开讲附真实调用链数据。关注更新不错过。
返回列表