ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

智能体面试准备(七十二):智能体上线交付与运维护航工程——发布门禁、SLO 与事故复盘

智能体面试准备(七十二):智能体上线交付与运维护航工程——发布门禁、SLO 与事故复盘 智能体面试准备七十二智能体上线交付与运维护航工程——发布门禁、SLO 与事故复盘引言本篇是工程实战深化系列收官篇。前面讲了架构、调度、记忆、多智能体、可观测、故障防护、可演进最后落到一个朴素问题一个智能体系统怎么从本地能跑变成线上敢放、出了问题能救、救完能复盘。这就是上线交付与运维护航。它决定了智能体是停在 Demo 里还是真的扛住业务流量。也是智能体平台 / SRE 方向的终面常考。前文链接B71 可演进架构与重构工程、B70 级联故障防护熔断与自愈、B57 可观测性与成本治理。需求 ──▶ 开发 ──▶ 发布门禁 ──▶ 灰度 ──▶ 全量 ──▶ 护航 ──▶ 复盘 │ │ │ │ │ │ │ 单测/集成/ 影子/金丝雀 监控 On-call 事故单 │ 回放/混沌 非劣性门禁 SLO 告警 改进项 │ │ │ │ │ │ └─────────┴───────────┴────────┴────────┴─────────┘ 交付流水线 (Delivery Pipeline) 护航闭环 (Ops Loop)表智能体发布门禁清单与传统服务的差异门禁项传统服务智能体系统额外项单元测试函数输入输出工具调用正确性、Schema 校验集成测试API 联通多轮对话轨迹回放、记忆一致性回归指标不劣化Golden Case 行为不漂移LLM-as-Judge灰度流量比例输出分布差异阈值语义层回滚版本回退prompt/模型热切换 会话兼容一、发布门禁让敢发有依据智能体上线前必须过四道关缺一不发接口测试所有工具 Input/Output 契约通过异常输入超长、注入被沙箱拦下。轨迹回放用历史会话重放规划路径、工具调用序列与基线一致。行为回归Golden Case 集用 LLM-as-Judge 评劣化率超阈值如 5%拒收。成本/延迟预算单次会话平均 token、P99 延迟不超 SLO。# 发布门禁聚合CI 中执行defdelivery_gate(agent,golden,budget):results{contract:contract_test(agent),# boolreplay:replay_test(agent,history100),# 轨迹一致率regress:behavior_regression(agent,golden),# 劣化率cost:cost_latency_check(agent,budget),# SLO 达标}blocked[kfork,vinresults.items()ifnotv.ok]ifblocked:raiseDeliveryBlocked(f门禁未过:{blocked})returnresults二、灰度语义层差异阈值智能体灰度和传统服务不同——流量比例只是表层真正要看的是输出分布有没有变。比如切到新模型QPS 一样但回答风格漂移、拒答率上升这种问题流量比例看不出来。做法影子流量shadow让新旧两版并行处理同一批请求用语义相似度 关键指标拒答率、工具调用成功率、用户点赞率比对差异低于阈值才放量。# 影子比对v1/v2 输出分布差异defshadow_diff(v1_out,v2_out,metrics):driftsemantic_drift(v1_out,v2_out)# 0~1formin[refuse_rate,tool_success,like_rate]:ifabs(metrics[m][v1]-metrics[m][v2])metrics[m][threshold]:returnFalse,f{m}漂移超阈值ifdrift0.15:returnFalse,f语义漂移{drift:.2f}超 0.15returnTrue,ok三、SLO 与 On-call护航的指标智能体的 SLO 不能只看服务可用率还要有回答质量维度可用性API 成功率 ≥ 99.9%。延迟TTFT P99 ≤ 2s单 token 间隔 P99 ≤ 200ms。质量拒答率 ≤ x%Golden Case 通过率 ≥ y%工具调用成功率 ≥ z%。成本单会话平均 token ≤ 预算。On-call 告警要分层P0整服务不可用/质量崩塌电话P1单租户 SLO 越界IMP2成本异常工单。避免告警疲劳。四、事故复盘从救火到不再着火故障结束后 24~48h 内出事故单incident结构固定时间线 → 根因 → 影响面 → 临时止血 → 长期改进项action item带 owner 和 deadline。智能体事故的根因常不在代码而在prompt 漂移模型版本回退工具超时雪崩复盘要落到可验证的改进而不是加强监控这种空话。# 事故 action item 跟踪防止复盘流于形式classIncident:def__init__(self,id,root_cause):self.ididself.root_causeroot_causeself.actions[]# (desc, owner, due, verified)defadd_action(self,desc,owner,due):self.actions.append({desc:desc,owner:owner,due:due,verified:False})defclose_if_done(self):returnall(a[verified]forainself.actions)五、收尾工程实战深化系列小结从 A53/B53 到现在 A72/B72我们沿着华为多模态 LLM RAG/Agent 备战主线把大模型推理服务化编译、PD 分离、负载均衡、多租户、流式、智能体生产化可观测、故障防护、可演进、交付护航走了一遍。这 20 篇不是孤立知识点而是一条主线把会跑的模型/智能体变成敢放、能救、可演进的生产系统。面试速答问智能体上线为什么要语义层灰度而不是直接按比例放量答流量比例只看表层 QPS看不出回答风格漂移、拒答率上升这类质量问题。要用影子流量并行跑新旧两版比对语义相似度和拒答率/工具成功率等关键指标差异低于阈值才放量。问智能体的 SLO 和传统服务有什么不同答除可用性、延迟外还要有质量 SLO拒答率、Golden Case 通过率、工具调用成功率、单会话 token 预算。质量崩塌也算事故。问智能体事故复盘为什么容易流于形式怎么治答根因常在 prompt 漂移/模型回退/工具雪崩不在代码。复盘要落到带 owner 和 deadline 的可验证 action item并跟踪 verified 状态不靠加强监控这种空话。高频追问清单智能体的行为回归用 LLM-as-Judge 评Judge 本身不可靠怎么办灰度期间新旧两版共享记忆/状态吗不共享怎么保证一致性质量 SLO 越界时应该自动回滚还是人工决策智能体成本超预算是限流、换小模型还是截断上下文怎么选多智能体系统里一个角色故障怎么界定事故边界和影响面事故复盘 action item 如何避免写了不执行智能体的可观测性数据保留多久才能支撑事后复盘从 Demo 到生产最常被低估的交付环节是哪个为什么
返回列表