
1 先说结论LLM 应用的质量门不是再调一调 prompt是先有评测集。没有评测集每次改 prompt 都是在裸奔——改的不是字是行为。## 2 一个真实翻车现场2026 年 4 月CallSphere 团队一周内 booking 营收掉了 11%。查下来一行 promptyou are a helpful assistant→you are a helpful, concise assistant。多了个concise模型简洁到跳过预订确认环节。用户没完成预约钱没进来没人发现。来源可查latitude.so 2026-05 复盘。## 3 为什么 demo 能跑生产就翻车改的不是 prompt是行为。LLM 是概率系统传统单测断言等于不适用。prompt 是输入的一部分改了 prompt 等于改了行为规范——主流程没坏分支悄悄变了。arXiv 2601.22025 记录 RAG 场景改 prompt 让模型更乐于回答结果无依据自信输出跑 golden set 才发现 citation compliance 下降加证据不足就拒绝回答才修回来。demo 能跑 ≠ 生产能跑。demo 测它能干什么评测集测它该干什么、别乱干什么。## 4 评测集LLM 应用的质量门先建评测集再谈改 prompt。golden dataset 真实输入 你认可的期望行为。每次改 prompt/模型/检索跑一遍分数说话。规模25~50 条起步200~500 条算成熟。关键是质量不是数量。5 四桶黄金集| 桶 | 内容 | 占比 ||—|—|—|| 真实流量 | 线上日志按意图抽样8~12 意图桶每桶约 10 条加权长尾 | 60% || 历史失败 | 每个修过的线上 bug 都是一条免费回归用例 | 20% || 边界 | 长尾输入、极端长度、少见语言/格式 | 10% || 对抗 | prompt 注入、越权试探、恶意输入 | 10% |每条冻结输入、上下文或 mock、期望行为。期望行为不一定是标准答案——格式/安全/语气合规也算reference-free。## 6 开源工具起步- DeepEvalMIT50 指标pytest 原生RAGASApache-2.0RAG 专用faithfulness / context precision / context recall / answer relevancy- promptfooCLI GitHub Actions快速对比 prompt 版本要 tracing 再上 LangSmith5K traces/月免费档、Langfuse开源可自托管。## 7 两个守动作- CI 门禁easy 层挡蠢回归hard 层测进步。FutureAGI发现 retriever 回归 → 阻断 → 修复 → 重跑放行。- 90 天刷新 失败回流每 90 天抽 200 例真实输入重标线上翻车 trace 提升成新行。每个修过的 bug 都留一条回归用例。## 8 边界评测集会过拟合拦不住全新输入形态LLM-as-judge 有同源偏差钱/合同/医疗必须人审维护是成本25 条起步先跑起来。有评测集会翻车没有评测集是盲翻。互动你的 LLM 应用上线前有评测集吗评论区聊聊。