
DeepEval LLM 评测框架如何 5 分钟跑通评测闭环并接入 CI【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval刚升级模型客服回答的质量肉眼看起来差不多你拿什么向团队证明新旧版本真的有差别人工抽看十几条回复给出的结论往往互相打架。DeepEval 的思路是把评测写成可重复执行的测试每条样本交给指标打分输出 0-1 的分数版本差异从感觉变成可复现的数字。先判断该测什么RAG、智能体、多轮对话三套指标选指标前先归类你的系统三类系统对应三组核心指标。RAG 应用回答相关性看回答贴不贴问题忠实度看是否忠于检索上下文上下文召回率看关键信息有没有被漏掉。智能体任务完成度衡量目标是否达成工具正确性校验工具调用是否符合预期。多轮对话知识保留度检验多轮之后信息是否还在每轮忠实度关注摘要与追问场景。判断标准就一条指标要对应你会被用户投诉的那类失败。最快安装步骤与最小可运行用例安装只需一条命令Python 3.9 即可pip install -U deepeval本地克隆仓库便于阅读示例与源码git clone https://gitcode.com/GitHub_Trending/de/deepeval配置好 OPENAI_API_KEY 环境变量后下面这个工单分类用例约 10 行就能跑起来from deepeval import evaluate from deepeval.metrics import AnswerRelevancyMetric from deepeval.test_case import LLMTestCase tc LLMTestCase( input用户反馈 API 超时判断工单类别, actual_output应归类为性能问题建议先查服务端 P99 延迟。, retrieval_context[性能类工单需先确认是否伴随延迟指标异常。], ) evaluate([tc], [AnswerRelevancyMetric(threshold0.7)])终端会打印指标说明和结果表每个指标一行分数落在 0-1PASS 或 FAIL 一目了然分数低于 0.7 就标 FAIL回答与问题、上下文是否对得上直接量化了。把评测固化进流程数据集管理、阈值设置与 CI 集成评测要防回归得先固化成数据集。用一个 jsonl 文件维护测试用例每行一条字段对应 LLMTestCase 的 input、actual_output、retrieval_context。用 EvaluationDataset 加载阈值统一写在指标初始化处集中管理、避免散落各处。CI 侧加一步deepeval test run test_chatbot.py低于阈值的指标会直接让构建失败每次合并都自动跑一轮回归。数据集加载与持久化的实现在 deepeval/dataset/集成示例见 examples/tracing/。评分不及格时的排查顺序输入、上下文、阈值三步走分数偏低时按固定顺序排查不要先动阈值。先查输入清晰度问题本身含糊分数低是合理的先修样本再谈模型。再查上下文完整性确认 retrieval_context 里真的有支撑答案的依据漏检就查召回环节。最后才考虑调阈值阈值是业务决策不是掩盖问题的旋钮。排查完仍普遍偏低说明是模型或提示词的问题这时换版本重跑对比两轮的均分才是有效证据。一句话总结DeepEval 让你用测试代码给 LLM 应用建起 0-1 的评分闭环版本迭代和 CI 防回归都有据可依。指标的完整清单与自定义写法直接看 deepeval/metrics/ 源码即可。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考