十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepEval 入门指南:10 分钟跑通你的第一个 LLM 评估

DeepEval 入门指南:10 分钟跑通你的第一个 LLM 评估 DeepEval 入门指南10 分钟跑通你的第一个 LLM 评估【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval把 prompt 调好、换上新模型之后你凭什么确认它没在胡说大多数团队的回答是在终端里手动翻一遍输出感觉没问题。这种感觉不可复现也无法阻止下一次改动悄悄引入回归。DeepEval 是一个开源的 LLM 评估框架用来做 AI 模型评估它的工作方式类似 pytest你写好测试用例后在本地执行自动化评估由 LLM 作为评判方LLM-as-a-judge给每次输出打分判断回答是否相关、是否有幻觉、是否达成任务目标。DeepEval 解决的三个评估难题改动没有回归测试。你调整了 prompt 或更换了模型除了人眼抽查没有任何机制能证明质量没下降。DeepEval 让这类检查变成可重复执行的测试分数低于阈值时测试直接失败。人工评估主观且不可复现。这个回答还行和这个回答不行之间的界限因人而异。LLM 评判方把标准固化成评分依据同一个用例多次评估结果一致可追溯。RAG 与 Agent 的评估维度太多。检索质量、事实一致性、工具调用是否正确、整条决策轨迹是否高效……手写一套评估代码成本很高DeepEval 内置 40 现成指标覆盖这些场景。安装后先跑通的第一条命令环境准备只需三步确认 Python 版本为 3.9 及以上建议用虚拟环境隔离依赖安装框架本身pip install -U deepeval export OPENAI_API_KEYsk-...设置好OPENAI_API_KEY后即可运行评估。多数 LLM 评判类指标默认调用 OpenAI 模型当评判方所以这个 key 是必需项评估结果默认只留在本地不上传任何数据。 提示如果你想在云端生成可分享的评估报告可以额外执行deepeval login注册账号这是可选项不影响本地评估。跑通一个真实任务从测试用例到看懂结果用一个客服问答场景演示单轮评估。DeepEval 里一切评估都围绕LLLMTestCase展开准确类名是LLMTestCase它的四个字段分别对应用户输入input、你应用的真实输出actual_output、标准答案expected_output、RAG 场景的检索上下文retrieval_context。新建test_chatbot.py写入以下最小可运行示例from deepeval import assert_test from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric def test_chatbot(): case LLMTestCase(inputWhat if these shoes dont fit?, actual_outputWe offer a 30-day full refund at no extra cost., expected_outputFree full refund within 30 days of purchase.) assert_test(case, [AnswerRelevancyMetric(threshold0.7)])把actual_output换成你应用对这条输入的真实回答然后在终端执行deepeval test run test_chatbot.py。运行后你会得到三项信息得分0-1 之间的浮点数、通过/失败状态得分是否达到threshold设定值、评判理由评判方说明扣分原因的文字解释。AnswerRelevancyMetric衡量的是回答与问题的相关程度——如果它给出了题外话分数会明显下降。登录平台后同一批用例的结果会出现在这样的测试用例面板里可以看到每个用例的状态、输入与输出对照按需进阶自定义指标与多指标组合自定义指标 GEval内置指标覆盖不了业务标准时用自然语言描述你的评判规则即可例如回答是否礼貌专业from deepeval.metrics import GEval from deepeval.test_case import SingleTurnParams politeness GEval(namePoliteness, criteriaJudge whether the reply is polite, professional, and useful., evaluation_params[SingleTurnParams.INPUT, SingleTurnParams.ACTUAL_OUTPUT], threshold0.8)criteria是评判方遵循的打分依据evaluation_params指定它拿哪些字段参与判断最后把politeness加进assert_test的指标列表即可。多指标组合同一个测试用例可以挂多个指标一起跑各指标独立打分、互不影响。RAG 场景的常见组合是AnswerRelevancyMetric答案相关加FaithfulnessMetric答案与检索上下文是否事实一致此时需在用例中填retrieval_contextAgent 场景则可以用TaskCompletionMetric、ToolUseMetric分别评估目标达成与工具调用。完整清单见 deepeval/metrics/。落地与避坑接入 CI/CD以及阈值和成本建议接入现有工作流在 CI 的流水线里加一步pip install -U deepeval和deepeval test run tests/并注入OPENAI_API_KEY环境变量。之后任何 prompt 或模型变更都会触发评估指标掉分即红灯这是防止 prompt 漂移最简单有效的手段。如果团队需要集中管理评估历史与数据集deepeval login之后本地评估结果会自动同步到 Confident AI 平台评估、数据集、提示词和 trace 都经由统一的 API 层接入⚠️ 注意新手最常踩的三个坑——阈值拍脑袋。建议先不设严格阈值默认 0.5跑一轮看分数分布确认哪些用例该过、哪些该挂之后再把阈值定在合理分位避免一上来设 0.9 导致全线红灯失去信任。评判成本。每个指标对每个用例都会触发一次 LLM 调用指标多 × 用例多会线性放大开销先用 20-50 条有代表性的黄金样本而不是全量数据。评判方本身会波动。LLM 打分不是完全确定性的保留一小批人工确认过的基准用例定期校准评判标准本身。下一步行动把上文示例中的actual_output替换为你应用对同一输入的真实输出执行deepeval test run test_chatbot.py拿到第一个分数浏览 deepeval/metrics/按你的场景单轮问答 / RAG / Agent挑出 2-3 个指标组合进测试将deepeval test run加进 CI 流水线让评估在每次改动时自动执行。更多细节可参考官方入门文档 docs/content/docs/getting-started.mdx 与完整示例 examples/getting_started/test_example.py。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表