拓冰建站拓冰建站
首页 / 资讯中心 / 正文

DeepEval:在本地运行、像写单元测试一样给 LLM 应用打分

DeepEval在本地运行、像写单元测试一样给 LLM 应用打分【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepevalDeepEval 是一个开源的 LLM 评测框架把大语言模型应用的质量检查做成 Pytest 风格的断言测试你提供输入、实际输出和期望行为它用 50 余种内置指标LLM-as-a-judge、RAG、多轮对话、安全等在你的本地环境中打分适用于 AI Agent、RAG 管道和聊天机器人的开发与回归验证。谁适合用它三类典型场景DeepEval 的定位是给已经写了一部分 LLM 应用、需要验证它到底好不好的人准备的而不是又一个模型训练工具。AI 工程师给 Agent 的每次工具调用、RAG 的检索与生成环节写可重复的评测换模型或改提示词前先看分数变化避免凭感觉调 prompt。QA / 测试人员把 AI 行为纳入回归测试。提示词改了、模型换了跑一遍deepeval test run就知道有没有退化。数据科学家与产品经理用同一套测试数据集对比不同模型、不同提示词版本的得分让哪个版本更好有数据支撑。官方在 docs/content/docs/introduction.mdx 中明确列出了这四类目标用户AI 工程师、数据科学家、QA、技术型 PM如果你的角色不在其中也可以先读那份文档再决定是否引入。3 分钟确认是否适合你判断标准很简单逐条对照即可你的应用有输入 → 输出的可观测边界。聊天回复、RAG 回答、Agent 的最终结果都行。如果你还没写任何应用只在做模型选型可以关注后面的基准测试部分。你需要分数而不是截图。DeepEval 的每个指标输出 0–1 的分数配合threshold参数决定测试通过与否天然适合挂进 CI/CD。你希望评测默认在本地执行。评测流程运行在你自己的机器或环境中只有当你主动执行deepeval login接入 Confident AI 平台时测试报告才会上传到云端用于团队共享这部分是可选的。满足前两条就值得试第三条涉及数据敏感场景时尤其重要——不登录、不上传评测本身不出本地。最小可运行示例一条命令加一个测试文件DeepEval 与 Pytest 集成安装后评测文件按 pytest 的方式被收集执行。Python 3.9 环境下安装pip install -U deepeval仓库里有一个可以直接参考的入门文件 examples/getting_started/test_example.py其核心结构是定义一个LLMTestCase包含输入、实际输出、期望输出挑选指标然后调用assert_test断言from deepeval import assert_test from deepeval.metrics import AnswerRelevancyMetric, GEval from deepeval.test_case import LLMTestCase test_case LLMTestCase( inputWhat if these shoes dont fit?, actual_outputWe offer a 30-day full refund at no extra cost., expected_outputYoure eligible for a free full refund within 30 days., ) assert_test( test_case, [AnswerRelevancyMetric(threshold0.7)], )运行方式deepeval test run test_chatbot.py有 TypeScript 版本npm install --save-dev deepeval后通过npx deepeval test run执行基于 Vitest 收集用例源码见 typescript/ 目录。核心能力拆解50 指标按问题归类内置指标全部位于 deepeval/metrics/按你要回答什么问题来选比按名字记忆更有效你要回答的问题对应指标示例典型用法回答是否跑题、是否忠实于检索到的上下文AnswerRelevancyMetric、Faithfulness、Contextual Recall / PrecisionRAG 管道整体与检索、生成分开的验收Agent 有没有把事办成、工具用对了吗TaskCompletion、Tool Correctness、Step Efficiency、Plan Adherence评估 Agent 轨迹与单步决策多轮对话中信息是否丢失、角色是否漂移KnowledgeRetention、TurnRelevancy、RoleAdherence客服类聊天机器人输出是否安全、合规、格式正确Bias、Toxicity、PIILeakage、JSONCorrectness上线前内容审核任意自定义标准GEvalLLM-as-a-judge、DAG图式确定性判定业务自定义质量标准两点工程上的说明LLM-as-a-judge 的裁判模型可以换。指标默认调用你配置的 LLM通过OPENAI_API_KEY或自定义模型也可以接入本地模型评测本身不依赖某一家云厂商。评测粒度有三档端到端黑盒、基于完整轨迹trajectory、组件级。轨迹级评测依赖内置 tracing用observe装饰器或框架集成记录模型调用、工具调用、检索等中间步骤之后可以对Agent 走的每一步而非只看最终输出做评测。本地模型接入怎么判断DeepEval 的本地优先有两层含义容易混淆分开看被评测的应用可以是任何东西——OpenAI、Anthropic、本地部署的模型、LangChain 应用框架不关心你用什么。当裁判的评测模型同样可换内置模型适配层在 deepeval/models/llms/子目录覆盖了 Ollama、OpenAI、Anthropic、Gemini、Groq 等多家后端embedding_models/提供本地嵌入模型选项。如果数据完全不能出内网可以把裁判也换成 Ollama 上的本地模型整条评测链路就都不依赖外部 API。判断方法先看指标是否支持你选的裁判模型多数 LLM-as-a-judge 指标支持任意 LLM 后端再在测试用例初始化时通过model参数传入即可不需要改评测逻辑。与主流框架的对接方式集成代码在 deepeval/integrations/覆盖 LangChain、LangGraph、LlamaIndex、CrewAI、Pydantic AI、OpenAI Agents、Anthropic、Google ADK、AWS AgentCore 等。接入模式基本只有三种按你用的框架对号入座回调 / 包装器LangChain 用CallbackHandlerOpenAI、Anthropic 用包装过的客户端代码改动通常是多传一个参数。一键插桩CrewAI、AgentCore 等提供instrument_xxx()调用一次后自动捕获轨迹。OpenTelemetry 导出器OpenInference、Strands、Google ADK 走 OTel 协议上报适合已接入可观测体系的团队。官方文档在 docs/content/docs/ 下按 use-cases、integrations 等目录组织README.md的 Integrations 一节列出了每个框架的接入文档链接。从哪份文档、哪个目录开始看按目标选入口不必通读想跑通第一个评测docs/content/docs/getting-started.mdx官方 5 分钟快速上手或 examples/getting_started/test_example.py。有具体应用场景文档提供 Agent、聊天机器人、RAG、MCP 四个按场景的 Quickstart示例代码在 examples/ 下分目录存放如 examples/rag_evaluation/rag_evaluation_with_qdrant.py、examples/mcp_evaluation/、examples/notebooks/。想看指标实现直接读 deepeval/metrics/每个指标一个子目录含实现与提示词模板templates/下的 txt 文件这也是自定义指标的最好参考。想对比模型而不是应用deepeval/benchmarks/ 内置 MMLU、HellaSwag、DROP、GSM8K、HumanEval、TruthfulQA 等基准官方称十几行代码即可跑完一个基准。进阶能力deepeval/synthesizer/ 用于生成合成评测数据集deepeval/optimizer/ 基于评测结果自动改写提示词deepeval/simulator/ 模拟多轮用户对话。落地建议推荐的推进顺序先复现入门示例把 examples/getting_started/test_example.py 拷进项目替换actual_output为你应用的真实输出跑通deepeval test run。按场景挑 2–3 个指标RAG 应用建议从 AnswerRelevancy Faithfulness 开始Agent 从 TaskCompletion 开始。指标贪多会让报告失去焦点。把测试文件挂进 CIDeepEval 原生兼容任意 CI/CD评测文件就是普通 pytest 文件加一步执行即可形成回归门禁。需要团队共享时再考虑平台只有当出现多人看结果、跨版本对比、生产监控的需求时再通过deepeval login接入 Confident AI个人本地使用完全不需要。如果需要让 AI 编码工具代劳仓库的 skills/deepeval/SKILL.md 提供可安装到 Cursor、Claude Code 等工具的 Skill配合文档中的 vibe-coder 快速上手指南可以让编码代理直接生成评测套件并迭代失败用例。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门