拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Harvey LAB架构揭秘:三阶段评估管线深度解析与新手入门指南

Harvey LAB架构揭秘:三阶段评估管线深度解析与新手入门指南【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个开源的法律 AI 智能体基准测试项目用于在真实法律工作场景中评估大模型 Agent 的能力。它的核心是一条清晰的三阶段评估管线Run智能体干活→ EvaluateLLM 裁判打分→ Report报告与对比看板。本文将带你从零理解这条法律智能体评估管线的完整架构帮助新手快速跑通任意一个法律任务评测。 先懂架构:一个文件系统优先的评测基准Harvey LAB 的设计哲学非常简单:没有数据库没有 Web 服务架构详情见 docs/architecture.md。任务放在tasks/目录运行结果放在results/目录报告生成为静态 HTML 文件浏览器直接打开数据集包含1,660 个任务、24 个法律执业领域含合同场景、约101,000 条评分标准覆盖企业并购、知识产权、税务、破产重组、数据隐私等方向每个任务就是一个目录一份task.json指令 交付物清单 评分标准加一个documents/文件夹模拟案卷资料。例如tasks/corporate-ma/review-data-room-red-flag-review/ ├── task.json # 任务指令、交付物、68条评分标准 └── documents/ # 60份模拟数据室文件这种目录即任务的模型让任务 ID 天然对应路径如 tasks/ 下的corporate-ma/review-data-room-red-flag-review或嵌套场景real-estate/extract-psa-key-terms/scenario-01。阶段一 · Run:智能体读卷宗、写交付物运行入口是一条命令harness/run.py 负责全部调度uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-reviewHarness 会加载任务文件、共享系统提示词harness/system_prompt.md以及harness/skills/下的 docx、xlsx、pptx 技能手册然后启动 harness/agent_loop.py 中的智能体循环模型响应 → 执行工具调用 → 结果回填 → 继续直到模型不再调用工具没有显式的结束工具。智能体拥有 6 个封闭工作区工具工具用途bash在工作区执行 Shell 命令read读取 .docx / .xlsx / .pptx / .pdf / 文本write写入交付物到输出目录edit精确替换文件内容glob/grep按模式查找文件 / 正则搜索内容两个关键设计让这条管线既安全又可移植沙箱隔离每次运行都在独立的 Podman 容器中执行无网络、丢弃全部权限文档目录只读、输出目录可写攻击性内容在容器内解析详见 sandbox/README.md模型适配器harness/adapters/ 下统一实现了 Anthropic、OpenAI、Google、Mistral、Fireworks 等供应商接口换模型只需改--model参数运行结束后results/run-id/下会留下完整案底config.json配置、transcript.jsonl逐轮对话追踪、metrics.jsontoken/耗时/工具统计和output/交付物。阶段二 · Evaluate:LLM 裁判的 All-Pass 打分这一步是 Harvey LAB 评估策略最有特色的部分方法论见 docs/eval-strategies.mduv run python -m evaluation.run_eval \ --run-id run-id \ --task corporate-ma/review-data-room-red-flag-review① 没有标准答案文件。每条评分标准criterion的match_criteria字段本身就是一句什么样的输出算通过、什么算不通过的描述例如若智能体识别出关键客户合同包含控制权变更同意条款则 PASS……。评分逻辑在 evaluation/scoring.py裁判实现在 evaluation/judge.py提示词模板见 evaluation/prompts/rubric_criterion.txt。② 逐条独立评判 范围隔离。裁判默认 claude-sonnet-4-6温度 0.0每次只看一条标准和该条声明的交付物文件避免串味且每条判定都附带推理记录存入scores.json。③ All-Pass 二元计分score 1.0全部标准通过 否则 0.0这听起来严苛但在法律场景中一份只抓到 95% 问题的尽调备忘录漏掉的那个关键风险可能致命——管线回答的核心问题正是智能体多常做到全对。同时scores.json会记录n_passed / n_criteria作为诊断指标告诉你差多远。④ 可选双裁判模式加--dual参数即可用 Sonnet 4.6 GPT-5.5 独立双评并取均值适合正式对比场景。阶段三 · Report:从单份成绩单到模型对比看板评分完成后会自动生成report.html——包含总分、逐条判定理由、文档覆盖率、裁判模型等信息是快速定位模型漏了什么的最快途径evaluation/report.py。当同一任务跑过多个模型后对比看板evaluation/compare.py就是终极输出uv run python -m evaluation.compare --all看板汇总All-Pass 率、标准通过率、逐条标准热力图、文档覆盖率、token 用量、延迟和估算成本——一张图看清各模型在法律真实工作上的差距。⚡ 一条命令跑通三阶段:Sweep 批量评测手动三步走只是起点。utils/sweep.py 可以把模型 × 任务矩阵一次跑完先预检任务与评分标准再并行执行智能体然后有界并发地评估、生成报告uv run python -m utils.sweep \ --task corporate-ma --models sonnet --parallel 4任务粒度很灵活all跑全部任务、corporate-ma跑整个执业领域、real-estate/extract-psa-key-terms跑该工作流下所有场景、或指定到单个任务。还支持--dry-run只看计划不烧 token、--eval-only只重评分、--report-only只重生成报告。 新手四步上手清单获取项目并初始化环境git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.sh配置 API 密钥在仓库根目录.env中写入ANTHROPIC_API_KEY必需裁判默认用 ClaudeOPENAI_API_KEY、GOOGLE_API_KEY可选跑一个任务先uv run python -m utils.describe_task task-id看懂任务再执行阶段一运行命令评分 对比执行阶段二评估命令最后uv run python -m evaluation.compare --all查看全局看板完整带截图式的操作示例含 20 分钟走查流程请阅读 docs/tutorial.md。 关键模块速查你想了解看这里整体架构与任务模型docs/architecture.md评估方法论与裁判机制docs/eval-strategies.md端到端教程docs/tutorial.md智能体循环harness/agent_loop.py评分逻辑evaluation/scoring.py沙箱威胁模型sandbox/README.md批量评测utils/sweep.py总结Harvey LAB 用文件系统优先 三阶段管线回答了如何严肃评估法律 AI 智能体Run 阶段让智能体在沙箱里处理真实复杂度的案卷Evaluate 阶段用 LLM 裁判逐条、语义化、可追溯地打分Report 阶段把单次成绩单沉淀为可横向对比的模型看板。对新手而言记住一条主线即可harness.run干活 →evaluation.run_eval打分 →evaluation.compare看榜——三个命令就是完整的法律智能体评测闭环。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门