拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Cua-Bench 任务怎么验证?oracle 参考解与手动演练的完整清单

Cua-Bench 任务怎么验证oracle 参考解与手动演练的完整清单【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cuaCua-Bench 是 cua 开源项目里的 computer-use 评测基准。本文讲在把 Cua-Bench 任务交给 agent 之前怎么做自检先用 oracle 参考解验证评估器再人工走一遍交互路径读完后你就能判断这个任务能否放行。任务目录已经就绪你的第一反应多半是丢给 agent 跑分。但跳过验证有坑评估器算错分、环境没搭好都要等 agent 烧完几小时算力才暴露更糟的是你会把坏任务误判成agent 不行。Cua-Bench 用cb命令行工具处理这件事cb task info检查任务定义cb interact驱动环境。下面三道门要按顺序过。门 1装好cb用cb task info自检任务定义前置条件只有两个Python 3.12 或 3.13外加 uv。模拟任务还要浏览器支持。下面三步装 CLI、装 Chromium 并确认可用uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium cb --help帮助输出里能看到run、interact、task、trace、dataset等命令组就算通过。完整命令列表见 cli-reference.mdx。接着在启动环境前加载任务定义cb task info task-pathtask-path就是你任务里含main.py的目录。输出满足这几点才算通过provider 和操作系统类型符合你的预期你要跑的 variant 在列表里setup 和 evaluate 都带✓任务自带 oracle 的话solve 也带✓。main.py里用装饰器声明生命周期cb.tasks_config返回一组 variantvariant 就是同一任务的不同出题版本列表里每个Task由 CLI 按零基索引选取cb.setup_task负责环境准备cb.solve_task是参考解cb.evaluate_task是评估器。签名细节看 task-definition.mdx。门 2跑一次 oracle比对评估分与成功奖励oracle 是任务自带的标准答案脚本。跑它一次等于验证正确答案确实能拿满分。让 variant 0 执行完并自动收尾cb interact task-path \ --variant-id 0 \ --oracle \ --no-wait会弹出一个桌面窗口Cua-Bench 依次执行 setup、oracle、评估器。终端出现以下内容算通过✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!比对对象是任务定义里的成功奖励值。比如你的evaluate对正确解答返回[1.0]这里就该看到[1.0]。oracle 跑失败说明任务或环境本身有问题这是验证失败不是可以记到 agent 头上的分数先修任务别急着跑 agent。门 3手动做一遍 variant其余逐个补跑 oracle去掉--oracle把同一个 variant 手动跑一次这次在可见环境里自己完成目标cb interact task-path --variant-id 0在环境窗口里做完回到终端按回车就会执行评估并关闭环境。终端打出与 oracle 一致的✓ Evaluation result: [1.0]就算通过。其余 variant 逐个补跑 oracle只改--variant-idcb interact task-path --variant-id variant --oracle --no-wait看到和门 2 相同的三条✓、窗口自动关闭即可。生命周期函数虽然共用但每个 variant 的 prompt、metadata、computer 配置各自独立哪个都可能出问题所以每个都要单独验证。放行清单以下条件全部满足任务才可以交给 agent 或编入数据集cb task info中 provider、操作系统、variant 列表都符合预期setup、evaluate、solve有 oracle 时均显示✓每个 variant 的 oracle 运行报告的分值与成功奖励一致手动演练打出的分值与 oracle 结果一致。卡住时先看这两处Playwright 提示缺浏览器可执行文件模拟任务说明浏览器没装进 Cua-Bench 的 uv tool 环境。执行uv tool run --from cua-bench[browser] playwright install chromium补装。cb task info里 solve 没有✓多半是main.py漏加装饰器。确认各函数都用了同一 split 的装饰器支持的装饰器与签名见 task-definition.mdx。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门