Cua-Bench 任务验证指南:如何用 3 步完成 oracle 校验与手动演练
Cua-Bench 任务验证指南如何用 3 步完成 oracle 校验与手动演练【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua拿到一个现成的 Cua-Bench 任务目录后先别急着交给 agent 跑分或编入数据集。完整的 Cua-Bench 任务验证分两步先用任务自带的 oracle参考解跑一遍评估器确认参考答案确实能拿到成功奖励再不带 oracle 手动演练一次确认环境和交互路径可用。本文带你走完cb interact的完整用法核对任务定义、oracle 校验、手动演练再逐个验证 variant。先想清楚验证到底在防什么结论先行你验证的不是 agent而是任务本身。跑分前先确认下面三件事否则测出来的数据没有意义评估器可能有问题。如果评估逻辑本身有缺陷连 oracle 都拿不到满分奖励那之后所有 agent 的分数都会整体失真等于白跑。环境可能跑不起来。provider环境提供方配置、浏览器依赖、生命周期函数缺失都会让任务在启动阶段就失败——这种失败跟 agent 能力无关。判定口径要记牢oracle 失败属于任务或环境本身的验证失败这个结果不能当作 agent 的分数使用。看到 oracle 跑不通正确的反应是修任务、修环境而不是记录一个 0 分。所以整个流程的逻辑是先证明参考答案能拿满分再证明人手动操作也能走通两件事都成立agent 的成绩才有解读价值。开始前的 30 秒自检按 构建第一个 Cua-Bench 任务 教程的要求三类前置条件齐了再动手环境Python 3.12 或 3.13已安装 uvCua-Bench 及该任务 provider 所需的依赖都装好了模拟任务还需浏览器支持。CLI 可用运行cb --help能看到run、interact、task、trace、dataset等命令组。任务目录一个包含main.py的本地目录下文所有task-path都指它的路径。先装好 CLI 与模拟任务用的 Chromium再确认命令组是否齐全——看到这几个命令组就说明工具链就绪uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium cb --help三道关验证主流程三关顺序不能颠倒先确认任务定义完整再让 oracle 拿满分最后人工走一遍闭环。第一关cb task info 核对任务定义完整性启动环境前先让 Cua-Bench 加载任务定义并检查生命周期是否完整cb task info task-path对照 run-a-task 指南 的核对清单逐项确认provider 与操作系统类型是你预期的你要运行的 variant从零开始的索引确实存在setup 和 evaluation 都显示 check mark任务应当包含 oracle 时solve 也应有 check mark。背景知识一句话带过main.py里用cb.tasks_config、cb.setup_task、cb.solve_task、cb.evaluate_task四个装饰器声明生命周期函数每个返回的Task就是一个可被 CLI 按零基索引选择的 variant。字段含义与签名见 任务定义参考。第二关oracle 验证评估器的完整命令对 variant 0 运行 oracle评估完成后立即关闭环境--no-waitcb interact task-path \ --variant-id 0 \ --oracle \ --no-wait执行时会打开一个桌面窗口Cua-Bench 按 setup 准备状态、执行 oracle、再调用 evaluate 检查最终状态。检查点是把报告的评估结果与该任务认为成功的奖励值对比。教程示例任务的标准输出长这样实际数值以你的任务为准✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!看到Evaluation result与任务定义的成功奖励一致评估器才算过关不一致就按 run-a-task 指南 的口径处理——这是任务或环境本身的验证失败不能当作 agent 的分数使用。第三关手动演练闭环三步走oracle 通过后去掉--oracle再跑同一个 variant这次由你自己操作cb interact task-path --variant-id 0闭环就三步走完说明交互路径没问题在任务窗口里亲手把任务做完回到终端按 EnterCua-Bench 用同一个评估器执行评估并关闭环境。如果手动操作后的评估结果与 oracle 结果一致就说明交互路径和评估逻辑都按预期工作。cb interact的其他参数如 trace、数据集相关选项可在 CLI 参考 里按需查阅。不止一个 variant逐个过一遍cb.tasks_config一次返回多个Task时别只验证 variant 0。只改--variant-id会复用同一组生命周期函数但走的是该 variant 自己的 prompt、metadata 和 computer 配置所以每个 variant 都需要单独验证cb interact task-path --variant-id variant --oracle --no-wait把0换成1、2……对每个 variant 重复第二关的 oracle 检查即可判定口径不变报告的评估结果必须与成功奖励一致。卡住了对照症状排查症状处理⚠️ Playwright 报告缺少浏览器可执行文件模拟任务在与 Cua-Bench 相同的环境中安装 Chromiumuv tool run --from cua-bench[browser] playwright install chromiumcb task info里某个生命周期没有 check mark如 solve 缺失检查main.py里各函数是否按同一 split 正确加了装饰器支持的装饰器与签名见 任务定义参考还没写过任务、不确定main.py该长什么样按 构建第一个 Cua-Bench 任务 的教程过一遍完整结构oracle 跑通了但评估结果不是成功奖励先怀疑 setup 准备的状态或 evaluate 的检查逻辑别急着归因于 oracle验收清单全部勾上才算通过按 run-a-task 指南 的流程下面三项全部成立这个任务才算通过验证可以放心交给 agent 运行或编入数据集cb task info中 setup、evaluate 都有 check mark应含 oracle 的任务 solve 也有 check mark每个 variant 的 oracle 运行报告出的评估结果都与任务定义的成功奖励一致手动演练走通了操作 → 回车 → 评估并关闭的完整闭环且结果与 oracle 一致。三项全勾验证闭环才算完成任何一项不成立先修任务与环境再谈跑分。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考