拓冰建站拓冰建站
首页 / 资讯中心 / 正文

gstack /benchmark-models 指南:如何同题对比 Claude、GPT、Gemini 的延迟、成本与质量

gstack /benchmark-models 指南如何同题对比 Claude、GPT、Gemini 的延迟、成本与质量【免费下载链接】gstackUse Garry Tans exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstackgstack /benchmark-models是 Garry Tan 开源工作流工具 gstack 中的跨模型基准测试技能。它把同一个提示词同时交给 Claude、GPT通过 Codex CLI和 Gemini 并行运行用真实数据对比响应延迟、Token 消耗、成本与质量评分——用数据回答哪个模型最适合这个技能而不是凭感觉。/benchmark-models 是什么模型同题竞速先划清边界gstack 里有两个容易混淆的 benchmark 技能技能测量对象/benchmark网页性能Core Web Vitals、加载时间、包体积详见 benchmark/SKILL.md/benchmark-modelsAI 模型性能延迟、Token、成本、质量详见 benchmark-models/SKILL.md/benchmark-models的工作方式是同一个提示词 → 三家模型并行跑分 → 一张对比表。它包装了 bin/gstack-model-benchmark 这个命令行工具并串联起三个模型适配器claude→ Claude Code CLI默认模型 claude-opus-4-7gpt→ OpenAI Codex CLIcodex exec默认模型 gpt-5.4gemini→ Gemini CLI默认模型 gemini-2.5-pro三家并行执行Promise.allSettled跑得慢的模型不会阻塞跑得快的任何一家的认证失败、超时或限流都只会让表格中那一行显示错误原因而不会中止整个批次。核心实现位于 test/helpers/benchmark-runner.ts。完整使用流程从选提示词到保存结果跑分是交互式流程一共六步跟着提示选就行。第 1 步选择提示词三种来源任选其一跑一个真实的 gstack 技能推荐工具会列出所有带SKILL.md的技能文件供你挑选。用真实技能跑分最能暴露模型在工具调用上的实际差异而不只是裸生成能力内联提示词直接输入一段文字通过--prompt text传递磁盘文件指定路径工具会读取文件内容作为提示词第 2 步干运行预览认证状态正式跑分前工具会先执行--dry-run它只验证参数、检查各模型的 CLI 是否安装且已登录不发送任何提示词、不花一分钱。输出的 Adapter availability 部分会告诉你每个厂商是 OK 还是 NOT READY并附带修复提示比如claude login、codex login或export GOOGLE_API_KEY。然后由你选择参赛阵容全部已认证厂商推荐对比信息最丰富、仅 Claude、或指定两个。未登录的厂商会被干净地跳过不会中断批次。第 3 步决定是否启用质量裁判如果检测到 Anthropic 访问凭证工具会询问是否启用--judge质量裁判。裁判用 claude-sonnet-4-6 对每个输出打分每次运行额外花费约 $0.05。官方建议开启——既然要跨模型对比质量才是重点不只是速度。这一步必须手动确认工具绝不会自动启用。第 4 步正式跑分三家模型在同一个工作目录里并行运行每个模型有独立的 5 分钟超时--timeout-ms默认 300000。典型耗时 30 秒到 5 分钟取决于提示词复杂度和是否开启裁判。输出会以表格形式流式打印。第 5 步解读结果跑完后工具会直接给出四个结论最快最低延迟、最便宜最低成本、质量最高裁判评分最高仅当启用--judge、综合最优需结合权衡判断。任何一家出错认证、超时、限流都会单独标出并附修复路径。第 6 步保存基线结果可以存为~/.gstack/benchmarks/日期-技能名.json。厂商会不定期更新模型技能表现存在漂移——保存的基线能让你在未来跑分中捕捉到质量回退趋势数据很值钱。跑分报告6 个指标 内置价格表一份标准报告长这样--output支持 table / json / markdown 三种格式指标说明Model实际使用的模型名以运行时真实返回为准Latency从调用到返回的总耗时In→Out Tokens输入 / 输出 Token 数Cost按内置价格表估算的美元成本每次跑分都可见Quality裁判评分0–10未启用裁判时为-Tool Calls工具调用次数——最能体现模型执行力的差异成本不是拍脑袋算的而是查内置价格表2026 年 4 月版按季度更新模型输入 $/百万 Token输出 $/百万 Tokenclaude-opus-4-715.0075.00claude-sonnet-4-63.0015.00gpt-5.42.5010.00gpt-5.4-mini0.602.40gemini-2.5-pro1.255.00gemini-2.5-flash0.301.20完整价格表见 test/helpers/pricing.ts。缓存读取的 Token 按输入价的 10% 计费表外的模型会打警告并计 0。质量裁判0-10 分怎么打裁判的实现见 test/helpers/benchmark-judge.ts。它把原提示词和各家输出放在一起从 4 个维度逐项打 0–10 分correctness正确性是否解决了提示词要求的问题completeness完整性边缘情况和错误路径是否覆盖code_quality代码质量命名、结构、显式性edge_cases边界处理nil / 空 / 非法输入的处理总分取 4 个维度的平均。裁判只给成功的输出打分固定使用 claude-sonnet-4-6 保证评分稳定每次运行成本约 $0.05。成本可见 5 条铁律/benchmark-models内置了几条防踩坑规则值得新手记住没干运行不跑分——花钱前必须先看到认证状态不硬编码模型名——参赛模型永远来自你的选择裁判绝不自动开启——它花真金白银必须用户明确点头零认证就停下——没有任何可用厂商时跑分不会产生有用输出成本必须可见——每次运行都在表格里展示各家成本让你下一次运行前心里有数新手常见疑问NOT READY 怎么办Claude 显示 NOT READY确认claudeCLI 已安装并完成登录或设置ANTHROPIC_API_KEYGPT 显示 NOT READY确认codexCLI 已安装并执行过codex login凭据存在~/.codex/Gemini 显示 NOT READY确认geminiCLI 已安装并导出GEMINI_API_KEY或GOOGLE_API_KEY。注意 gemini CLI 已不再支持个人 OAuth 免费额度需使用 AI Studio 的 API 密钥单家超时或限流表格中对应行标注ERROR timeout/rate_limit及原因其余厂商结果不受影响想换模型适配器支持按厂商指定具体模型--models之外的模型覆盖参数但新手用默认模型即可小结/benchmark-models是 gstack 中用数据代替感觉的代表技能一个提示词、三家模型、一张对比表把延迟、成本、质量三个维度一次性摊开。跑分前花 10 秒干运行跑分后花 10 秒存基线你就能看到模型选择的真实成本曲线。更多技能清单可参考 docs/skills.md 与 README.md。【免费下载链接】gstackUse Garry Tans exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstack创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门