拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Stagehand 浏览器 Agent SDK 完整指南:用 3 个自然语言 API 让 AI 接管网页操作

Stagehand 浏览器 Agent SDK 完整指南用 3 个自然语言 API 让 AI 接管网页操作【免费下载链接】stagehandThe SDK For Browser Agents项目地址: https://gitcode.com/GitHub_Trending/stag/stagehand如果你写过网页自动化脚本大概率经历过这样的场景页面改版后某个按钮换了个 id跑了几百行的脚本全部失效或者你想让大模型直接帮点一下却发现它连元素在哪儿都找不到。传统浏览器驱动如 Playwright是为人工写测试用例设计的而 AI Agent 需要的是另一种接口。项目定位为浏览器 Agent 而生的 SDKStagehand 把自己定义为 The SDK For Browser Agents——它是 Browserbase 团队开发的浏览器 Agent 开发工具包SDK 即 Software Development Kit可理解为封装好的功能库目标是让 AI 以更少的 token、更低的延迟、更强的容错能力操作网页。它提供 TypeScript、Python、Go 三套语言 SDK底层通过 Chrome DevTools Protocol 驱动浏览器无需依赖 Playwright。Stagehand 浏览器 Agent SDK 在 Web 应用中的运行示意它和传统方案的核心区别有三点自愈动作act、observe、extract用自然语言驱动当网站结构变化时自动重新推断动作目标省 token通过修剪后的可访问性树页面的精简大纲向模型提供页面上下文贴近浏览器运行以浏览器扩展形式驻留在页面侧减少往返延迟。拆解三大核心能力1. act()用一句话执行网页操作不需要写选择器直接告诉它要做什么await stagehand.act(click the add to cart button);act接收一句自然语言指令模型会推断目标元素并完成操作。更妙的是它还能接收observe()返回的现成动作直接重放此时不经过任何模型推理执行是确定性的。开启selfHeal后当记录的选择器失效它会自动重新推断。详见 act 文档。2. extract()把页面变成结构化数据从网页抓数据最头疼的是页面结构千差万别。extract让你用 schema 定义想要的输出形状Stagehand 会校验结果后再返回拿到的数据天然带类型const { data } await stagehand.extract( extract the name of the repository, z.object({ name: z.string() }), );TypeScript 用 Zod 描述结构Python 用 Pydantic 模型Go 则直接由类型参数推导 JSON Schema。详见 extract 文档与示例源码 packages/sdk-ts/examples/extract.ts。3. observe()先侦察再行动observe()扫描当前页面返回一组可执行的动作含元素选择器。它适合在动手前规划多步流程、校验元素是否还存在或把动作缓存起来以跳过后续模型调用const { data: actions } await stagehand.observe(find the login form);详见 observe 文档。快速开始环境、安装与密钥环境要求Node.js ≥ 22.18、Python ≥ 3.11 或 Go ≥ 1.26三选一与你的语言栈一致即可本地跑需要已安装 Chrome用 Browserbase 云浏览器则无需本地浏览器。安装依赖并配置 Browserbase API 密钥在 Browserbase 控制台 申请pnpm add browserbasehq/stagehand zod # Python: pip install stagehand export BROWSERBASE_API_KEYyour_api_key注意 Stagehand 不会替你读环境变量密钥需要在自己的代码里取出并显式传入。未配置模型时Model Gateway 会自动为每次推理挑选并鉴权模型因此连模型厂商密钥都可以省掉。完整说明见 安装文档。第一个可运行的自动化下面的最小示例串联了三大能力启动浏览器、打开页面、执行点击、提取结构化内容。运行后可观察到 Agent 在真实页面上的完整动作Stagehand 浏览器自动化 Agent 执行演示import { browserbase, Stagehand } from browserbasehq/stagehand; import { z } from zod/v4; const browser await browserbase.launch({ apiKey: process.env.BROWSERBASE_API_KEY }); const stagehand await Stagehand.create({ browser }); const [page] await browser.context.pages(); await page.goto(https://stagehand.dev); await stagehand.act(Click the Evals button.); const { data } await stagehand.extract( Extract the value proposition from the page., z.object({ valueProposition: z.string() }), ); console.log(data.valueProposition);完整版本见 quickstart 文档本地开发时可把browserbase.launch()换成localBrowser.launch()直接驱动本机 Chrome。组合场景确定性 自愈的混合玩法单独使用任一能力都够但组合起来才体现设计意图。一个典型的稳健模式是先用observe()侦察并锁定动作再用传统 Playwright 风格定位器执行——既保留了 AI 的灵活性又保留了确定性执行const { data: actions } await stagehand.observe(find the latest PR link); await page.locator(actions[0].selector).click();计划-执行分离observe的结果可缓存重复运行时零模型调用见 caching 最佳实践复杂页面结构原生支持跨进程 iframe 与封闭 Shadow DOM 的深层定位批量命令batch一次提交多个操作减少往返可观测性内置 OpenTelemetry 支持每一步操作都有迹可循。Stagehand 浏览器 Agent 的可观测性追踪演示进阶与生态集成多语言同构同一套能力在 Python 中同样简洁from stagehand import Stagehand, browserbase browser await browserbase.launch(api_key...) stagehand await Stagehand.create(browserbrowser) await stagehand.act(click the add to cart button)Python 源码位于 packages/sdk-python/src/stagehand/Go SDK 位于 packages/sdk-go/。Agent 框架集成官方为 Claude Code、Codex、CrewAI、Deep Agents、Mastra、Pi、Vercel AI SDK 等提供统一适配器每个集成都暴露run/snapshot/screenshot三个工具Agent 负责决策Stagehand 负责管理浏览器会话。详见 integrations 总览。评估与持续改进仓库自带一套评测框架内置 WebVoyager、Mind2Web 等基准任务可量化你的 Agent 在真实任务上的成功率与成本Stagehand 内置 Evals 评测框架的任务运行结果其他值得关注的方向速度优化、成本优化、模型与密钥配置、部署建议。下一步行动清单按上文安装依赖配好BROWSERBASE_API_KEY跑通最小示例读一遍 act / extract / observe 三篇文档理解侦察-执行-提取的工作循环用observe()结果 定位器构建一个带缓存的确定性流程如果你的 Agent 框架在集成列表里直接接入run/snapshot/screenshot工具用内置 evals 给自动化流程建立基线再持续调优。浏览器 Agent 时代选择对的 SDK 决定了你的自动化能走多远。打开终端给你的 Agent 接上 Stagehand今天就让网页操作交给自然语言。【免费下载链接】stagehandThe SDK For Browser Agents项目地址: https://gitcode.com/GitHub_Trending/stag/stagehand创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门