
Stagehand AI网页自动化框架速览3条命令从零跑通浏览器自动化【免费下载链接】stagehandThe SDK For Browser Agents项目地址: https://gitcode.com/GitHub_Trending/stag/stagehand写过网页自动化脚本的人都有体会选择器散落在一堆代码里目标页面换个样式就报错站点调整布局后要逐行排查到了生产环境偶发失败更是常态。Stagehand 就是一个面向 AI 的网页自动化框架——用“自然语言 代码”驱动浏览器确定的环节交给代码不确定的环节交给 AI。 Stagehand是什么和 Playwright 的区别在哪官方给它的一句话定位是 The SDK For Browser Agents即专门为构建浏览器 Agent 提供的 SDK。可以这样理解Selenium、Playwright 这类传统工具面向的是“人写用例”每个点击、每次输入都要你明确指定选择器Stagehand 则同时面向“人 Agent”除了完整保留 Playwright 风格的 APIgoto、click、locator、screenshot外还提供三个用自然语言描述的基本操作act执行一个动作比如“点击提交按钮”它自己完成点击observe查看页面问一句“这里有哪些可点击的东西”它返回可操作元素的清单extract从页面抽取数据并按你预先定义的结构返回schema即一份事先约定好的数据格式契约。最大的差异在自愈机制传统脚本遇到网站改版会直接失败等你来修Stagehand 会检测到页面变化自动重新计算操作方式把“坏了”变成“绕过去了”。⚡ 首次运行命令跑通一个页面的最少步骤跑通一个页面只需要三件事创建项目、装依赖、配密钥。一条命令脚手架出示例项目npx create-browser-app或者在已有项目里直接装 SDK以 TypeScript 为例pnpm install browserbasehq/stagehand zodPython 与 Go 也有对应的官方 SDKpip install stagehand。装完之后脚本结构是固定的启动浏览器 →Stagehand.create建实例 →page.goto打开页面随后就可以调用 act / extract / observe。完整可运行的例子在 快速入门文档 里照抄即可。 上手案例三类常见任务怎么拆任务一一步提取数据。比如从一个页面上提取“作者 标题”。做法是调用extract传入一句自然语言描述和你想要的字段结构直接拿到结构化数据不用写一行 DOM 解析代码。字段结构越明确结果越稳定。任务二多步骤流程。典型场景是“登录 → 翻页 → 取数”。做法是把流程拆成若干独立动作不确定当前页面有什么入口时先observe拿可操作元素清单确认后再执行下一步确定性的环节直接走代码定位器既稳又省模型调用费用。任务三缓存重复操作。同一个“点击 填写”组合如果要长期反复执行可以把它缓存下来后续运行直接走缓存不再消耗 LLM 调用。这对控制成本和延迟很实际。 坑与应对三个大概率会遇到的点密钥与凭据配置至少需要两类密钥——LLM 提供商如 OpenAI的 key和 Browserbase 浏览器托管服务的凭据。都建议放进环境变量。首次运行报鉴权错误十有八九是其中一类没配。缓存策略缓存默认生效但目标站点改版后缓存可能过期。Stagehand 会自动检测变化并回退到 AI 重新计算你不需要手动清缓存但要预期到改版后的首次执行会更慢因为走的是重新推理。重试与兜底别把单条自然语言指令当 100% 可靠。关键步骤加重试先observe再act排查失败时会话回放界面能看到整次运行的操作轨迹和输入输出比翻日志直观得多。想继续深入两条路径就够了官方文档 里从入门到配置逐项都有packages/sdk-ts/examples/ 则按常见操作各放了一个示例脚本改一改参数就能直接跑。【免费下载链接】stagehandThe SDK For Browser Agents项目地址: https://gitcode.com/GitHub_Trending/stag/stagehand创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考