Browser Use实战:让AI Agent替你操作网页的完整教程
从安装到写出一个能自动填表、比价、抓数据的浏览器 Agent,详解 Browser Use 的工作原理、提示词技巧与稳定性优化,附避坑指南。
为什么浏览器 Agent 是刚需
很多任务没有 API:后台系统、比价网站、表单申报。传统 RPA 靠录屏和坐标点击,网站一改版就全废。Browser Use 这类工具让 AI 直接”看懂”网页并操作,适应性远超坐标脚本。
它到底怎么工作
Browser Use 把浏览器页面转成结构化的可访问性树(而非截图),交给大模型决策。模型每步输出一个动作——点击、输入、滚动、提取——循环执行直到任务完成。
相比纯截图方案,文本结构方案的 Token 消耗更低、定位更准,也更容易调试。
快速上手
from browser_use import Agent
from langchain_openai import ChatOpenAI
agent = Agent(
task="打开某电商网站,搜索'机械键盘',"
"筛选价格低于300元、评分4.5以上,"
"把前5个商品的名称和价格整理成表格。",
llm=ChatOpenAI(model="gpt-5"),
)
result = await agent.run()
核心就是一句自然语言任务描述。但描述的质量,直接决定成功率。
提示词三条铁律
- 说清起点:明确从哪个 URL 开始,或”用搜索引擎找到官网”。
- 给判定标准:与其说”找便宜的”,不如说”价格低于 300 元”。模糊词会让 Agent 反复犹豫。
- 定义终点:明确要输出什么格式(表格、JSON、列表),避免它不知道该何时停。
稳定性优化
- 限制步数:设置
max_steps,防止陷入死循环烧钱。 - 加超时与重试:网络抖动时自动重试单步操作。
- 失败截图:开启记录,出错时回看图与动作序列,快速定位。
- 先跑小任务:把大流程拆成几个小任务验证,再串联。
常见坑
| 问题 | 原因 | 对策 |
|---|---|---|
| 反复点同一个按钮 | 状态没更新 | 加等待或刷新条件 |
| 输错字段 | 页面有多个同名输入框 | 用更精确的元素描述 |
| 中途卡死 | 遇到验证码/登录 | 关键站点保留人工介入 |
| 成本失控 | 步骤过多 | 设步数上限 + 简化任务 |
合规与边界
浏览器 Agent 能力越强,越要守住边界:
- 遵守目标网站的服务条款,不要高频爬取。
- 敏感操作(付款、提交)设人工确认,别让 Agent 全自动执行。
- 登录态凭证妥善保管,避免泄露。
适合谁用
Browser Use 最适合重复性的网页流程:批量填表、跨站比价、信息汇总、后台数据导出。它不擅长需要复杂视觉判断(如图形验证码)或强实时交互的场景。
一句话:把”需要点一百次鼠标”的活交给 Agent,你只负责描述清楚任务和验收标准。这就是 2026 年浏览器自动化的正确姿势。