让 AI Agent 像人一样操作浏览器与电脑,是 agentic 时代最关键的能力之一。Browser Use 指让 agent 自主操控浏览器完成网页任务;Computer Use 更进一步,让 agent 通过截图 + 鼠标键盘直接操作整台电脑。本章收录相关框架、为 agent 打造的浏览器基础设施、自动化 MCP、反检测方案、桌面操作 Agent 与评测基准。
相关:浏览器类 MCP Server 见 MCP 指南,理念见 Agent-First。
| 名称 | 链接 | 简介 |
|---|
| browser-use | GitHub | 当前最热门的浏览器 Agent 框架(Python,MIT),让 AI 直接操控浏览器完成网页任务 |
| Stagehand | GitHub | Browserbase 出品的"浏览器 Agent SDK"(TypeScript),融合自然语言与代码控制,带自愈与缓存 |
| agent-browser | GitHub | Vercel Labs 出品的原生 Rust 浏览器自动化 CLI,accessibility-tree 快照省 token,兼容 Claude Code/Cursor,热度高 |
| Midscene | GitHub | 字节跳动出品,视觉驱动的跨平台(Web/Android/iOS)UI 自动化,用自然语言写脚本 |
| Skyvern | GitHub | 用 LLM + 计算机视觉自动化网页工作流,提供 Playwright 兼容 SDK 与无代码流程编排 |
| Nanobrowser | GitHub | 开源 Chrome 扩展,定位 OpenAI Operator 的免费替代,多 Agent、本地运行、自带 API Key |
| peerd | GitHub | 浏览器原生的 Agent harness,Chrome/Firefox 扩展内直接跑 Agent 循环,驱动标签页并按需拉起沙箱算力(JS notebook、WASM Linux VM),P2P 共享、BYOK、无后端无遥测(Apache-2.0) |
| hermes-browser-extension | GitHub | 浏览器侧边栏扩展,把当前网页上下文接入本地 Hermes Agent 运行时,实现网页内的本地 Agent 协作(MIT) |
| LaVague | GitHub | 由 World Model + Action Engine 组成,将目标翻译为 Selenium/Playwright 可执行代码 |
| Agent-E | GitHub | EmergenceAI 出品,基于多 Agent 框架,用自然语言驱动浏览器自动化 |
| browser-use WebUI | GitHub | browser-use 官方的 Gradio 网页界面,支持多家 LLM、自定义浏览器与持久会话 |
| Notte | GitHub | 主打速度、成本与可扩展性的网页 Agent 框架,支持结构化抽取 |
| Index (Laminar) | GitHub | 结合视觉推理 LLM 自主执行复杂网页任务的开源浏览器 Agent,提供 CLI 与 serverless API |
| open-operator | GitHub | Browserbase 出品,基于 Stagehand 的 web agent 模板,对标 OpenAI Operator |
| browser-cli | GitHub | browsemake 出品的面向 LLM Agent 的命令行浏览器自动化工具,为 LLM 设计输出格式、本地运行、凭证隔离 |
| Playwright(底层) | GitHub | 微软出品,跨 Chromium/Firefox/WebKit 的统一自动化 API,常作为上层 Agent 的底层驱动 |
| Puppeteer(底层) | GitHub | Chrome 团队出品,通过 DevTools 协议控制浏览器的经典底层库 |
把网页/文档转成干净、结构化、LLM 友好的数据,是喂给 agent 的关键一环,也是当前 GitHub 上最火的方向之一。
| 名称 | 链接 | 简介 |
|---|
| MarkItDown | GitHub | 微软出品,将 PDF/Office/图片/音频等多种文件转为 Markdown 供 LLM 使用,star 极高 |
| Firecrawl | GitHub | 大规模搜索、抓取并与网页交互的 API,输出 LLM 友好的 markdown/JSON(注意 org 已迁至 firecrawl) |
| crawl4ai | GitHub | 开源 LLM 友好爬虫,将网页转为干净结构化 Markdown,GitHub 趋势榜常客 |
| Scrapling | GitHub | 自适应爬虫框架,支持 HTTP/隐身/动态浏览器抓取,含 MCP server |
| Docling | GitHub | IBM 出品,文档(PDF/DOCX/PPTX)解析转 gen-AI 就绪格式,含表格/版面识别 |
| olmOCR | GitHub | AllenAI 出品,将 PDF 线性化为干净文本的开源工具包,擅长扫描件/复杂版面,面向 LLM 数据集与训练 |
| ScrapeGraphAI | GitHub | 用 LLM + 图逻辑做抓取,只需自然语言 prompt 即可提取信息 |
| Crawlee | GitHub | Apify 出品的 Node.js 爬虫与浏览器自动化库,内置反爬 |
| gpt-crawler | GitHub | 抓取站点生成知识文件,用于构建自定义 GPT |
| Maxun | GitHub | 开源无代码网页数据平台,Extract/Scrape/Crawl/Search 四类机器人,可自托管 |
| Jina Reader | GitHub | 通过 https://r.jina.ai/ 前缀把任意 URL 转为 LLM 友好的 markdown,含搜索 |
| llm-scraper | GitHub | 用 LLM 把任意网页转为结构化数据,基于 Playwright,多模型支持 |
为 agent 提供开箱即用、可扩展、带反检测与会话管理的浏览器运行环境。
| 名称 | 链接 | 简介 |
|---|
| Steel / steel-browser | GitHub | 开源"为 Agent 打造的浏览器 API",开箱即用浏览器沙箱,封装会话/代理/扩展/反检测,支持 Puppeteer/Playwright/Selenium |
| Browserbase | 官网 | 为 AI Agent 而生的云端浏览器基础设施(Stagehand 出品方) |
| Browserless | 官网 | 远程 Chrome 服务,支持 Playwright/Puppeteer/Selenium,可自托管 |
| Hyperbrowser | 官网 | "Web Infra for AI Agents",AI-first 的 serverless 浏览器,含 HyperAgent |
| Anchor Browser | 官网 | 面向 Computer-Use Agent 的安全浏览器基础设施,fork Chromium 强化行为级反检测 |
| BrowserCat | 官网 | Headless 浏览器 API,"浏览器界的 OpenRouter",一份脚本路由到托管后端 |
| 名称 | 链接 | 简介 |
|---|
| Chrome DevTools MCP(Google 官方) | GitHub | 官方 MCP,让编码 Agent 控制并检视真实 Chrome(性能分析、网络调试、自动化、截图),可对接 Claude/Copilot/Cursor/Gemini |
| Playwright MCP(微软官方) | GitHub | 微软官方 Playwright MCP,基于可访问性树驱动真实浏览器,比截图方案更快更可靠 |
| Browser MCP | GitHub | MCP server,让 Claude/Cursor/VS Code/Windsurf 等控制你本地的浏览器 |
| Stagehand | GitHub | "浏览器 Agent SDK",可与 MCP 生态集成 |
| 名称 | 链接 | 简介 |
|---|
| CloakBrowser(官方) | GitHub ・官网 | 在 Chromium C++ 源码层打入多处指纹补丁的 Stealth Chromium,Playwright drop-in 替代品 |
| Camoufox | GitHub | Firefox fork 的反检测浏览器,在实现层拦改指纹(navigator/WebGL/屏幕等),面向爬取与 Agent |
⚠️ 安全提醒:GitHub 上存在多个冒名 "CloakBrowser" 的李鬼仓库(如 SpikySituations/CloakBrowser 等),盗用官方描述、README 实为诱导下载 exe 安装包的页面,疑似分发恶意软件。请认准官方 CloakHQ/CloakBrowser 与官网 cloakbrowser.dev,切勿下载来路不明的 zip/exe。
让 Agent 通过"看屏幕 + 操作鼠标键盘"直接控制整台电脑。
| 名称 | 链接 | 简介 |
|---|
| Anthropic Computer Use(官方文档) | 文档 | Anthropic 官方 Computer Use 工具,让 Claude 通过截图 + 鼠标键盘控制桌面 |
| Anthropic 参考实现 | GitHub | 官方 quickstarts 仓库,含 computer-use-demo 让 Claude 控制桌面环境的参考实现 |
| OpenAI Operator / CUA | 公告 | OpenAI 的 Computer-Using Agent,结合视觉与强化学习像人一样操作 GUI;产品 Operator 已并入 ChatGPT Agent |
| UI-TARS | GitHub | 字节跳动开源的多模态 GUI Agent 视觉语言模型,覆盖桌面/移动/浏览器,在 OSWorld 等取得 SOTA |
| UI-TARS Desktop | GitHub | 字节出品,含 Agent TARS 框架与原生桌面应用,自然语言控制电脑 |
| Agent S | GitHub | simular-ai 开源 GUI Agent 框架,"像人一样使用电脑",Agent S3 在 OSWorld 上表现突出 |
| cua | GitHub | Computer-Use Agent 开源基础设施,提供沙箱、SDK 与基准,可操控 macOS/Linux/Windows 桌面 |
| OmniParser | GitHub | 微软出品的屏幕解析工具,将 UI 截图解析为结构化元素,为纯视觉 GUI Agent 提供精准定位 |
| Self-Operating Computer | GitHub | 早期框架,让多模态模型看屏幕并执行鼠标键盘操作 |
| Open Interpreter | GitHub | "计算机的自然语言接口",让 LLM 在本地执行代码与操作电脑(执行前需确认) |
| Bytebot | GitHub | 自托管 AI 桌面 Agent,在容器化 Linux 桌面内用自然语言执行任务,近期很火 |
| open-computer-use | GitHub | E2B 出品,基于开源 LLM + E2B 桌面沙箱的 computer use |
| Computer Use OOTB | GitHub | Show Lab(NUS) 出品,开箱即用的 Windows/macOS GUI Agent,无需 Docker |
| OpenAdapt | GitHub | 生成式流程自动化(Generative RPA),录制-回放式桌面自动化 |
| 名称 | 链接 | 简介 |
|---|
| Mobile-Agent | GitHub | 阿里 X-PLUG 出品的强大 GUI Agent 家族(Mobile-Agent v1/v2/v3、PC-Agent 等) |
| droidrun / mobilerun | GitHub | LLM 无关的移动设备自然语言自动化 Agent,支持 Android/iOS,含无障碍 Portal app |
| AppAgent | GitHub | 腾讯出品,多模态智能体像用户一样操作智能手机 App |
| AgentCPM-GUI | GitHub | 面壁智能 OpenBMB 出品的端侧 Android GUI Agent,强化推理、中文优化 |
让纯视觉 Agent 看懂屏幕、精准定位可操作元素的底层模型与工具。
| 名称 | 链接 | 简介 |
|---|
| OmniParser | GitHub | 微软出品,把截图解析为结构化可点击元素,最主流的纯视觉解析底座 |
| UI-TARS | GitHub | 字节跳动原生 GUI 交互视觉语言模型(模型本体/论文/权重) |
| Qwen3-VL | GitHub | 阿里通义多模态大模型,具备强 GUI grounding / agent 能力 |
| CogAgent | GitHub | 智谱 AI 端到端 VLM GUI Agent 模型 |
| ShowUI | GitHub | Show Lab(NUS) 出品,CVPR 2025,端到端 Vision-Language-Action GUI 模型 |
| 名称 | 链接 | 简介 |
|---|
| ChatGPT Atlas | 链接 | OpenAI 浏览器,含 Agent Mode 多步自主任务(先 macOS) |
| Perplexity Comet | 链接 | Perplexity 的浏览器,每个标签页内嵌多模型助手 |
| Dia | 链接 | The Browser Company(Arc 团队)的新一代 AI 浏览器,AI 作为浏览器底层 |
| Gemini in Chrome | 链接 | Google 在 Chrome 内集成 Gemini,提供侧边栏与自主浏览能力 |
注:AI 浏览器产品的功能、定价与上线时间变动较快,请以官方为准。
评测基准
| 名称 | 链接 | 简介 |
|---|
| WebArena | GitHub | 可自托管的真实网站仿真环境,评测自主网页 Agent(含多模态扩展 VisualWebArena) |
| WebVoyager | GitHub | 基于多模态大模型的网页 Agent 与基准,含 15 个真实网站、600+ 任务 |
| Mind2Web | GitHub | 首个通用网页 Agent 基准,覆盖 137 个网站、31 个领域、2000+ 任务 |
| OSWorld | GitHub | 真实计算机环境中评测多模态 Agent 的开放式桌面任务基准 |
| AndroidWorld | GitHub | 运行在真实 Android 模拟器上的移动端 Agent 基准 |
| GAIA | 链接 | 通用 AI 助手基准(含网页浏览任务),466 题分 3 个难度等级 |