跳转至

📄 文章总结:《4.8K Stars 的神级开源项目,让"自动打开网页"这件事终于成了》

公众号: 阿刚同学 | 分类: agent | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/FR5sdm_1etvPj25YFm2X6g


4.8K Stars 的神级开源项目,让"自动打开网页"这件事终于成了

公众号: 阿刚同学
作者: 阿刚同学(原创)


一、AI 上网的痛点

如今大多数人工作学习都离不开 AI,过去那些重复机械的活儿,现在一句话就能让 AI 搞定。但有些时候,AI 还是会让人崩溃:

  • 你想让它看一眼某款商品的实时价格,它说访问失败;
  • 你想让它帮你汇总某网站的热榜简报,它告诉你该内容需要登录。

熟悉吧?不是 AI 不够聪明,而是现在的网站早就筑起了层层防线——Cloudflare、人机验证、登录墙,把 AI 那个简单的 HTTP 请求挡得死死的。想让 AI 真正"上网冲浪",它得拥有一双能打开真实浏览器的手。

可惜大部分 AI 没有这个能力。少数能做到的,要么配置劝退、要么效果拉胯。直到碰上 BrowserAct——这个 GitHub 上 4.8k Star 的国产开源项目,实测下来是真的惊艳。

二、BrowserAct 是什么

BrowserAct 是一个面向 AI Agent 的浏览器自动化 CLI,相当于给 AI 配了一双能开真实浏览器的手。你只需要用大白话告诉它从哪个网站拿什么数据,它就可以帮你打开真实浏览器,自动处理登录、验证码、反爬墙,把结果整理成干净的结构化数据交给你。

核心能力:

  • 反爬能力: 支持真实浏览器控制、反检测浏览器环境、代理、Profile、Cookie、Session 等能力,帮助 Agent 处理动态渲染、登录态页面和护页面。
  • 支持人机接力: 验证码、扫码登录等人工环节可无缝接入流程。
  • 支持多任务并发: 多 Session 独立工作区,多任务并行互不干扰,避免页面和上下文冲突。
  • 多账号独立隔离: 每个账号独享独立浏览器环境与静态代理,登录态、Cookie 完全分离,适配多账号长期运营。

官网:https://www.browseract.ai/gang

三、让你的 AI Agent 真正能操作浏览器

BrowserAct 是一款专门为 AI Agent 设计的浏览器自动化工具与技能库(CLI/工具集),面向 Claude Code、Cursor 等智能体环境,简单说就是一个 Skill,可以通过命令一句话安装。

提示词: 安装这个技能:https://github.com/browser-act/skills/tree/main/browser-act

比如在企鹅的 WorkBuddy 中安装,安装后就可以在 WorkBuddy 调用 BrowserAct 的能力了。

阿刚经常玩软件,GitHub 是必逛网站之一。想知道最近一周内最火热的中文项目,可以这样说:

去 GitHub Trending 页面,筛选一周排名前十的中文项目,要项目名称、星标数、和项目简介,整理成表格。

BrowserAct 首先需要配置一个浏览器,主要支持两种方式:

  1. 直接使用本地的 Chrome 浏览器
  2. 基于云的 stealth 模式(需配置 API)

第一种就是直接用本机的 Chrome 浏览器。由于 GitHub 是公开可访问的页面,直接使用本机浏览器即可。

配置好后,BrowserAct 会在后台静默调用浏览器,三下五除二就成功抓取到了数据。过程中它会自动调整抓取策略,比如当发现截取的内容有截断,它会自动尝试用 JavaScript 提取数据。最后的效果很棒。

五、实例二:抓取小红书笔记

小红书的反爬一直很严苛,一般的工具很难抓取到内容,但 BrowserAct 照样手到擒来。比如:

去小红书搜索"装机配置",提取前 10 条热门笔记的:笔记标题、作者昵称、点赞数、收藏数、笔记链接。

BrowserAct 在进行基本测试后,明确告知小红书的反爬检测较强,普通标准的 Chrome 浏览器被拦截,必须使用 BrowserAct 提供的隐身浏览器 Stealth Brower。

Stealth Brower 简介: stealth 模式是 BrowserAct 提供的一种浏览器类型,专门用来对付那些"带反爬"的网站。它属于 BrowserAct 的云端托管能力,需要注册账号才可使用,本身有强大的反爬,包括隐身指纹伪装、TLS 轮换、自动过 reCAPTCHA 验证码等等。

按照提示的链接注册后(或者已经登录了账号后点击链接),它会自动获取到你账号的 API。之后根据提示的链接为本次的小红书创建一个专属的隐身浏览器。

由于小红书搜索内容必须要登录账号,BrowserAct 会自动发起一个远程模式,只需点击链接后扫码登录一下小红书即可。

一切就绪后,BrowserAct 便会开始抓取数据,最后返回表格。WorkBuddy 还单独生成了一个 html,更加一目了然。

六、BrowserAct 网页版

除了本地调用外,BrowserAct 近期还推出了一项新能力——BrowserAct Agent Built。简单说,不需要任何客户端,不用写代码,不用配规则,只需要一句话就可以创建可复用的 bot,全程只需要一句 prompt。

七、实例三:抓取知乎高赞回答

知乎上与软件相关的话题多不胜数。作为一个软件博主,每隔一段时间都会上去浏览,总能发现一些不为人知的好软件。由于知乎的问答较分散,自己搜索、浏览、筛选颇为麻烦,此时就可以交给 BrowserAct 了。

在 BrowserAct 的网页端,用大白话描述需求即可。比如:

知乎搜索软件推荐效率工具AI工具;提取热门问题的标题、回答数、高赞回答中提到的软件名和推荐理由,返回表格。Bot 需支持更换关键词重复运行。

BrowserAct 心领神会,在确认需求后:

  1. 首先将开始创建为一个"知乎软件推荐提取 Bot";
  2. 根据描述进一步罗列出 Bot 的创建方案;
  3. 确认无误后点击继续,当然也可以进一步描述、修改直至满意。

同时,BrowserAct 会立刻调用浏览器,开始尝试访问知乎,包括尝试搜索关键词、判断是不是需要登录才可搜索到内容。

这里强调:浏览器是直接由 BrowserAct 在云端提供,与一般自动化的同类工具不同,BrowserAct 是一个标准的真实浏览器,如同真人操作浏览器,本身具备强大的反浏览器控制、反检测能力。且浏览器支持隐身模式、支持设置代理、屏蔽广告。

在确认需要登录后,在浏览器中扫码登录一下知乎网站即可。而且只需要登录一次,云端浏览器可以记住登录状态,今后就能直接运行 Bot。

关键点: 能真正操作浏览器的 AI,一定是人机互动的。BrowserAct 的做法就是把这些"必须人处理一下"的步骤纳入工作流——Agent 能处理的先自动处理;必须人工参与的,就让人接力;接力完成后,Agent 从原来的浏览器状态继续执行。而阿刚之前用过的一些同类自动化工具却做不到这一点。

登录账号之后,BrowserAct 再次进行探索,并很快指出了一个实际的问题,给出了修改建议。再次确认无误后,稍等片刻,一个"知乎软件推荐提取 Bot"便构造成功了。

八、云端 Bot 的复用与参数化

在 BrowserAct 云端中,执行的流程是:提出需求——创建 Bot——运行 Bot——返回数据

在上面的实例中,提出需求后,BrowserAct 执行的是 Bot 创建。在云端所有的 Bot 都可以统一管理、编辑、更新。

创建的 Bot 不是一次性的,而是一个可以反复使用、反复执行的 Bot。更牛的是,它支持"参数输入"。比如在"知乎 Bot"中,实际使用时肯定需要搜索不同的关键词(如软件推荐、AI 工具等),总不能每一个关键词都做一个 Bot。因此在描述需求时,就可以明确指出 Bot 要支持关键词更换,或者指定其他参数。

实际效果也很棒:运行 Bot 后,稍等片刻就能抓到数据。抓取到的是结构化的数据,支持一键下载 CSV、markdown、JSON、XML 格式,方便至极。当然,为了更好的阅读,可以把数据在 AI 中进行二次归纳、提炼、整理。

九、总结

如今的 AI 的确强大,大家也更习惯把注意力放在模型参数、提示词优化这些硬性指标上,但实际执行时,有时候就被挡在了门外,导致 AI 直接歇菜。尤其是对于访问网站、抓取数据这一块,一个验证码或者登录验证就把 AI 难住了,进都进不去还谈什么推理呢。

BrowserAct 的做法,就是给 Agent 配一双能打开真实浏览器的手,极尽可能提升反验证能力。但它也实诚,它从不称可以绕过所有验证,而是把"人机接力"纳入正常的流程——Agent 暂停,你接力,它继续跑,反而更好用。

如果你也在用 AI Agent,或者有抓取数据的需求,不妨试试 BrowserAct。

官方网站: www.browseract.ai/gang
开源地址: https://github.com/browser-act/skills/tree/main/browser-act


🎯 Friday 提炼

  • 核心定位: BrowserAct 是一个面向 AI Agent 的浏览器自动化 CLI/技能库,给 AI 配上能操作真实浏览器的"手",解决反爬、登录墙、验证码等难题。
  • 两大使用方式: 本地 Chrome 直接驱动,或使用云端 stealth 隐身浏览器应对强反爬网站(如小红书)。
  • 人机接力设计: 验证码、扫码登录等人工步骤无缝纳入工作流,Agent 暂停、人工接力、继续执行,而非试图绕过所有验证。
  • 网页版 Agent Built: 无需客户端和代码,一句 prompt 即可创建可复用的 Bot,支持参数输入(如更换关键词)和结构化数据下载(CSV/Markdown/JSON/XML)。
  • 多账号与隔离: 支持多任务并发、多账号独立浏览器环境与静态代理,登录态和 Cookie 完全分离,适合长期运营。

一句话: BrowserAct 是一个 4.8K Stars 的国产开源项目,为 AI Agent 装上真实浏览器的"手",通过反检测与人机接力,让"自动打开网页、抓取数据"真正落地可用。


💡 Friday 看法

这工具最打动我的是“人机接力”的设计——验证码、扫码登录这些卡脖子环节交给用户,剩下的脏活累活让 Agent 干,确实比那种纯黑盒自动化靠谱得多。但作为日常用户,我还是会担心云端浏览器这玩意儿的数据隐私问题,毕竟逛小红书、知乎这些账号都得在它那儿过一遍。另外这类工具本质是在跟网站反爬玩猫鼠游戏,现在好用不代表以后一直好用,长期依赖一个开源项目的可持续性也得打个问号。