跳转至

📄 文章总结:《又一个 Agent 上网神器,暴涨 14 万 Star。》

公众号: 开源日记 | 分类: tools | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/_icQ_h1oH4wlmR9ksZnvBw


文章标题: 又一个 Agent 上网神器,暴涨 14 万 Star。

一、问题与背景 做 AI 应用的人,基本都会遇到相同的问题。模型训练所用到的数据有一个截止时间,而现实世界每天都在发生变化。为了让 Agent 获取到最新的网页数据,一般只能自己搭建爬虫或者购买网页数据 API。前者需要解决 JavaScript 渲染、反爬机制、代理池、数据清洗等一系列问题;后者的成本很高,返回的数据不能直接用于大语言模型。

二、Firecrawl 简介 最近在 GitHub 上看到一个项目,已经把这件事做成了一个标准能力。它的名字叫做 Firecrawl,在 GitHub 上有 14.9 万颗星。用一句话概括:它把任意网页转换成干净的 Markdown 或结构化 JSON,并通过一个 API 直接交给 AI 使用。

很多人第一次看到都会觉得:这不就是一个爬虫吗?它所要解决的问题并不是网页抓取,而是使网页数据能够直接进入 AI 工作流。

三、典型使用场景 先来看几个最典型的使用场景。

  1. 给 RAG 系统加上网页数据 很多 AI 应用都会遇到这样的问题。比如用户问:西门子最新推出的产品是什么?模型训练的时候不知道,但是官网已经更新了。以前要重新写爬虫、解析网页、清洗数据,然后导入到向量数据库里。现在只要抓取官网页面就可以得到干净的 Markdown,直接添加到知识库里面。

  2. 批量提取商品、新闻等结构化的数据 对几个竞争者的网站进行分析。传统的做法是为每一个网站分别编写 CSS 选择器、XPath 或者正则表达式。网站一旦有一点点变化,就必须要重新维护。Firecrawl 可以直接定义出 JSON Schema,比如商品名称、价格、评分、库存等等几个字段,返回的结果就是标准的 JSON 格式。不管网页用什么样的布局方式,也不用研究 DOM 结构,只要告诉它最后要获取的数据是什么就可以了。

  3. AI 自己去网上找答案 Firecrawl 新增的功能也最有趣。以前必须事先准备好目标网址。现在只要让 AI 说:整理出 OpenAI 最新的模型价格。它会自动去搜索网页、进入网站、浏览页面然后提取出结果。整个过程就是可以真正上网的 Agent。

到这里就差不多可以知道为什么 Firecrawl 会受到欢迎了。它不仅是一个网页抓取工具,而且把网页获取、正文提取、结构化输出和 Agent 自动导航等所有功能都集成在一起,形成了一整套的功能。

四、技术实现 有人要好奇怎么做到的。

01 抓取层突破:12 种引擎并发竞速,自动处理 JS 渲染和反爬 Firecrawl 内置了 Playwright、Puppeteer、Chrome CDP 等 12 种抓取引擎,在并发启动之后会自动选择出最快速、最稳定的结果。同时实现了 JavaScript 渲染、代理轮换、反爬处理。开发者只需要写一个代码: app.scrape("https://example.com") 浏览器启动、页面加载、正文提取等等都实现了自动化的功能。

02 层级优化:输出格式 LLM 准备就绪,准确率 96% 支持 Markdown、HTML、JSON、截图等格式输出,得到的就是已经清洗好的正文。可以定义 JSON Schema,Firecrawl 会自动理解页面语义并输出结构化的数据。question 和 highlights 两种模式只返回核心内容,比整页抓取最多可以节省 100 倍的 Token 消耗。

03 代理层进阶:从知道网址到知道目标 开发者不需要提前准备好 URL,只需要说明要达到的目的就可以。比如说找到 Notion 最新的价格。FIRE-1 Web Action Agent 内置有自动搜索、点击、填表单以及提取结果的功能。底层的 PDF 解析、链接提取等模块用到了 Rust NAPI,速度提升 3-5 倍。

五、代码示例 看完这些功能,相信很多人已经想试试了。

Python 用户: pip install firecrawl-py

下面给出一些常见的 API 调用示例。

01 网页正文抓取

from firecrawl import FirecrawlApp
app = FirecrawlApp(api_key="your-api-key")
result = app.scrape_url("https://example.com")
print(result["markdown"])
输出就是干净的 Markdown,可以被直接写入到向量数据库或者知识库中。

02 用 Agent 来获取需要的信息

result = app.extract(
    [
        "https://openai.com",
        "https://openai.com/pricing"
    ],
    {
        "prompt": "Extract pricing information for GPT-4 models"
    }
)
对自动化的数据采集和 Agent 的应用场景来说,这种方法比传统的网页爬虫更具有灵活性。

03 也可以用 skill 的方式来使用 打开 CC 之后执行以下命令: npx -y firecrawl-cli@latest init --all --browser 这样就可以在命令行调用了。

六、写在最后 Firecrawl 并不是只有做网页爬虫的功能。它把网页抓取、内容提取和结构化输出结合起来,让网页数据可以直接用到 AI 应用里。但是它不能抓取需要登录的付费内容,并且会遵守 robots.txt。如果你在做 RAG、AI Agent 或者是企业知识库,可以试一试这个项目。

项目基于 AGPL-3.0 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。开源地址:https://github.com/firecrawl/firecrawl

既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!


🎯 Friday 提炼 - Firecrawl 通过一个 API 将任意网页转为干净的 Markdown 或结构化 JSON,让网页数据可以直接进入 AI 工作流。 - 内置 12 种抓取引擎并发竞速,自动处理 JavaScript 渲染、反爬和代理轮换,开发者只需一行代码。 - 支持 JSON Schema 结构化提取,并可通过 question/highlights 模式节省最多 100 倍 Token 消耗。 - FIRE-1 Web Action Agent 能按目标自动搜索、点击、填表并提取结果,实现真正“能上网”的 Agent。 - 开源协议为 AGPL-3.0,遵守 robots.txt,但无法抓取需要登录的付费内容。

一句话: Firecrawl 把“网页抓取+内容提取+结构化输出+Agent自动导航”整合为标准 API,让任意网页数据能直接喂给大模型,是 RAG、Agent 和企业知识库场景下的开源利器。


💡 Friday 看法

14万星确实夸张,说明大家苦“网页数据进AI”久矣。但我有点担心它把爬虫包装成“标准能力”后,大家会忽略robots和合规问题——毕竟人家也说了不能抓付费内容。对普通开发者来说,能省去维护选择器的时间是真香,尤其是那2个只提取核心内容的模式,token省下来都是钱。不过这类工具越方便,越容易让人过度依赖,真到反爬升级或页面结构诡变时,可能还是得自己兜底。