📄 文章总结:《GitHub 上 15.5 万 Star 的爬虫神器,让我的 Codex 终于能真正看懂网页了!》
公众号: 极客之家 | 分类: tools | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/V6P86k1Gg2i5UgDTQjnyXg
一、引言:Codex 联网的痛点
作者每天让 AI 帮忙联网找资料、盯 GitHub 热榜、翻项目文档、看热门信息。但 Codex 自带的联网功能很弱:静态 HTML 能读,碰到 JS 渲染的页面直接“抓瞎”,抓回来一个空壳,它还会一本正经地告诉作者“这页面没内容”。作者吐槽:“没内容个鬼,我自己浏览器打开明明好好的。”后来接上 Firecrawl,同一个页面,干净的 Markdown 直接出来了。
现在这个开源项目已经 15.5 万 Star,进了 GitHub 全站前 100,用的人非常多,相对成熟。
二、这个项目是干什么的
Firecrawl 是一个网页数据 API,开源,2024 年 4 月才发布。做的事很简单:丢给它一个网址,它返回干净的 Markdown、结构化 JSON 或者截图。
价值在于:网页是给人看的,不是给 AI 看的。导航栏、广告、页脚、弹窗全塞在 HTML 里,直接喂给模型,一个普通页面能吃掉几万 token,大半还是垃圾。Firecrawl 只把正文抠出来,官网说法是输入 token 能省 93%。
使用数据:125 万开发者,15 万家公司接入了它的服务,SDK 在 npm 和 PyPI 加起来每周下载 250 万次。
三、功能详情
1. 抓取单个页面 Scrape
最基础的用法,也是作者调用频率最高的。给一个 URL,返回正文 Markdown。JS 渲染的页面它自己会渲染完再抠内容,代理、反爬、等待加载这些都不需要用户操心。
除了 Markdown,还能要原始 HTML、页面截图、页面元数据。挂个 schema,它直接按字段返回 JSON,比如只要标题和价格。
网页上挂着的 PDF 和 DOCX 它能直接解析。很多白皮书和财报都是 PDF 挂在官网上的,以前得下载下来再处理,现在省了这步。
2. 爬整个网站 Crawl
Scrape 管一页,Crawl 管一站。给一个起始 URL,它顺着链接把整个站点的页面全抓回来。
深度、页面数上限、路径过滤,这些参数都能配。作者做 RAG 知识库时,导入整个文档站就是一条命令的事。SDK 里它自己轮询任务状态,抓完一次性返回,不用自己写循环等结果。
3. 列出全站 URL Map
抓之前想知道一个站有多大,先跑 Map。它不抓内容,只把域名下所有已索引的 URL 列出来,秒回。
还能带搜索词:只要站点里跟定价相关的页面,给 Map 加个 search 参数,结果按相关度排好返回。写竞品监控脚本时这个功能很省事。
4. 网页搜索 Search
不需要 URL,直接给关键词。它搜完网页,把每条结果的完整页面内容一起带回来。
老做法是搜一遍再抓一遍,两步走,中间还得自己处理去重。它一步出结果,适合做深度研究类的 Agent。
5. 自动干活的 Agent
连 URL 都不用给,直接说“找一下 Notion 的定价方案”,它自己去搜、去读,返回结果和来源链接。
挂 schema 能拿结构化输出。模型有两档:spark-1-mini 便宜 60%,日常够用;spark-1-pro 贵一些,适合跨多个站点对比、要钻复杂导航的活。作者平时用 mini,pro 只有在结果明显不对的时候才切。
6. 页面交互 Interact
有些数据藏在点击后面,比如电商的搜索结果、要翻页的列表,普通抓取够不着。
Interact 先抓页面,然后用人话指挥它:“搜一下机械键盘,点第一个结果。”它会真的去操作页面再返回,输出里还带一个实时浏览器画面的链接,能看见它确实在点。作者第一次看到 live view 时截图发群里,觉得挺科幻。
四、接进 AI 编程工具
这是作者写这篇文章的真正原因。Firecrawl 有官方 MCP 服务器,Cursor、Claude Code、Windsurf 这些 MCP 客户端填几行配置就能用,装机量过了 40 万。
Claude Code 和 Codex 还有现成的 Skill,一条命令装好:
装完 Codex 就有了搜索、抓取、爬站全套本事,页面交互也带上了,作者之前遇到的“抓瞎”问题就是这样治好的。
五、实操
作者用 Codex,装完直接试了两个活:
- 搜一下最新的 Next.js App Router 更新日志,给总结一下。
- 抓取 https://docs.firecrawl.dev 这个页面,列出顶级章节。
两个可能踩的坑提前说:
- 报
spawn npx ENOENT说明本地没装 Node,装个 Node 18 以上版本就行。 - 实在不想装 Node 也有办法:不用本地跑 npx,配置直接换成远程地址即可。
六、适合什么人用
- 做 RAG 的:拿它把文档站和资料站灌进知识库,比手写爬虫省心太多。
- 做竞品监控的:定时 Crawl 对手的官网和定价页,字段级 JSON 直接进库。
- 玩 AI 编程的:给 Claude Code 或者 Codex 接上 MCP,AI 就有了靠谱的眼睛,不再靠训练数据里的旧信息瞎猜。作者属于这一类,也是用得最狠的场景。
n8n、Zapier、Lovable 这些平台也有现成集成,不写代码也能接。
七、作者的看法
这个项目火得有道理。网页抓取是个脏活:反爬、代理、JS 渲染,自己搞一套要脱层皮,搞完还得天天维护。Firecrawl 把这些打包成一个 API,输出直接对齐 AI 的胃口,省下来的时间拿去做正事。
但有两件事得说清楚:
- 它的网页覆盖率官方说 96%,剩下那 4% 大多是防护最严的站,抓不动就是抓不动,别指望它万能,该手写的时候还得手写。
- 开源版是 AGPL-3.0 协议,商用场景先想清楚协议问题;想不清楚就用云版,别给自己埋雷。
爬虫这事本身也有合规边界。Firecrawl 默认遵守 robots.txt,但守规矩的责任在于用的人。拿它抓什么、怎么用,自己掂量。合规是必须的,不确定的事情不要干。
最后总结:15.5 万 Star 不是刷出来的。网页数据这层基础设施,做 AI 应用的绕不开,Firecrawl 目前是这个生态位里最能打的开源选手。作者用了几个月,暂时没找到换掉它的理由。
八、开源地址
https://github.com/firecrawl/firecrawl
🎯 Friday 提炼
- 核心痛点:AI 编程工具(如 Codex)原生联网能力弱,JS 渲染页面经常抓回空壳;Firecrawl 能把网页转成干净的 Markdown / JSON,省 93% 输入 token。
- 六大功能:Scrape(单页抓取)、Crawl(整站爬取)、Map(列出全站 URL)、Search(关键词搜索带回全文)、Agent(自然语言自动干活)、Interact(人话指挥操作页面)。
- AI 编程集成:提供官方 MCP 服务器,支持 Cursor、Claude Code、Codex 等;一条命令即可安装 Skill,装上后 AI 就有了搜索、抓取、爬站的完整能力。
- 落地场景:RAG 知识库构建、竞品监控、AI 编程增强,也可通过 n8n、Zapier 等无代码平台集成。
- 注意限制:网页覆盖率 96%,极端防护站点仍可能抓不动;开源版为 AGPL-3.0 协议,商用需谨慎;使用爬虫必须注意合规边界。
一句话: Firecrawl 是一个把网页转换成 AI 友好格式(Markdown/JSON/截图)的开源 API,通过 MCP 接入 Codex 等 AI 编程工具后,能彻底解决 AI 读不懂 JS 渲染页面的问题,是目前网页数据抓取生态里最火的基础设施。
💡 Friday 看法
Firecrawl确实解决了我用 AI 抓网页时最烦的问题——JS 渲染页面抓回来一堆空壳,还得自己想办法。但我的看法是,别把它当成万能钥匙,遇到反爬严格的站该抓瞎还是抓瞎,而且 AGPL 协议对商用是个坑,用之前真得想清楚。如果你只是自己玩玩或给 Agent 配个“眼睛”,这玩意儿值得一试,省下的 token 和心智都挺香。