AI产品库

产品情报 / Web 数据抓取与转换 API

Firecrawl LogoFirecrawl

搜索、抓取并转换网页的 Web 数据 API

官方把它定义为「用于大规模搜索、抓取并与网页交互的 Web 数据 API」:把网页内容转成干净的 Markdown 或结构化数据供智能体使用,既可自托管开源版,也可直接使用其托管服务。

深度介绍

Firecrawl详细介绍

🔥

定位:把网页变成模型能直接吃的输入

官方的定位是「用于大规模搜索、抓取并与网页交互的 Web 数据 API」,核心产出是干净的 Markdown、结构化 JSON 与截图等模型友好的形式。这条链路的实际价值在成本:把杂乱 HTML 直接塞进上下文既浪费 token 又干扰模型,先转换成正文级别的 Markdown 往往能显著降低单页开销。官方同时把「少花 token、做更好的 AI 应用」写进卖点,说明它瞄准的正是检索增强与智能体场景中的语料准备环节。

🔍

搜索端点:直接拿到结果页的完整内容

搜索端点不只是返回链接列表,而是把结果页的完整内容一并抓下来,官方示例的输出里每条结果都带标题、网址与 Markdown 正文。对做检索增强的团队,这省掉了「先搜索再逐条抓取」的两段式流程,也减少了自行拼接与去重的工作。需要注意的是搜索质量与覆盖范围由服务方决定,涉及时效性或垂直领域内容时,建议先用自有查询集验证召回与正文质量,再决定是否把它当作唯一入口。

📄

抓取端点:一个网址得到多种格式

抓取端点把任意网址转换成 Markdown、HTML、截图或结构化 JSON,并支持只取正文等选项。官方强调「零配置处理难点」:轮换代理、编排、速率限制与被 JavaScript 阻塞的内容都由服务端处理。这些正是自建抓取最常见的坑——写出一次能跑的脚本不难,难的是在目标站点改版与封禁策略变化后仍然稳定。选型时应把稳定性指标(成功率与延迟)而不是功能列表作为主要评估项。

🖱

交互端点:先抓取,再用自然语言操作页面

交互端点允许先抓取一个页面,然后用自然语言提示或代码在其上继续操作,例如输入搜索词、点击结果;返回结果里还带有实时预览地址,便于人工查看当前页面状态。它补上了纯抓取的短板——很多数据在表单与多步导航之后才出现。工程上要注意交互流程的不确定性高于纯抓取:站点结构变化、弹窗与加载时序都会影响成功率,建议在流程中加断言与重试,并保留实时预览地址用于排查。

🤖

Agent 端点:描述需求即可,不必先知道网址

官方把 Agent 端点称为「最容易的网页取数方式」:只需描述需要什么,系统会自行搜索、导航并取回结果,无需预先提供 URL;它被定位为抽取端点的演进版本。该端点还支持用模式(schema)约束输出,官方示例用数据模型类声明字段以获得结构化结果并附上来源。对探索性任务,这降低了使用门槛;但自动化程度越高,可预测性越低,涉及金额、法务或对外发布的关键数据仍应人工复核来源。

🕸

批量与整站能力:Crawl、Map 与批量抓取

除单页能力外,官方提供三类批量接口:整站抓取用一个请求抓遍站点所有网址;地址发现用于即时列出站点上的全部链接;批量抓取则以异步方式处理成千上万个网址。对做语料构建、站点迁移或全站监控的团队,这三者覆盖了从「先看有哪些页面」到「把内容全部取回」的完整流程。实际使用时建议先做小规模试跑,确认目标站点的结构与反爬策略,再放大并发,避免因限流导致大面积失败。

🧰

接入方式:SDK、命令行、MCP 与技能包

官方提供 Python 与 Node.js SDK、cURL 与命令行工具,并单独维护 MCP 服务器,让兼容该协议的客户端用一段配置即可接入网页能力。它还为编码助手准备了技能包(一条命令安装,装完重启助手即可),并提供了「让智能体自行注册并领取密钥」的引导文件——官方文档里直接写「你是 AI 智能体?从这里开始」。这意味着它把「被智能体调用」当作一等使用方式,适合正在搭建代理工作流的团队。

⚖️

许可、可靠性口径与版本节奏

需要区分开源与托管两层:源码以 AGPL-3.0 许可发布(网络提供服务时对源码开放有额外要求,商用集成前应逐条核对),官方同时提供托管服务,两者在可靠性与运维负担上不同。官方给出的可靠性口径是覆盖约 96% 的网页(含大量依赖 JavaScript 的页面)、跨数百万页面的 P95 延迟约 3.4 秒,并强调零配置处理轮换代理与限流。核验时仓库约有 18.3 万 star,发布节奏极快——2026 年 9 月 20 日一天内就有多个版本(v2.11.377 等)。

产品特点

核心功能与独有价值

01

三种输出形态与面向模型的干净正文

抓取端点可把任意网址转成 Markdown、HTML、截图或结构化 JSON,并支持只取正文;官方把「少花 token」作为核心卖点,契合检索增强与智能体场景。

02

搜索、抓取、交互、Agent 四类端点

搜索直接返回结果页完整内容;抓取负责单页转换;交互允许在抓取后用自然语言或代码继续操作页面并返回实时预览;Agent 端点只需描述需求、无需预先提供网址。

03

整站与批量接口齐全

整站抓取一个请求覆盖站点全部网址,地址发现用于即时枚举链接,批量抓取以异步方式处理成千上万个网址,覆盖从枚举到全量取回的流程。

04

把「被智能体调用」当一等用法

官方维护 MCP 服务器并提供一条命令安装的编码助手技能包,还给出了让智能体自行注册领取密钥的引导文件,接入方式对代理工作流友好;源码以 AGPL-3.0 开源。

最近动态

重要更新

一天内多个版本(9 月 20 日)

发布记录显示 2026 年 9 月 20 日先后发布 v2.11.377、v2.11.375、v2.11.373 与 v2.11.371,此前一天为 v2.11.369。发布频率以天计,使用托管服务时通常无需自行升级,自托管部署则应固定版本并关注变更。

v2 API 的端点结构(核验时点)

截至核验时,官方文档与示例以 v2 接口为主,核心端点包括搜索、抓取与交互,另有 Agent、整站抓取、地址发现与批量抓取。接口版本与参数变化较快,接入前建议以官方文档当期说明为准。

面向智能体的接入方式(核验时点)

官方目前提供 MCP 服务器与编码助手技能包两种「一键接入」路径,并额外提供让 AI 智能体自行完成注册与领取密钥的引导文件。这类面向代理的接入方式仍在演进,具体命令与配置以官方文档为准。

可靠性与延迟口径(核验时点)

官方在仓库中给出的口径是覆盖约 96% 的网页(含 JavaScript 较重的页面)与跨数百万页面的 P95 延迟约 3.4 秒,并强调零配置处理轮换代理、编排与限流。这些数字来自官方基准,迁移到自有目标站点时应自行抽测。

产品总结

Firecrawl 是面向智能体与 AI 应用的 Web 数据 API,官方把它定义为「用于大规模搜索、抓取并与网页交互的 Web 数据 API」,核心产出是干净的 Markdown、结构化 JSON 与截图等模型友好格式,目标是让使用者少花 token、更快拿到可用数据。项目源码以 AGPL-3.0 许可开源并支持自托管,同时官方提供托管服务与在线试用场;核验时 GitHub 仓库约有 18.3 万 star,发布节奏以天计(2026 年 9 月 20 日一天内即有多个版本,最新记录为 v2.11.377)。 能力围绕几类端点展开。核心端点包括搜索(直接返回结果页的完整内容,而非仅链接列表)、抓取(把任意网址转成 Markdown、HTML、截图或结构化 JSON,支持只取正文)与交互(先抓取再用自然语言或代码操作页面,并返回实时预览地址)。此外还提供 Agent 端点(描述需求即可取数,无需预先知道网址,并支持用模式约束结构化输出)、整站抓取(一个请求覆盖站点全部网址)、地址发现(即时枚举站点链接)与批量抓取(异步处理成千上万个网址)。官方强调难点由服务端承担:轮换代理、编排、速率限制与被 JavaScript 阻塞的内容都零配置处理。 接入方式覆盖 Python 与 Node.js SDK、cURL 与命令行工具,并单独维护 MCP 服务器供兼容客户端一段配置接入;官方还为编码助手提供一条命令安装的技能包,并给出让 AI 智能体自行注册领取密钥的引导文件,把「被智能体调用」当作一等用法。官方给出的可靠性口径是覆盖约 96% 的网页(含大量依赖 JavaScript 的页面)与跨数百万页面的 P95 延迟约 3.4 秒。 使用前需要注意:源码是 AGPL-3.0 许可,若把修改版本作为网络服务对外提供,需按该许可开放相应源码,商用集成前应逐条核对;官方基准数字来自其自有测试集,迁移到具体目标站点时应自行抽测成功率与延迟;交互与 Agent 端点的自动化程度更高、可预测性更低,关键数据仍应人工复核来源;抓取行为需遵守目标站点的服务条款、robots 规则与当地法律。

产品类型
Web 数据抓取与转换 API
支持平台
REST API(api.firecrawl.d / Python SDK(firecrawl) / Node.js SDK(firecrawl) / 命令行工具 / MCP 服务器(接入各类 AI 客户端) / 面向编码 Agent 的技能包 / 开源自托管 / 官方托管服务与在线试用场
资费模式
源码以 AGPL-3.0 许可开源、可自托管;官方托管服务按用量计费,需在官网注册获取 API 密钥。

核验信息

参考文章与数据来源

本页事实来自 Firecrawl 官方渠道:GitHub 仓库 README(「大规模搜索、抓取并与网页交互的 Web 数据 API」定位、为何选择的六项说明(覆盖率与延迟口径、LLM 友好输出、零配置处理代理与限流、面向智能体的接入、媒体解析、页面动作)、核心与扩展端点表格、各端点的调用示例与输出样例、MCP 与技能包安装方式、智能体自助注册引导)与许可文件(AGPL-3.0)、发布页版本与日期,以及官方站点、官方文档与在线试用场。star 数、版本与接口结构核验于 2026 年 9 月 22 日,项目发布频繁,请以官方文档与发布说明为准。

  1. 其他Firecrawl 官方仓库
  2. 官网Firecrawl 官网
  3. 官方文档官方文档 · CLI 与技能
  4. 其他官方在线试用场
  5. 其他官方 MCP 服务器
  6. 其他官方 Python SDK(PyPI)
  7. 其他官方许可证(AGPL-3.0)
  8. 其他官方版本发布页

用户体验调查

Firecrawl介绍页面对您是否有帮助?