Firecrawl | 开源网页抓取 – LLM数据提取与自托管

Firecrawl 是什么

Firecrawl 是面向 AI 应用与 Agent 的网页数据 API:把公开网页整理成更适合模型使用的 Markdown、结构化 JSON、截图、HTML 或元数据。可通过托管 API、官方 SDK(Python/Node 等)或自托管部署;并提供 MCP,方便接到 Cursor、Claude 等工具链。仓库主许可为 AGPL-3.0(部分 SDK/UI 可能为 MIT,以目录内 LICENSE 为准)。

它不是“下载任意网站”的万能爬虫。能处理 JS 渲染、站点 Crawl/Map、交互 Actions,也不等于可绕过登录墙、付费墙或站点条款。截至 2026 年 7 月核对,GitHub stars 约 15 万级,具体以仓库页为准。

Firecrawl 网页抓取与 Markdown 提取示意界面

Search、Scrape、Crawl 与 Map

单页与搜索

Scrape 把单个 URL 转成干净 Markdown/JSON 等;Search 可搜索并带回可继续处理的页面内容。相对原始 HTML,清洗后的正文通常更省 token,也更适合摘要、问答和切分入库。

站点级任务

Map 用于发现站点 URL 列表;Crawl / Batch Scrape 适合文档站、帮助中心、博客归档等批量导入。建议先 Map 看结构,再限制深度与范围,避免无预算地全站扫。

Interact / Actions 与 MCP

部分页面需点击、滚动或等待才出内容,可用交互动作再抓取。MCP/Agent 场景下,应限制允许域名、请求预算和任务边界,防止智能体扩大抓取范围。

托管 API 还是自托管

  • 官网:https://www.firecrawl.dev/
  • 文档:https://docs.firecrawl.dev/
  • GitHub:https://github.com/firecrawl/firecrawl
  • 自托管:https://docs.firecrawl.dev/contributing/self-host

原型验证、低运维接入:优先托管 API,关注额度与费用。需要控制网络边界、长期内网任务:再评估自托管——要自行维护浏览器依赖、队列、存储、升级与监控。官方说明云端相对开源版有额外能力;选型时对照最新 Open Source vs Cloud 说明,不要默认“自托管=云端全功能”。

AGPL 与抓取合规

  • AGPL-3.0 对改造、以网络服务形式提供、二次分发可能有源码义务;商业项目上线前先做法务核对。
  • 遵守目标站服务条款、robots、版权与频率限制;登录后、付费、个人隐私内容必须有明确授权。
  • 生产管线建议保留来源 URL、抓取时间与失败日志,便于审计。
  1. 用托管 API 对目标样例页做小规模 Scrape/Search 验证输出格式。
  2. 确认字段/Markdown 质量够用后,再定 Crawl 范围或自托管方案。
  3. 接入 Agent/MCP 时写死域名白名单与预算上限。
Firecrawl | 开源网页抓取 – LLM数据提取与自托管 - 杂货喵
Firecrawl | 开源网页抓取 – LLM数据提取与自托管
此内容为免费资源,请登录后查看
0积分
发布平台GitHub
编码语言TypeScript、Python...
支持语言中英文多语言
收录日期2026年7月5日
Stars145k
Forks8.3k
免费资源
© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像 - 杂货喵
欢迎您留下宝贵的见解!
提交
头像 - 杂货喵

昵称

取消
昵称图片快捷回复

    暂无评论内容