Firecrawl 是什么
Firecrawl 是面向 AI 应用与 Agent 的网页数据 API:把公开网页整理成更适合模型使用的 Markdown、结构化 JSON、截图、HTML 或元数据。可通过托管 API、官方 SDK(Python/Node 等)或自托管部署;并提供 MCP,方便接到 Cursor、Claude 等工具链。仓库主许可为 AGPL-3.0(部分 SDK/UI 可能为 MIT,以目录内 LICENSE 为准)。
它不是“下载任意网站”的万能爬虫。能处理 JS 渲染、站点 Crawl/Map、交互 Actions,也不等于可绕过登录墙、付费墙或站点条款。截至 2026 年 7 月核对,GitHub stars 约 15 万级,具体以仓库页为准。

Search、Scrape、Crawl 与 Map
单页与搜索
Scrape 把单个 URL 转成干净 Markdown/JSON 等;Search 可搜索并带回可继续处理的页面内容。相对原始 HTML,清洗后的正文通常更省 token,也更适合摘要、问答和切分入库。
站点级任务
Map 用于发现站点 URL 列表;Crawl / Batch Scrape 适合文档站、帮助中心、博客归档等批量导入。建议先 Map 看结构,再限制深度与范围,避免无预算地全站扫。
Interact / Actions 与 MCP
部分页面需点击、滚动或等待才出内容,可用交互动作再抓取。MCP/Agent 场景下,应限制允许域名、请求预算和任务边界,防止智能体扩大抓取范围。
托管 API 还是自托管
- 官网:https://www.firecrawl.dev/
- 文档:https://docs.firecrawl.dev/
- GitHub:https://github.com/firecrawl/firecrawl
- 自托管:https://docs.firecrawl.dev/contributing/self-host
原型验证、低运维接入:优先托管 API,关注额度与费用。需要控制网络边界、长期内网任务:再评估自托管——要自行维护浏览器依赖、队列、存储、升级与监控。官方说明云端相对开源版有额外能力;选型时对照最新 Open Source vs Cloud 说明,不要默认“自托管=云端全功能”。
AGPL 与抓取合规
- AGPL-3.0 对改造、以网络服务形式提供、二次分发可能有源码义务;商业项目上线前先做法务核对。
- 遵守目标站服务条款、robots、版权与频率限制;登录后、付费、个人隐私内容必须有明确授权。
- 生产管线建议保留来源 URL、抓取时间与失败日志,便于审计。
- 用托管 API 对目标样例页做小规模 Scrape/Search 验证输出格式。
- 确认字段/Markdown 质量够用后,再定 Crawl 范围或自托管方案。
- 接入 Agent/MCP 时写死域名白名单与预算上限。
© 版权声明
1.本站所发布资源部分收集于网络,仅限用于学习和研究测试使用。2.本站资源售价仅为赞助网站,赞助收费仅用于网站维护运营更新,感谢您的支持。3.本站仅保证资源的正常下载和测试使用,售后不包含相关技术咨询服务,请知悉谅解。4.本站所发布资源为非实物商品,不接受退款,请考虑好再进行支付赞助获取下载。
赞助获取下载注意:1.支付赞助成功后请勿关闭窗口或其他操作,等待系统自动确认,按钮 变为 获取下载按钮。2.游客操作请使用 Chrome、Edge 或 FireFox 浏览器 ,以免支付刷新失败(浏览器缓存7天有效)。3.如支付赞助成功后刷新无法显示下载按钮、链接失效等问题请到 【公告留言】 处理或参考下载说明文档 。
THE END














暂无评论内容