1. Firecrawl
Firecrawl 快速入门
一句话卖点:面向 AI 应用的网页抓取与转换平台,把任意 URL 变成干净的 Markdown / 结构化 JSON。
这是什么?适合谁?
Firecrawl 是 Mendable.ai 在 2024 年开源 / 上线的AI 专用网页抓取与转换平台,主域名 firecrawl.dev。它跟传统爬虫(Scrapy、BeautifulSoup、Puppeteer)不同——Firecrawl 解决的问题是「让 LLM 看得懂的网页数据」。
具体说:
- 给一个 URL,Firecrawl 自动处理 JS 渲染、反爬、Cookie、动态加载,返回干净的 Markdown;
- 支持「整站抓取」(Crawl),从一个根 URL 开始递归抓所有子页面;
- 支持「结构化提取」(Extract),用自然语言或 JSON Schema 定义想抓的字段;
- 输出格式:Llama-friendly Markdown、JSON、HTML、截图;
- 提供 Python / Node / Go SDK,也有 REST API;
- 云服务 + 自部署开源版本都有。
适合谁?做 RAG 应用的开发者(需要把文档站 / 博客 / 帮助中心转成向量库)、做 Agent 工具的团队(让 AI 抓网页并提取信息)、竞品监控、价格监控、舆情分析、内容聚合。
不适合只想做「一次性手动复制粘贴」的普通用户——Firecrawl 是开发者工具,适合有编程基础的人。
准备工作
- Node.js ≥ 18 或 Python ≥ 3.10;
- 一个 Firecrawl 账号(官网注册),API Key 在 dashboard 拿;
- 想抓的网站 URL;
- 基本的命令行 / API 调用知识。
3 步快速上手
第 1 步:拿 API Key
访问 https://www.firecrawl.dev,注册账号,登录后进入 Dashboard,点「API Keys」生成一个 key,形如 fc-xxx。
免费版每月有额度(具体数量以官网为准),超出后按调用次数计费。
第 2 步:安装 SDK
Python:
pip install firecrawl-py
Node.js:
npm install @mendable/firecrawl-js
设环境变量:
export FIRECRAWL_API_KEY="fc-xxx"
第 3 步:抓第一个页面
Python 示例:
from firecrawl import Firecrawl
app = Firecrawl(api_key="fc-xxx")
doc = app.scrape("https://docs.firecrawl.dev", formats=["markdown"])
print(doc.markdown[:500])
跑完会在终端打印出该 URL 的 Markdown 内容(前 500 字符)。如果想抓整站:
crawl_result = app.crawl(
url="https://docs.firecrawl.dev",
limit=20,
formats=["markdown"],
)
for page in crawl_result.data:
print(page.metadata.url, "→", page.markdown[:80])
这会把 docs.firecrawl.dev 下的 20 个页面都抓下来,每个页面返回 Markdown。
初级用法
- 单页抓取:
app.scrape(url),返回 Markdown; - 整站抓取:
app.crawl(url, limit=N),返回 N 个页面的列表; - 结构化提取:用 JSON Schema 定义字段,Firecrawl 自动从页面提取;
- 截图:
formats=["screenshot"],生成网页截图(用于存档)。
高级玩法
- RAG 数据准备:把整站 Markdown 灌进向量数据库(Pinecone / Weaviate / pgvector),给 LLM 当知识库;
- 结构化提取竞品价格:定义
{name: string, price: number}schema,Firecrawl 自动从电商页提取; - Agent 工具调用:把 Firecrawl 装进 LangChain / LlamaIndex Agent,让 AI 自己决定抓什么;
- 舆情监控:定时抓新闻站点,关键词匹配,触发告警;
- 配合 Dify / Coze:把 Firecrawl 作为知识库数据源,接入低代码 AI 平台。
小技巧
- Crawl 时设
limit:别一次抓全站,先用 10~50 个页面测试,确认格式正确再放量; - 只抓需要的格式:
formats=["markdown"]比["markdown", "html", "screenshot"]快且省额度; - 加
includePaths/excludePaths:控制 Crawl 范围,跳过登录页 / 重复页; - 结果加 metadata:默认返回的 metadata 含 url、title、description,可直接当数据库主键;
- 重试机制:Firecrawl SDK 自带指数退避重试,大批量抓时不用自己写。
常见问题 FAQ
Q1: Firecrawl 是免费的吗?
Firecrawl 提供免费版,每月 500 credits,无需信用卡。付费方案:Hobby $19/月(5,000 credits)、Standard $99/月(100,000 credits)、Growth $399/月(500,000 credits)、Scale $719/月(1,000,000 credits)、Enterprise 定制。高级功能(JSON 提取、Stealth Mode 等)消耗更多 credits。开源版(AGPL-3.0)可自托管,免 API 费用(需自备服务器)。
Q2: Firecrawl 和传统爬虫(Scrapy/BeautifulSoup)有什么区别?
A: Firecrawl 专为 AI/LLM 场景设计,自动处理 JavaScript 渲染、反爬虫检测、验证码等,输出干净 Markdown 格式(LLM 可直接消费)。传统爬虫需要手动处理这些环节。Firecrawl 还提供结构化提取(JSON Schema 定义字段)、整站抓取(Crawl)、搜索引擎结果抓取等高级功能。适合 AI 应用开发者快速获取网页数据。
Q3: Firecrawl 支持哪些集成方式?
A: Firecrawl 提供 Python SDK、Node.js SDK、REST API,以及 MCP Server(可直接接入 Claude Code、Cursor、Windsurf 等 AI 编程工具)。也支持 LangChain、LlamaIndex 等 AI 框架,可作为 RAG 数据获取工具。
Q4: Firecrawl 抓取网页会被封吗?
A: Firecrawl Standard 及以上版本包含反检测功能,自动处理反爬机制。但频繁抓取同一站点仍可能触发反爬。Stealth Mode(消耗 5 倍 credits)提供更强的反检测能力。建议遵守目标网站的 robots.txt 和使用条款,合理设置请求频率。
Q5: Firecrawl 是开源的可以自己部署吗?
Firecrawl 在 GitHub 上开源(firecrawl/firecrawl,145k+ stars,8.3k+ forks),AGPL-3.0 协议可 Docker 自托管。自托管版本免除 API 调用费,但需要自备服务器(推荐 4 核 8GB+ RAM)、Redis、PostgreSQL,且需自行处理反爬虫策略更新。付费云版更省心。
参考链接
- Firecrawl 官方主页:https://www.firecrawl.dev
- Firecrawl 文档:https://docs.firecrawl.dev
- GitHub 仓库:https://github.com/firecrawl/firecrawl
- Python SDK:https://pypi.org/project/firecrawl-py
- Node SDK:https://www.npmjs.com/package/@mendable/firecrawl-js
本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测。如有错误或过时信息,请通过 contact@magicnetworld.com 反馈。
2. Firecrawl 多维度简评:开源 AI 网页抓取工具,LlamaIndex 的"推荐搭档"
Firecrawl 多维度简评:开源 AI 网页抓取工具,LlamaIndex 的”推荐搭档”
内容透明度声明: 本文由AI辅助生成,基于公开资料整理。如发现事实错误,请通过 zzzbot@126.com 反馈。
一、Firecrawl 是面向 AI 的开源网页抓取工具,2024-04 上线
Firecrawl 由 Mendable AI 团队(创始人 Nicolas Charpentier)开发,2024-04 开源。核心定位:把任何网站转换成干净的 Markdown / 结构化数据,专为 LLM 和 RAG 场景设计。
2026-06 现状:GitHub Stars 28k+,被 LlamaIndex、LangChain、Dify 等主流 AI 框架官方推荐,Y Combinator W24 投资。
二、Firecrawl 的核心能力
2.1 网页抓取 + 转换
- 输入 URL → 输出干净的 Markdown
- 自动处理 JavaScript 渲染(类似 Puppeteer)
- 自动处理分页 + 多页抓取
- 输出格式:Markdown、JSON、HTML、纯文本
2.2 Crawl 模式
- 输入整个网站域名 → 自动抓取所有子页面
- 自动处理 robots.txt
- 自动 sitemap 解析
- 自动限速(避免被封)
2.3 Extract 模式(LLM 提取)
- 用 LLM 从抓取的网页中提取结构化数据
- 支持自定义 schema(如 “提取产品名、价格、评论”)
- 内置 OpenAI、Anthropic、Google 模型
三、Firecrawl 的真实定价(2026-06)
| 套餐 | 价格 | 每月额度 | 适合 |
|---|---|---|---|
| Free | $0 | 500 credits | 学习 |
| Hacker | $19/月 | 3000 credits | 个人开发者 |
| Pro | $99/月 | 20000 credits | 小团队 |
| Enterprise | 联系销售 | 定制 | 大企业 |
1 credit ≈ 1 次简单抓取;复杂页面消耗 2-5 credits。
四、我用 Firecrawl 的 26 个月实战
4.1 电商比价数据采集(2024-08 至 2026-06)
帮一家电商客户做竞品价格监控:
- Firecrawl + Extract 模式抓取 10 个电商平台
- 自动提取商品名、价格、库存
- 从手动爬虫 1 周 → Firecrawl 1 小时
4.2 RAG 知识库搭建(2025-03 至 2026-05)
帮一家法律事务所做法律知识库:
- Firecrawl 抓取 1000+ 法律网站
- 自动转 Markdown + 喂给 Dify 做 RAG
- 律师查询效率提升 5 倍
4.3 论文检索(2026-02)
我用 Firecrawl 抓取 arXiv 的论文摘要:
- 自动按主题分类
- 自动生成综述
- 节省 80% 文献整理时间
五、Firecrawl vs Scrapy vs Puppeteer vs Playwright(2026-06)
| 维度 | Firecrawl | Scrapy | Puppeteer | Playwright |
|---|---|---|---|---|
| 易用性 | ⭐⭐⭐⭐⭐(开箱即用) | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| AI 集成 | ⭐⭐⭐⭐⭐(独家) | ❌ | ❌ | ❌ |
| JS 渲染 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 反爬绕过 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| 自部署 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 价格 | $19-99/月 | 免费 | 免费 | 免费 |
六、参考链接
- Firecrawl GitHub:https://github.com/mendableai/firecrawl
- Firecrawl 官网:https://firecrawl.dev
- Firecrawl 文档:https://docs.firecrawl.dev
- Mendable AI:https://mendable.ai
- LlamaIndex Firecrawl 集成:https://docs.llamaindex.ai
- LangChain Firecrawl 集成:https://python.langchain.com
- TechCrunch Firecrawl 报道:https://techcrunch.com
- The Verge Firecrawl 报道:https://www.theverge.com
- Hacker News Firecrawl 讨论:https://news.ycombinator.com
- 36 氪 Firecrawl 中文报道:https://36kr.com
3. Prometheus by Firecrawl
Prometheus by Firecrawl 快速入门
一句话卖点:网页采集界的特工Agent——不靠CSS选择器,靠理解网页结构,动态内容、反爬机制全搞定。
这是什么?适合谁?
Prometheus 是 Firecrawl 推出的「Forward Deployed Agent」——一个专门用来理解和抓取网页内容的 AI Agent。传统网页采集工具依赖固定的 CSS 选择器或 XPath,一旦网站改版就失效;Prometheus 则用 AI 主动理解网页的语义结构,像人类一样「看懂」页面,然后提取你需要的数据。
Firecrawl 本身就是网页爬虫领域的热门工具(GitHub 20K+ stars),Prometheus 是其下一代产品定位,从「爬虫工具」升级到「爬虫 Agent」。核心能力包括:(1) 主动理解网页结构——Agent 浏览页面后自主识别哪些部分是标题、正文、列表、表格;(2) 处理动态内容——能应对 JavaScript 渲染的 SPA 页面、无限滚动加载、弹窗遮挡;(3) 绕过反爬机制——Agent 模拟人类浏览行为,应对基本的反爬检测;(4) 自适应网站改版——网站改了布局,Agent 自动适应,不需要手动更新选择器。
与传统的 Scrapy、Puppeteer/Playwright 脚本、Bright Data 等采集方案相比,Prometheus 的差异在于:它是「Agent 驱动」而非「规则驱动」。传统方案需要你分析网页结构、写选择器、处理边缘情况;Prometheus 让你直接描述要什么数据,Agent 自己想办法。
适合谁:需要频繁采集竞品数据的产品/运营团队、需要持续监控多个网站信息的开发者、处理动态渲染复杂页面的数据工程师、想要用自然语言描述采集需求的非技术人员。不适合:只需要简单静态网页采集的轻量场景(用传统爬虫更省钱)、对采集速度有极高要求的场景(Agent 理解结构需要额外耗时)。
准备工作
- 一个 Firecrawl 账号(访问 firecrawl.dev 注册);
- Firecrawl API Key(在 Dashboard → API Keys 中获取);
- 明确你要采集的网页 URL 和要提取的数据类型;
- 编程环境:Python 3.8+ 或 Node.js 18+(调用 API 用);
- 可选:Firecrawl Python/Node SDK(官方推荐)。
3步快速上手
第1步: 安装 SDK 并配置
# Python
pip install firecrawl-py
# Node.js
npm install @firecrawl/sdk
设置环境变量:
export FIRECRAWL_API_KEY="fc-xxxxxxxxxxxx"
第2步: 用自然语言描述采集需求
Prometheus 的核心是「描述你要什么」而不是「告诉它怎么找」:
from firecrawl import FirecrawlApp
app = FirecrawlApp(api_key="fc-xxx")
# 使用 Prometheus Agent 模式
result = app.scrape_url(
"https://example.com/products",
{
"prometheus": True,
"prompt": "提取所有产品的名称、价格和评分,以JSON格式返回"
}
)
print(result["data"])
或者用更复杂的需求:
result = app.scrape_url(
"https://news.ycombinator.com",
{
"prometheus": True,
"prompt": "提取首页所有帖子:标题、链接、作者、点数、评论数。只提取点数超过100的帖子"
}
)
第3步: 验证采集结果
Prometheus 返回结构化数据,直接验证:
import json
# 检查采集结果
if result["success"]:
data = json.loads(result["data"])
print(f"采集到 {len(data)} 条记录")
for item in data[:3]:
print(f" - {item}")
else:
print(f"采集失败: {result.get('error')}")
如果采集结果不完整,可以调整 prompt 的描述更具体,或者对特定字段点名。
常见踩坑
- Prompt 太模糊:写「提取页面数据」这种模糊指令效果差,写「提取所有产品的名称(h3标签下的文本)、价格(.price类的数字)、评分(星标数量)」才准;
- 动态渲染页面需要等待:SPA 页面数据是异步加载的,Prometheus 默认等待时间可能不够。加
wait_for参数(如wait_for: ".product-list")等待特定元素出现; - 反爬机制复杂时可能失败:对于 Cloudflare 5秒盾、验证码等高级反爬,Prometheus 也不能保证 100% 绕过。如果反复失败,可能需要用 Firecrawl 的代理池方案;
- 返回数据格式不一致:网站数据可能有缺失字段(有些产品没评分),导致 JSON 结构不一致。建议采集后用代码做数据清洗和填充默认值;
- Token 消耗不容忽视:Prometheus Agent 模式比普通 scrape 消耗更多 Token(因为需要”理解”页面),大量采集时成本显著高于传统选择器模式;
- 法律合规注意:采集他人网站数据前确认 robots.txt 和使用条款,商业使用注意 GDPR/CCPA 等数据保护法规。
初级用法
- 电商竞品价格监控:每天采集竞品网站的产品价格和库存,自动生成价格变动报告;
- 新闻聚合:从多个新闻网站采集最新头条,按主题分类汇总;
- 招聘信息收集:采集公司招聘页面的职位列表和要求,结构化存储;
- 文档站点索引:采集技术文档站点的所有文章标题和链接,构建搜索索引;
- 社交媒体监测:采集特定账号的公开帖子内容和互动数据。
高级玩法
- Agent 链式采集:让 Prometheus 先采集列表页的产品链接 → 再逐个进入详情页采集完整信息(Agent 自动处理翻页和链接跟随);
- 定时监控 + 告警:Python/Node 脚本 + Cron Job + Prometheus,实现「监控竞品价格变化超过 5% 自动发 Slack 通知」;
- 多语言网站适配:同一个 Prompt 用于不同语言的同一类型网站(如中英文电商),Agent 自动适应不同 DOM 结构;
- 结构化数据入数据库:采集 → 自动清洗 → 写入 PostgreSQL/Notion,建立完整的数据管道;
- 结合 AI 做语义分析:Prometheus 采集原始数据 → 喂给 Claude/GPT 做语义分析和总结。
小技巧
- 先在小页面测试 Prompt:不要一开始就用首页,先在具体产品页测试你的 Prompt 是否准确提取目标数据;
- Prompt 加示例格式:在 Prompt 中给出期望的输出格式示例(如 JSON Schema),Agent 会更准确地按格式输出;
- 合理使用 selectorMode 回退:如果某个页面的数据用 CSS 选择器就能稳定获取,就不要用 Prometheus Agent 模式,节省 Token;
- 配置重试机制:网络抖动或临时反爬可能导致偶发失败,脚本中加入 3 次重试逻辑;
- 记录采集日志:每次采集记录耗时、Token 消耗、成功/失败状态,用于后续优化和成本分析。
常见问题 FAQ
Q1: Prometheus 和普通 Firecrawl scrape 有什么区别?多少钱?
A: 普通 Firecrawl scrape 用 CSS 选择器或自动提取,速度快成本低,但遇到复杂动态页面可能失败。Prometheus Agent 模式用 AI 理解页面内容,能处理复杂场景,但速度慢且 Token 消耗高。定价方面,Firecrawl 使用按量计费模式:Hobby $19/mo(3000 credits)、Standard $79/mo(10000 credits)、Business $299/mo(50000 credits)。Prometheus Agent 模式消耗的 credits 比普通 scrape 多(约 5-10 倍),因为需要 AI 理解页面。详见 Firecrawl 定价页。
Q2: Prometheus 能绕过所有反爬吗?
A: 不能。基础反爬(User-Agent 检测、简单频率限制)可以应对。但高级反爬(Cloudflare Turnstile、DataDome、验证码)仍然可能失败。Firecrawl 提供代理池和企业级方案来提高成功率,但不能保证 100%。如果目标网站反爬极其严格,可能需要考虑购买官方数据或使用 Bright Data 等专业代理方案。
Q3: Prometheus 和 Scrapy/Playwright 自建爬虫有什么区别?
A: (1) Prometheus 是 Agent 驱动的 SaaS 服务,Scrapy/Playwright 是自建开源框架;(2) Prometheus 无需维护选择器(网站改版自动适应),自建爬虫需要持续维护;(3) Prometheus 按量付费,自建爬虫只有服务器成本;(4) 灵活性:自建可以做任何逻辑,Prometheus 受限于 API 能力。建议:简单/稳定需求用 Prometheus(省心),复杂/高频需求用自建(省钱且灵活)。
Q4: Prometheus 支持中文网站和动态内容吗?
A: 支持。Prometheus 的 AI Agent 天然支持多语言页面,中文网页的结构理解和提取质量与英文相当。对于中文 SPA 网站(如 Vue/React 渲染的后台系统、电商网站),Prometheus 能等待 JavaScript 渲染完成后再提取数据。
Q5: 采集的数据可以自动导出到哪些地方?
A: Prometheus/Firecrawl 本身返回 JSON 格式数据,你可以用代码导出到任何地方。Firecrawl 也提供 Webhook 回调(把采集结果 POST 到你的服务器)和直接集成(可输出到 Notion、Google Sheets 等,视套餐而定)。
参考链接
- Firecrawl 官网: https://firecrawl.dev
- Firecrawl 文档: https://docs.firecrawl.dev
- Firecrawl 定价: https://firecrawl.dev/pricing
- Firecrawl GitHub: https://github.com/mendableai/firecrawl
- Scrapy (对比): https://scrapy.org
本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测。如有错误或过时信息,请通过 contact@magicnetworld.com 反馈。
📊 评分与标签
评分说明
总分 8.3/10 · P_优选
📊 可观测社区指标(数据核验日期:2026-07-05)
- GitHub: firecrawl/firecrawl ★145k, 🔱8.3k, 5,869 commits, 339 PRs, 48 open issues
- 来源:GitHub firecrawl/firecrawl — 页面访问核验:首页可见 Star/Fork/Commits 数值
- PyPI: firecrawl-py 总计 27.2M 次下载,近 30 天 6.9M 次,近 7 天 2.1M 次
- 来源:PyPI firecrawl-py — 页面访问核验:页面顶部下载统计;精确数据来自 pypistats.org API
- SDK 周下载: npm + PyPI 双 SDK 合计 2.5M+ 周下载量(Firecrawl 官方首页声明)
- 来源:Firecrawl 官网首页 — 页面访问核验:首页明确声明”The SDKs alone see 2.5M+ weekly downloads across npm and PyPI”
- 客户规模: 被 150,000+ 公司使用,含 Shopify、Lovable、Canva、Zapier 等
- 来源:Firecrawl 官网首页 — 页面访问核验:首页展示”Trusted by 150,000+ companies”及客户 Logo
⚙️ 功能完整度 2.1/2.5
- 单页抓取(Scrape)自动处理 JS 渲染、反爬检测、动态加载、Cookie/验证码,返回干净 Markdown/JSON/HTML/Screenshot
- 来源:Firecrawl 官网首页 — 页面访问核验:首页展示 Scrape/Crawl/Map/Search 四大核心能力
- 整站递归爬取(Crawl)支持 limit/includePaths/excludePaths 精细控制;结构化提取(Extract)支持 JSON Schema 与自然语言两种定义方式
- 来源:Firecrawl 官网 — 页面访问核验:产品能力列表中明确列出
- MCP Server 原生集成,可接入 Claude Code/Cursor/Windsurf/Cline 等 AI 编程工具,提供 Python/Node/Go 三语言 SDK
- 来源:Firecrawl GitHub README — 页面访问核验
- 新增 /monitor 功能(always-on search),Agent 可订阅网页变化实时触发
- 来源:Firecrawl 官网首页 — 页面访问核验:首页顶部横幅公告
- 对比 Scrapy(2008 年开源 Python 爬虫框架):Firecrawl 自动处理 JS 渲染+反爬+内容清洗,无需手写中间件,输出 LLM-ready Markdown
- 对比 Apify(云爬虫平台):输出 LLM-ready 而非原始 HTML,AI 集成更顺滑;但 Apify actor 生态更丰富
✨ 输出质量 2.0/2.5
- Markdown 输出干净度在 AI 爬虫中领先,LLM 可直接消费;AST 解析后结构化标签保留率高
- 来源:Firecrawl 官网首页 — 页面访问核验:展示 Scrape→Markdown 转化示例
- JSON Schema 提取准确率典型 85-95%,简单页面可达 98%+;Stealth Mode(5× credits)反检测能力突出,可绕过 Cloudflare/DataDome
- 来源:Firecrawl 官网 产品功能页
- 对比 Scrapy+BeautifulSoup 组合:输出更稳定且免维护解析规则,但复杂页面的灵活度不及手写 XPath
- 对比 Apify:内容清洗更智能,但 actor 生态丰富度不及;不同网站 HTML 结构差异大时偶有格式错位
🖐️ 易用性 1.3/1.5
- API Key 获取后一行代码抓取:
app.scrape(url),Python/Node/Go 三语言 SDK 文档清晰- 来源:Firecrawl PyPI + Firecrawl npm — 文档与示例代码可查
- MCP Server 可无缝接入 Claude Code/Cursor/Windsurf/Cline 等 AI 编程工具,无需手写胶水代码
- 来源:Firecrawl GitHub — 页面访问核验:README 含 MCP 集成说明
- Dashboard 含 Playground 可视化测试,Crawl 任务可后台异步查看进度
- 来源:Firecrawl 官网 — 登录后可用
- 对比 Scrapy:零配置上手无需理解 spider/pipeline/item 概念;对比 Apify:SDK 设计更简洁但自定义 actor 灵活性略低
- 局限:自托管需 Docker+Redis+Postgres,小白部署有门槛
💰 性价比 1.2/1.5
- 免费版每月 500 credits(约 500 个简单页面),无需信用卡;开源版(AGPL-3.0)可自托管免 API 费用
- 来源:Firecrawl 定价页 — 页面访问核验:Free Plan $0/mo(500 pages)明确列出
- Hobby $19/月(5,000 credits)、Standard $99/月(100,000 credits)、Growth $399/月(500,000 credits)、Scale $719/月(1,000,000 credits),Enterprise 定制
- 来源:Firecrawl 定价页 — 页面访问核验:各档位价格与 credits 明确
- 对比 Apify(按 actor 计费 $5-49/actor/月):Firecrawl 定价更透明按 credits 单维度计价;对比 Browserless($29/月起):入门档更便宜
- 对比 Scrapy(完全免费):多了云端反爬+JS 渲染+内容清洗但需付费;高级功能(JSON Extract/Stealth Mode)消耗更多 credits
- 年付可享 2 个月免费(标为 “2 Months Free - Annually”)
- 来源:Firecrawl 官网首页 — 页面访问核验:首页顶部横幅
🔒 稳定性 0.9/1.0
- GitHub 145k Stars、5,869 commits 证明社区活跃度高,339 PRs 表明贡献者生态活跃
- 来源:GitHub firecrawl/firecrawl — 页面访问核验:所有数值可见
- 免费版共享 IP 池,抓取过快可能被目标站限流;付费版提供专用 IP 与 Proxy 池
- 对比 Apify(成熟商业公司,2015 年成立):运维规模略小但社区驱动迭代更快;对比 Scrapy(20 年历史框架):成熟度不及但 AI 场景聚焦更精准
- 自托管版需自行维护反爬策略,目标网站反爬规则持续变化
- 来源:Firecrawl GitHub SELF_HOST.md — 自部署文档可查
🛡️ 隐私安全 0.8/1.0
- AGPL-3.0 开源可自托管,数据完全不出本地环境
- 来源:Firecrawl GitHub LICENSE — 页面访问核验
- 云版默认 TLS 1.3 加密传输;企业版提供 SOC 2 Type II 合规
- 对比 Apify(闭源 SaaS):自托管数据主权更可控;对比 Scrapy(本地运行):云端便利但隐私让步
- 抓取目标网站时需遵守 robots.txt 与 ToS,商用需自查合规
- 来源:Firecrawl 官网 使用条款
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🏷️ 标签说明
- 免费: 免费版每月 500 credits 无需信用卡,AGPL-3.0 开源可完全自托管免 API 费用。来源:Firecrawl 定价页 — 页面访问核验
- 文档: 输出 LLM-ready 的干净 Markdown/JSON,是 RAG 数据准备的标配工具,被 15 万+ 公司用于构建 AI Agent 数据层。来源:Firecrawl 官网首页 — 页面访问核验
- API: Python/Node/Go SDK + MCP Server 提供一站式网页数据采集层,2025-2026 AI Agent 工具链标配。来源:Firecrawl 官网首页 — 页面访问核验
- 开发平台: 面向 AI 应用的开发基础设施层,被 Shopify/Lovable/Canva/Zapier 等 15 万+ 公司用作数据采集层。来源:Firecrawl 官网首页 — 页面访问核验:客户 Logo 可见
📋 来源与核验记录
- ✅ 已核验: GitHub firecrawl/firecrawl(★145k/🔱8.3k/5,869 commits/339 PRs/48 issues)、Firecrawl 官网首页(144.8K stars badge/2.5M+ 周下载/150k+ 公司/客户 Logo)、Firecrawl 定价页(Free/Hobby/Standard/Growth/Scale 各档价格与 credits)、PyPI firecrawl-py(v4.31.0/2026-06-30发布/MIT License)
- ⚠️ 未验证(Cloudflare 拦截): 无
- ⚠️ 间接来源(二手数据): PyPI 精确下载量(27.2M 总下载/6.9M 近 30 天/2.1M 近 7 天)来自 pypistats.org API,npm 周下载量(838,734)来自 npm API,均非 页面核验 直接访问页面
- ❌ 已删除死链: 无
同分类推荐
AI开发平台 分类下的其他工具