Firecrawl 源码学习
把网页搜索、抓取与结构化抽取得变成 Agent 可用的 API。这不是 API 速查表,而是一条可以重复走的源码路线:每天用 30 分钟,从一个真实相对路径出发,先用类比建立直觉,再把它接回整条运行链路。
开篇 · 这是个什么项目
Firecrawl 可以先想成一间网页采集团队。它的代码不是一堆孤立文件:入口接到需求,核心对象做判断,工具或模型完成工作,状态把结果交给下一个环节。
架构全景(动起来看)
发光扫过的每一层都是一次任务可能经过的站点。不同仓库命名不同,但「接入 → 编排 → 核心能力 → 资源」的责任边界很相似。
怎么使用这份教程
每天 30 分钟
6 讲,每讲先问问题,再给本质和大白话。
真实相对路径
所有路径都从项目根目录算,不把你的机器路径写进源码引用。
先验证再推理
每页都有可复制 bash 命令;文件版本变化时以本地实际内容为准。
可迁移方法
学会从入口、数据结构、循环和扩展点读任何 AI 项目。
从 README.md 认识项目大门
README.md:围绕 README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
配置与依赖:apps
apps:围绕 apps 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
顶层入口与启动路径
apps/api/src/db/schema/index.ts:围绕 apps/api/src/db/schema/index.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
核心对象:index.ts
apps/api/src/scraper/scrapeURL/engines/index.ts:围绕 apps/api/src/scraper/scrapeURL/engines/index.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
运转循环里的 cli.py
examples/gemini-2.5-screenshot-editor/cli.py:围绕 examples/gemini-2.5-screenshot-editor/cli.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
协作主线穿过 main.py
examples/openai_swarm_firecrawl/main.py:围绕 examples/openai_swarm_firecrawl/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
能力模块:anchor.ts
apps/api/src/lib/deterministicJson/pipeline/anchor.ts:围绕 apps/api/src/lib/deterministicJson/pipeline/anchor.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
业务动作落在 generate.ts
apps/api/src/lib/deterministicJson/pipeline/generate.ts:围绕 apps/api/src/lib/deterministicJson/pipeline/generate.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
把任务交给 postprocess.ts
apps/api/src/lib/deterministicJson/pipeline/postprocess.ts:围绕 apps/api/src/lib/deterministicJson/pipeline/postprocess.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
扩展点附近的 validate.ts
apps/api/src/lib/deterministicJson/pipeline/validate.ts:围绕 apps/api/src/lib/deterministicJson/pipeline/validate.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
状态如何进入 index.ts
apps/api/src/services/worker/nuq-fdb/index.ts:围绕 apps/api/src/services/worker/nuq-fdb/index.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
消息与协作:index-db.ts
apps/api/src/db/schema/index-db.ts:围绕 apps/api/src/db/schema/index-db.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
持久化视角下的 ledger.ts
apps/api/src/db/schema/ledger.ts:围绕 apps/api/src/db/schema/ledger.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
模型侧连接:Models
apps/dot-net-sdk/Firecrawl/Models:围绕 apps/dot-net-sdk/Firecrawl/Models 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
工具/MCP 桥:ApiResponse.cs
apps/dot-net-sdk/Firecrawl/Models/ApiResponse.cs:围绕 apps/dot-net-sdk/Firecrawl/Models/ApiResponse.cs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
检索与知识:BatchScrapeJob.cs
apps/dot-net-sdk/Firecrawl/Models/BatchScrapeJob.cs:围绕 apps/dot-net-sdk/Firecrawl/Models/BatchScrapeJob.cs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
集成层:BatchScrapeOptions.cs
apps/dot-net-sdk/Firecrawl/Models/BatchScrapeOptions.cs:围绕 apps/dot-net-sdk/Firecrawl/Models/BatchScrapeOptions.cs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
样例与复盘:main.py
examples/openai_swarm_firecrawl_web_extractor/main.py:围绕 examples/openai_swarm_firecrawl_web_extractor/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
测试与边界:app.py
examples/sales_web_crawler/app.py:围绕 examples/sales_web_crawler/app.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
收官:沿 index.ts 串回全图
examples/scrape_and_analyze_airbnb_data_e2b/index.ts:围绕 examples/scrape_and_analyze_airbnb_data_e2b/index.ts 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。