Crawl4AI 源码学习
为 LLM/Agent 设计的开源爬虫与网页清洗流水线。这不是 API 速查表,而是一条可以重复走的源码路线:每天用 30 分钟,从一个真实相对路径出发,先用类比建立直觉,再把它接回整条运行链路。
开篇 · 这是个什么项目
Crawl4AI 可以先想成一间LLM 友好的爬虫车间。它的代码不是一堆孤立文件:入口接到需求,核心对象做判断,工具或模型完成工作,状态把结果交给下一个环节。
架构全景(动起来看)
发光扫过的每一层都是一次任务可能经过的站点。不同仓库命名不同,但「接入 → 编排 → 核心能力 → 资源」的责任边界很相似。
怎么使用这份教程
每天 30 分钟
6 讲,每讲先问问题,再给本质和大白话。
真实相对路径
所有路径都从项目根目录算,不把你的机器路径写进源码引用。
先验证再推理
每页都有可复制 bash 命令;文件版本变化时以本地实际内容为准。
可迁移方法
学会从入口、数据结构、循环和扩展点读任何 AI 项目。
从 README.md 认识项目大门
README.md:围绕 README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
配置与依赖:pyproject.toml
pyproject.toml:围绕 pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
顶层入口与启动路径
docs/examples/website-to-api/app.py:围绕 docs/examples/website-to-api/app.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
核心对象:server.py
docs/examples/c4a_script/tutorial/server.py:围绕 docs/examples/c4a_script/tutorial/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
运转循环里的 app.js
docs/examples/c4a_script/tutorial/playground/app.js:围绕 docs/examples/c4a_script/tutorial/playground/app.js 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
协作主线穿过 cli.py
crawl4ai/cli.py:围绕 crawl4ai/cli.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
能力模块:browser
tests/browser:围绕 tests/browser 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
业务动作落在 test_browser_context_id.py
tests/browser/test_browser_context_id.py:围绕 tests/browser/test_browser_context_id.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
把任务交给 test_browser_manager.py
tests/browser/test_browser_manager.py:围绕 tests/browser/test_browser_manager.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
扩展点附近的 test_browser_manager_close.py
tests/browser/test_browser_manager_close.py:围绕 tests/browser/test_browser_manager_close.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
状态如何进入 memory
tests/memory:围绕 tests/memory 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
消息与协作:README.md
tests/memory/README.md:围绕 tests/memory/README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
持久化视角下的 cap_test.py
tests/memory/cap_test.py:围绕 tests/memory/cap_test.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
模型侧连接:server.py
docs/md_v2/apps/c4a-script/server.py:围绕 docs/md_v2/apps/c4a-script/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
工具/MCP 桥:server.py
docs/md_v2/marketplace/backend/server.py:围绕 docs/md_v2/marketplace/backend/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
检索与知识:mcp
tests/mcp:围绕 tests/mcp 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
集成层:test_mcp_socket.py
tests/mcp/test_mcp_socket.py:围绕 tests/mcp/test_mcp_socket.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
样例与复盘:test_mcp_sse.py
tests/mcp/test_mcp_sse.py:围绕 tests/mcp/test_mcp_sse.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
测试与边界:test_crawler_monitor.py
tests/memory/test_crawler_monitor.py:围绕 tests/memory/test_crawler_monitor.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
收官:沿 test_dispatcher_stress.py 串回全图
tests/memory/test_dispatcher_stress.py:围绕 tests/memory/test_dispatcher_stress.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。