源码深度学习 · 零基础友好 · 20 天

vLLM 源码学习

高吞吐 LLM 推理与 serving:PagedAttention、调度与 API 服务。这不是 API 速查表,而是一条可以重复走的源码路线:每天用 30 分钟,从一个真实相对路径出发,先用类比建立直觉,再把它接回整条运行链路。

00

开篇 · 这是个什么项目

vLLM 可以先想成一间高吞吐推理引擎房。它的代码不是一堆孤立文件:入口接到需求,核心对象做判断,工具或模型完成工作,状态把结果交给下一个环节。

💡 20 天的主线先找入口和地图,再跟一次真实任务穿过核心循环;随后研究状态、模型、工具与扩展;最后用复盘把全部概念连成一张可迁移的地图。不要背目录名,要不断问「谁创建它、它把什么交给谁」。
大白话读源码像参观工厂:第一天先看门牌和楼层,不急着拆机器。后面每节课只打开一个焦点路径,但始终知道它属于哪层、服务哪个业务动作。
01

架构全景(动起来看)

发光扫过的每一层都是一次任务可能经过的站点。不同仓库命名不同,但「接入 → 编排 → 核心能力 → 资源」的责任边界很相似。

L5 · 接入层
README.md本层职责
cli.rs本层职责
main.rs本层职责
server.py本层职责
L4 · 编排层
index.py本层职责
config.py本层职责
L3 · 能力层
tools本层职责
plugin本层职责
prithvi_geospatial_mae_io_processor.py本层职责
prithvi_geospatial_mae_offline.py本层职责
L2 · 状态层
模块本层职责
L1 · 扩展层
pyproject.toml本层职责
server.py本层职责
test_bitsandbytes.py本层职责
test_per_token_kv_cache.py本层职责
输入用户任务组织对象 / 流程执行模型 / 工具沉淀状态 / 记忆
设计取舍分层会增加跳转文件的次数,却让每层只承担一种职责:入口容易替换,核心逻辑能测试,模型与外部工具可插拔。读代码时先沿箭头追「数据」而不是追每一个类。
02

怎么使用这份教程

⏱️

每天 30 分钟

6 讲,每讲先问问题,再给本质和大白话。

📍

真实相对路径

所有路径都从项目根目录算,不把你的机器路径写进源码引用。

🧪

先验证再推理

每页都有可复制 bash 命令;文件版本变化时以本地实际内容为准。

🧭

可迁移方法

学会从入口、数据结构、循环和扩展点读任何 AI 项目。

S1

阶段 1 · 入口与地图

D01-D03 · 先认清入口、配置与顶层分工
01

从 README.md 认识项目大门

README.md:围绕 README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。

≈30 min · 6 讲开始学 →
02

配置与依赖:pyproject.toml

pyproject.toml:围绕 pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。

≈30 min · 6 讲开始学 →
03

顶层入口与启动路径

tools:围绕 tools 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。

≈30 min · 6 讲开始学 →
S2

阶段 2 · 核心循环

D04-D06 · 抓住对象怎样接力工作的主线
04

核心对象:cli.rs

rust/src/managed-engine/src/cli.rs:围绕 rust/src/managed-engine/src/cli.rs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。

≈30 min · 6 讲开始学 →
05

运转循环里的 main.rs

rust/src/mock-engine/src/main.rs:围绕 rust/src/mock-engine/src/main.rs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。

≈30 min · 6 讲开始学 →
06

协作主线穿过 index.py

vllm/model_executor/layers/fla/ops/index.py:围绕 vllm/model_executor/layers/fla/ops/index.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。

≈30 min · 6 讲开始学 →
S3

阶段 3 · 核心能力

D07-D10 · 沿业务闭环进入关键模块
07

能力模块:plugin

examples/pooling/plugin:围绕 examples/pooling/plugin 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。

≈30 min · 6 讲开始学 →
08

业务动作落在 prithvi_geospatial_mae_io_processor.py

examples/pooling/plugin/prithvi_geospatial_mae_io_processor.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_io_processor.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。

≈30 min · 6 讲开始学 →
09

把任务交给 prithvi_geospatial_mae_offline.py

examples/pooling/plugin/prithvi_geospatial_mae_offline.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_offline.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。

≈30 min · 6 讲开始学 →
10

扩展点附近的 prithvi_geospatial_mae_online.py

examples/pooling/plugin/prithvi_geospatial_mae_online.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_online.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。

≈30 min · 6 讲开始学 →
S4

阶段 4 · 状态与协作

D11-D13 · 理解消息、状态、存储如何流动
11

状态如何进入 server.py

vllm/v1/kv_offload/tiering/p2p/session/server.py:围绕 vllm/v1/kv_offload/tiering/p2p/session/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。

≈30 min · 6 讲开始学 →
12

消息与协作:test_bitsandbytes.py

tests/models/quantization/test_bitsandbytes.py:围绕 tests/models/quantization/test_bitsandbytes.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。

≈30 min · 6 讲开始学 →
13

持久化视角下的 test_per_token_kv_cache.py

tests/models/quantization/test_per_token_kv_cache.py:围绕 tests/models/quantization/test_per_token_kv_cache.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。

≈30 min · 6 讲开始学 →
S5

阶段 5 · 模型与扩展

D14-D17 · 连接模型、工具、记忆与 RAG
14

模型侧连接:server.py

examples/applications/api_server/server.py:围绕 examples/applications/api_server/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。

≈30 min · 6 讲开始学 →
15

工具/MCP 桥:main.py

vllm/entrypoints/cli/main.py:围绕 vllm/entrypoints/cli/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。

≈30 min · 6 讲开始学 →
16

检索与知识:config.py

vllm/model_executor/models/config.py:围绕 vllm/model_executor/models/config.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。

≈30 min · 6 讲开始学 →
17

集成层:rag

examples/applications/rag:围绕 examples/applications/rag 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。

≈30 min · 6 讲开始学 →
S6

阶段 6 · 复盘与扩展

D18-D20 · 把能力串成可演进的工程
18

样例与复盘:pyproject.toml

examples/features/structured_outputs/pyproject.toml:围绕 examples/features/structured_outputs/pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。

≈30 min · 6 讲开始学 →
19

测试与边界:retrieval_augmented_generation_with_langchain.py

examples/applications/rag/retrieval_augmented_generation_with_langchain.py:围绕 examples/applications/rag/retrieval_augmented_generation_with_langchain.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。

≈30 min · 6 讲开始学 →
20

收官:沿 retrieval_augmented_generation_with_llamaindex.py 串回全图

examples/applications/rag/retrieval_augmented_generation_with_llamaindex.py:围绕 examples/applications/rag/retrieval_augmented_generation_with_llamaindex.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。

≈30 min · 6 讲开始学 →