vLLM 源码学习
高吞吐 LLM 推理与 serving:PagedAttention、调度与 API 服务。这不是 API 速查表,而是一条可以重复走的源码路线:每天用 30 分钟,从一个真实相对路径出发,先用类比建立直觉,再把它接回整条运行链路。
开篇 · 这是个什么项目
vLLM 可以先想成一间高吞吐推理引擎房。它的代码不是一堆孤立文件:入口接到需求,核心对象做判断,工具或模型完成工作,状态把结果交给下一个环节。
架构全景(动起来看)
发光扫过的每一层都是一次任务可能经过的站点。不同仓库命名不同,但「接入 → 编排 → 核心能力 → 资源」的责任边界很相似。
怎么使用这份教程
每天 30 分钟
6 讲,每讲先问问题,再给本质和大白话。
真实相对路径
所有路径都从项目根目录算,不把你的机器路径写进源码引用。
先验证再推理
每页都有可复制 bash 命令;文件版本变化时以本地实际内容为准。
可迁移方法
学会从入口、数据结构、循环和扩展点读任何 AI 项目。
从 README.md 认识项目大门
README.md:围绕 README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
配置与依赖:pyproject.toml
pyproject.toml:围绕 pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
顶层入口与启动路径
tools:围绕 tools 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
核心对象:cli.rs
rust/src/managed-engine/src/cli.rs:围绕 rust/src/managed-engine/src/cli.rs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
运转循环里的 main.rs
rust/src/mock-engine/src/main.rs:围绕 rust/src/mock-engine/src/main.rs 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
协作主线穿过 index.py
vllm/model_executor/layers/fla/ops/index.py:围绕 vllm/model_executor/layers/fla/ops/index.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
能力模块:plugin
examples/pooling/plugin:围绕 examples/pooling/plugin 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
业务动作落在 prithvi_geospatial_mae_io_processor.py
examples/pooling/plugin/prithvi_geospatial_mae_io_processor.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_io_processor.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
把任务交给 prithvi_geospatial_mae_offline.py
examples/pooling/plugin/prithvi_geospatial_mae_offline.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_offline.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
扩展点附近的 prithvi_geospatial_mae_online.py
examples/pooling/plugin/prithvi_geospatial_mae_online.py:围绕 examples/pooling/plugin/prithvi_geospatial_mae_online.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
状态如何进入 server.py
vllm/v1/kv_offload/tiering/p2p/session/server.py:围绕 vllm/v1/kv_offload/tiering/p2p/session/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
消息与协作:test_bitsandbytes.py
tests/models/quantization/test_bitsandbytes.py:围绕 tests/models/quantization/test_bitsandbytes.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
持久化视角下的 test_per_token_kv_cache.py
tests/models/quantization/test_per_token_kv_cache.py:围绕 tests/models/quantization/test_per_token_kv_cache.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
模型侧连接:server.py
examples/applications/api_server/server.py:围绕 examples/applications/api_server/server.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
工具/MCP 桥:main.py
vllm/entrypoints/cli/main.py:围绕 vllm/entrypoints/cli/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
检索与知识:config.py
vllm/model_executor/models/config.py:围绕 vllm/model_executor/models/config.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
集成层:rag
examples/applications/rag:围绕 examples/applications/rag 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
样例与复盘:pyproject.toml
examples/features/structured_outputs/pyproject.toml:围绕 examples/features/structured_outputs/pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
测试与边界:retrieval_augmented_generation_with_langchain.py
examples/applications/rag/retrieval_augmented_generation_with_langchain.py:围绕 examples/applications/rag/retrieval_augmented_generation_with_langchain.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
收官:沿 retrieval_augmented_generation_with_llamaindex.py 串回全图
examples/applications/rag/retrieval_augmented_generation_with_llamaindex.py:围绕 examples/applications/rag/retrieval_augmented_generation_with_llamaindex.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。