Day 01 / 共 20 天 · 第 1 周 核心概念
项目全景:从自主智能体到平台
第一天建立全局认知:AutoGPT 的起源、为什么从"自主循环智能体"转型为"可视化构建平台"、经典与平台的区别、Block+Graph 核心心智。今天不碰源码,先拿到一张"课程地图"——后面 19 天每天都落在这张图的某一格上。
📍 你在整门课的位置(这条链贯穿全部 20 天,每天开头都会点亮你所在的格子)
W1 核心概念(全景/Block/Graph)→
W2 Block 深入(基类/凭证/成本/SDK)→
W3 执行引擎(Manager/拓扑/调度/WS)→
W4 平台化(计费/OAuth/API/经典)
💡 今天的类比世界观:一座"AI 工厂"(贯穿全天)
把 AutoGPT Platform 想成一座工厂,今天每一讲都用它来理解:Block = 工位上的一台设备(读网页机、总结机、发信机,各干一件事);Graph = 把设备用传送带串起来的流水线,连好就是一个能自动干活的智能体;数据 = 在传送带上流动的半成品,每过一个工位被加工一次。别急着抠代码,先记住"工厂/流水线/传送带"这套画面。
👶 小白:一张"图"凭什么就能叫"智能体"?它看起来只是几个方块连线。
👨🏫 老师:关键在于图里嵌了会"思考"的设备——比如"LLM 块"。传送带负责把料稳稳送到每台设备,而 LLM 块会读输入、动脑子、给出结果。确定性的流水线(可控)+ 局部会思考的设备(智能)= 既聪明又不放飞的智能体。这正是平台相对经典 AutoGPT 的进步:不是让一个人瞎跑,而是把"智能"装进固定工位里。
L01
一夜爆红的起源
🤔 痛点:为什么"你问一句、AI 答一句"还不够?
假设你要做"市场调研":得先想搜什么关键词、逐条打开网页读、记笔记、归纳、再决定下一步查什么……ChatGPT 只能回答你当前这一问,每一步都要你亲自喂它、催它。能不能给它一个目标,让它自己一步步干到完?
💡 本质:AutoGPT = 让 AI 自己给自己下命令的"循环"
普通对话是"人 → AI → 人 → AI"的单步问答;AutoGPT 把它变成"目标 → AI 思考下一步 → 执行 → 看结果 → 再思考……"的自主循环。这就是"自主智能体(autonomous agent)"的雏形,也是本课后面 Block+Graph 的思想源头。
AutoGPT 于 2023 年发布,是引爆"自主 AI 智能体"热潮的鼻祖。它第一次让大众看到:给 GPT 一个目标("帮我做市场调研"),它能自己拆解任务、上网、执行、循环,无需人类逐步指挥。GitHub star 数几周内冲到十几万,是史上增长最快的开源项目之一。
它当年为什么这么震撼?
在它之前,ChatGPT 是"你问一句它答一句"。AutoGPT 展示了 "AI 自己给自己下命令、连续行动直到完成目标"——这就是"自主智能体(autonomous agent)"的概念雏形。虽然当时它经常跑偏、烧钱、陷入循环,但它点燃了整个行业对 Agent 的想象。你今天学的 eino、OpenHands、CrewAI,某种意义上都是这波浪潮的后来者。AutoGPT 是"AI Agent"这个词进入大众视野的起点。
L02
为什么转型成"平台"
经典 AutoGPT 虽火,但有致命问题:不可控——它自主循环时经常跑偏、重复、烧掉大量 token 却得不到结果,难以用于生产。于是 AutoGPT 团队转型:从"一个放飞的自主智能体",变成"AutoGPT Platform——一个让你可控地搭建 AI 自动化的可视化平台"。
💬 你可能想问
👶 小白:全自主不是更酷吗?为啥要"退回"到人来搭流程?
👨🏫 老师:酷,但不敢用。想象你雇了个天才实习生,你只说"帮我做市场调研"就撒手不管——他可能查到一半跑去研究别的、把预算烧光、还给你编数据。企业不敢把钱和数据交给这种"放飞"。平台的做法是:你先把工序画成流水线,实习生只在每个工位上发挥,跑偏不了、能复用、能算钱。
👨🏫 老师:酷,但不敢用。想象你雇了个天才实习生,你只说"帮我做市场调研"就撒手不管——他可能查到一半跑去研究别的、把预算烧光、还给你编数据。企业不敢把钱和数据交给这种"放飞"。平台的做法是:你先把工序画成流水线,实习生只在每个工位上发挥,跑偏不了、能复用、能算钱。
💡 本质 + 生活类比:手工作坊 → 正规工厂
这次转型的本质,就是从"手工作坊"升级到"正规工厂流水线":经典 AutoGPT 像一位天才但乱来的手工艺人(给个目标自己瞎鼓捣,做出来全凭运气);平台像一条标准化流水线(工序固定、每步可控、能量产、出了问题知道卡在哪个工位)。本课后面所有内容,都在讲这条"流水线"是怎么造出来、怎么转起来的。
这个转型的本质是什么?
从"全自主、不可控"转向"半自主、可控"。经典 AutoGPT 是"你给目标,AI 自己决定所有步骤"(放飞)。平台是"你用积木搭好流程图,AI 在你规定的每一步里发挥"(可控)。这和 CrewAI 从纯 Crew 加入 Flow、OpenHands 强调沙箱+确认是同一个行业觉悟——纯自主不可靠,可控编排 + 局部 AI 自主才是生产之道。整个 Agent 行业都在从"炫技的放飞"走向"可靠的工程化"。
L03
经典 vs 平台
🤖 经典 AutoGPT(classic/)
- 2023 那个自主循环智能体
- 给目标 → 自己 think/plan/act 循环
- 不可控、易跑偏、烧钱
- 现为历史遗产(含 Forge 框架)
🧱 AutoGPT Platform(autogpt_platform/)
- 现代主力,本教程主战场
- 可视化:拖拽 Block 连成 Graph
- 可控、可复用、可计费
- 后端 + 前端 + libs 的完整 SaaS
本教程主讲 Platform(Day 02-18、20),并用 Day 19 讲经典 AutoGPT + Forge 的起源故事。为什么还讲经典?因为它是"自主智能体"概念的源头,理解它能让你看清整个 Agent 领域的来路——以及"为什么现在大家都不搞纯自主了"。
⚠️ 常见误解:小白常以为"平台版就是给经典 AutoGPT 加了个界面"。其实两者是两套不同的东西——经典是"一个会自己循环的脚本",平台是"一套让你搭流水线的工厂系统",代码几乎不复用(分别住在
classic/ 和 autogpt_platform/ 两个目录)。L04
Block + Graph 核心心智
平台的核心就两个概念,务必记牢:
- Block(积木):一个功能单元。有输入口和输出口,内部一个
run()逻辑。比如"调 LLM"块(输入:提示词,输出:回答)、"读网页"块(输入:URL,输出:文本)、"发邮件"块。 - Graph(图):把多个 Block 用连线连起来——前一个块的输出口连到后一个块的输入口。连好的一张图,就是一个 AI 智能体。
上:单个 Block 有输入口/输出口 + 一个 run();下:把输出口连到下一个的输入口,数据像电流一样流过,整张图就是一个智能体。
用"乐高"或"电路"打比方
Block 像一块乐高积木(有凸起和凹槽),Graph 就是把积木拼成的作品。或者:Block 像电子元件(有输入/输出引脚),Graph 是把元件连成的电路。你不用写代码,只要选积木、连线,就搭出一个能自动干活的 AI 流程。数据像电流一样从第一个块流到最后一个块。这就是 AutoGPT Platform 的全部魔法——接下来 20 天就是拆解"积木怎么定义、图怎么执行、平台怎么支撑"。
L05
一个直观例子
假设你想做一个"每天早上把某新闻网站的头条总结后发到我邮箱"的智能体。用 Block 搭:
# 一张 Graph(从上到下数据流动):
[定时触发 Block] 每天 8:00
↓
[读网页 Block] 输入 URL → 输出 网页文本
↓
[LLM 总结 Block] 输入 文本 → 输出 摘要
↓
[发邮件 Block] 输入 摘要 → 发送到你邮箱
📝 举个例子:数据怎么在这条线上流动
触发
08:00 → 读网页输出 "今日头条:A股大涨…(3000字)" → LLM 总结输出 "3条摘要" → 发邮件把摘要投进你邮箱。每个 Block 的"输出"正好是下一个 Block 的"输入"——这就是 Day 05 要逐帧追踪的"一次执行旅程"。🚶 换个视角:假设你就是那条"新闻数据"
现在你不是旁观者,你就是一条数据,亲历这条流水线:早上 8:00 闹钟(定时 Block)把你叫醒 → 你先被送到"读网页"工位,变成 3000 字的网页文本 → 传送带把你送到"LLM 总结"工位,被压缩成 3 条摘要 → 最后到"发邮件"工位,被塞进信封投进用户邮箱。你在每个工位都被加工一次,最终从"一堆原始文字"变成"一封有用的邮件"。这就是 Day 05 要一帧一帧追的"一次执行旅程"。
当然 Graph 不止是直线——可以有分支(根据条件走不同块)、并行(同时跑多个块)、甚至子图(把一个 Graph 当成一个块嵌套)。第 3 周讲执行引擎时细看。
L06
仓库结构
AutoGPT/
├── autogpt_platform/ # ★ 现代平台(本教程主战场)
│ ├── backend/backend/ # 后端核心
│ │ ├── data/block.py # Block 基类(Day 02/06)
│ │ ├── data/graph.py # Graph 模型(Day 03/11)
│ │ ├── data/execution.py # 执行数据模型(Day 12)
│ │ ├── data/credit.py # 积分计费(Day 16)
│ │ ├── blocks/ # 300+ 现成 Block(Day 07)
│ │ ├── executor/ # 执行引擎(Day 12-14)
│ │ ├── integrations/ # 凭证/OAuth(Day 17)
│ │ ├── sdk/ # 写 Block 的 SDK(Day 10)
│ │ └── rest.py / ws.py # API / WebSocket(Day 15/18)
│ ├── frontend/ # Next.js 可视化构建器
│ └── autogpt_libs/ # 共享库
└── classic/ # 经典 AutoGPT + Forge(Day 19)
读法:记住后端核心路径
autogpt_platform/backend/backend/——这 20 天几乎都在读它。data/ 放数据模型(Block/Graph/Execution/Credit),blocks/ 放具体积木,executor/ 放执行引擎。L07
技术栈
- 后端:Python + FastAPI(Web 框架)+ Prisma(ORM)+ PostgreSQL(数据库)。
- 队列/缓存:Redis + RabbitMQ(执行任务排队、事件分发)。
- 前端:Next.js(可视化拖拽构建器)。
- 认证:Supabase。
- 计费:Stripe(积分充值,Day 16)。
为什么用这么"重"的技术栈?
因为它是一个真正的生产级 SaaS 平台,不是玩具。要支撑:多用户并发跑图(需队列 RabbitMQ)、实时看执行进度(需 WebSocket)、可靠存储图和执行记录(需 Postgres)、计费(需 Stripe)、第三方授权(需 OAuth)。对比经典 AutoGPT 只是个 Python 脚本——平台的工程复杂度高得多,因为它要"可靠地服务真实用户"。这也印证了 L02 的转型:从 demo 到生产。
L08
今日小结 + 动手
🧠 今天你应该能回答
- AutoGPT 的起源?当年为什么震撼?
- 为什么从"自主智能体"转型为"平台"?(不可控 → 可控)
- 经典(classic/)和平台(autogpt_platform/)的区别?
- Block + Graph 的核心心智?(积木连成图 = 智能体)
- 后端核心代码在哪个路径?技术栈为什么这么重?
🎯 记忆口诀(把今天压成一句话)
"积木连成图,数据顺线流;作坊变工厂,可控又能收(费)。"——积木=Block,图=Graph,工厂=Platform,收费=Credits。
一句话复述(能讲给别人听才算懂):AutoGPT 从"给个目标就自己瞎跑的手工艺人",进化成了"你搭好流水线、AI 在每个工位上干活的正规工厂"。
一句话复述(能讲给别人听才算懂):AutoGPT 从"给个目标就自己瞎跑的手工艺人",进化成了"你搭好流水线、AI 在每个工位上干活的正规工厂"。
✋ 动手:确认结构
# 1. 两部分
ls autogpt_platform/ classic/
# 2. 后端核心
ls autogpt_platform/backend/backend/data/ | head
ls autogpt_platform/backend/backend/blocks/ | head
# 3. 看有多少现成 Block
find autogpt_platform/backend/backend/blocks -name '*.py' | wc -l
明天预告 · Day 02:精讲第一个核心概念——Block(积木)。读
data/block.py:Block 是什么、输入/输出 Schema、run() 方法、为什么这样设计成"有类型口的可复用节点"。