GPT Researcher 源码学习
自主调研 Agent:多源检索、规划与长文研究报告。这不是 API 速查表,而是一条可以重复走的源码路线:每天用 30 分钟,从一个真实相对路径出发,先用类比建立直觉,再把它接回整条运行链路。
开篇 · 这是个什么项目
GPT Researcher 可以先想成一间自主深度调研记者。它的代码不是一堆孤立文件:入口接到需求,核心对象做判断,工具或模型完成工作,状态把结果交给下一个环节。
架构全景(动起来看)
发光扫过的每一层都是一次任务可能经过的站点。不同仓库命名不同,但「接入 → 编排 → 核心能力 → 资源」的责任边界很相似。
怎么使用这份教程
每天 30 分钟
6 讲,每讲先问问题,再给本质和大白话。
真实相对路径
所有路径都从项目根目录算,不把你的机器路径写进源码引用。
先验证再推理
每页都有可复制 bash 命令;文件版本变化时以本地实际内容为准。
可迁移方法
学会从入口、数据结构、循环和扩展点读任何 AI 项目。
从 README.md 认识项目大门
README.md:围绕 README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
配置与依赖:pyproject.toml
pyproject.toml:围绕 pyproject.toml 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
顶层入口与启动路径
main.py:围绕 main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「入口与地图」。
核心对象:main.py
deep_agents/main.py:围绕 deep_agents/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
运转循环里的 main.py
multi_agents/main.py:围绕 multi_agents/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
协作主线穿过 main.py
multi_agents/ag2/main.py:围绕 multi_agents/ag2/main.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心循环」。
能力模块:tool_selector.py
gpt_researcher/mcp/tool_selector.py:围绕 gpt_researcher/mcp/tool_selector.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
业务动作落在 browser
gpt_researcher/scraper/browser:围绕 gpt_researcher/scraper/browser 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
把任务交给 __init__.py
gpt_researcher/scraper/browser/__init__.py:围绕 gpt_researcher/scraper/browser/__init__.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
扩展点附近的 browser.py
gpt_researcher/scraper/browser/browser.py:围绕 gpt_researcher/scraper/browser/browser.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「核心能力」。
状态如何进入 memory
gpt_researcher/memory:围绕 gpt_researcher/memory 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
消息与协作:__init__.py
gpt_researcher/memory/__init__.py:围绕 gpt_researcher/memory/__init__.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
持久化视角下的 embeddings.py
gpt_researcher/memory/embeddings.py:围绕 gpt_researcher/memory/embeddings.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「状态与协作」。
模型侧连接:app.py
backend/server/app.py:围绕 backend/server/app.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
工具/MCP 桥:server.js
docs/discord-bot/server.js:围绕 docs/discord-bot/server.js 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
检索与知识:mcp
gpt_researcher/mcp:围绕 gpt_researcher/mcp 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
集成层:README.md
gpt_researcher/mcp/README.md:围绕 gpt_researcher/mcp/README.md 建立因果链:谁调用、处理什么、交给谁;对应阶段是「模型与扩展」。
样例与复盘:test_local.json
gpt_researcher/config/variables/test_local.json:围绕 gpt_researcher/config/variables/test_local.json 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
测试与边界:examples
docs/docs/examples:围绕 docs/docs/examples 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。
收官:沿 custom_prompt.py 串回全图
docs/docs/examples/custom_prompt.py:围绕 docs/docs/examples/custom_prompt.py 建立因果链:谁调用、处理什么、交给谁;对应阶段是「复盘与扩展」。