Day 67 / 共 68 天 · 阶段 12 实战求职

面试冲刺①:概念题问答卡

昨天(Day 66)把项目写进了简历,用"问题→方案→指标"讲清了你做过什么。今天(Day 67)把最高频的概念面试题逐条过一遍——RAG、上下文、幻觉、工具调用、Agent、评测——每题给你"考点(面试官到底想听什么)+参考答法要点",做成可以盖住答案自测的问答卡。明天(Day 68)是收官:系统设计题 + 68 天全程复盘。

📍 你在阶段 12(实战求职 D62-68)的位置 · 只剩最后 2 天
D64 多智能体作品 D65 GitHub/博客 D66 简历包装 D67 概念题 D68 系统设计+收官🎓
💡 用一个类比兜住今天(今天全程沿用「驾照笔试」的世界观) 概念面试就像考驾照笔试。题库是公开的、翻来覆去就那些题,不需要天赋,需要的是把每道题的"标准答法"背熟并理解。今天的每张问答卡 = 一道笔试题:考点 = 出题人想考你哪个知识点,参考答法要点 = 满分答案的得分点。你要做的不是死记,而是能用大白话把得分点讲出来——就像教练问"这个标志啥意思",你张口就来。盖住答案自测,答不出的翻回对应天再看一眼。

L01

怎么答概念题:3 个通用套路

🤔 痛点知道 RAG 是啥,可一被问就语无伦次、说了三分钟还没说到点子上。面试官皱眉,你越说越慌。问题不在"你不懂",而在"你没有答题结构"。
💡 本质概念题不是让你背课本,而是考"你能不能把一个概念讲清楚"——这正是工作里天天要干的事(跟产品、跟老板解释)。答得好=结构清晰+有取舍+有例子,就像驾校教练要的是"你真懂"而不是"你背过"。
概念题万能答题结构:一句话 → 为什么 → 取舍 → 例子 ① 一句话 先给定义 "它是…" ② 为什么 解决啥痛点 不用它会咋样 ③ 取舍 优缺点/边界 "但要注意…" ④ 例子 你项目里咋用 落地一下 口诀:先定义,再说痛点,点出取舍,落到你自己的项目 30~60 秒讲完,别超过 1 分钟;能带出项目经历最加分
图注:这套"一句话→为什么→取舍→例子"结构,套用在今天所有问答卡上都成立。
📝 举个例子:同一道题,两种答法 问「什么是 RAG?」
❌ 差答法:"就是检索增强生成,先检索再生成……然后嵌入……向量……"(堆名词、没结构、听着像背的)
✅ 好答法:"RAG 就是给大模型外挂一个'可查的资料库'(一句话)。因为模型不知道你公司内部文档,硬答就会瞎编(为什么)。它的取舍是准确度靠资料质量、还多了检索这一步延迟(取舍)。我在知识库助手项目里用它,把 200 份 PDF 切块入库,回答时带出处(例子)。"
👶 记不住这么多概念咋办?不用全背。面试官问的就那十几个高频词。今天这几张卡覆盖了 80% 的概念题。把每张卡的"一句话定义"背到脱口而出,其余得分点理解即可——理解了就能现场组织语言,比死背更抗打。
L02

RAG 问答卡(4 题)

🤔 痛点RAG 是转行岗位里被问得最多的话题(几乎必问)。光会说"检索增强生成"这七个字远远不够,面试官会顺着追问"怎么切块""为什么检索不准"。
💡 本质下面每张卡先给考点(面试官想听啥),再折叠参考答法要点盖住答案,自己先答,再展开对照——像笔试刷题。答不出的题,点开卡里标注的"回看 Day"复习。
Q1:什么是 RAG?为什么需要它?
🎯 考点:能否讲清"外挂知识库"这个本质 + 不用它的痛点(幻觉/知识过时/无法读私有数据)
展开参考答法要点
  • 一句话:RAG = 回答前先去资料库检索相关内容,把它塞进提示词,让模型"看着资料答"。
  • 为什么:大模型的知识停在训练那一刻、且不知道你的私有文档;硬答会编造(幻觉)。RAG 让答案有据可查、可更新(改资料即可,不用重训模型)。
  • 六步:读文档→切块→做 embedding→存向量库→检索 top-k→拼进 prompt 生成。
  • 取舍:答案质量强依赖检索质量("检索不到=答不对"),且多一步检索延迟与成本。
答不顺?回看 Day 21 RAG 全景。
Q2:为什么要 chunking(切块)?切太大 / 太小各有什么问题?
🎯 考点:理解切块是为了"检索精度"和"塞得进上下文窗口",能说出大小的权衡
展开参考答法要点
  • 为什么切:整篇文档太长塞不进上下文,且检索时命中"一整篇"不精准;切成小块才能精确定位到相关段落。
  • 切太大:一块里混了很多无关内容,检索噪声大、浪费 token。
  • 切太小:语义被切断(一句话被拦腰砍),检索到的块信息不完整。
  • 常用做法:按语义/段落切 + 设置 overlap(相邻块重叠一点)防止边界信息丢失。
回看 Day 22 chunking。
Q3:embedding 是什么?为什么"语义相近"能被找到?
🎯 考点:能用大白话解释"把文本变成一串数字(向量),意思相近的向量距离近"
展开参考答法要点
  • 一句话:embedding 把一段文本变成一串数字(向量),意思相近的文本,向量在空间里离得近。
  • 为什么能检索:把用户问题也变成向量,找和它距离最近(余弦相似度高)的文档块,就是"语义最相关"的内容——即使用词不同也能匹配("汽车"能命中"轿车")。
  • 对比关键词检索:关键词只能匹配字面,embedding 能匹配"意思"。实际中常两者混合。
回看 Day 23 embedding、Day 25 检索。
Q4:检索不准怎么优化?rerank 和混合检索是干嘛的?
🎯 考点:能给出"先粗召回再精排""向量+关键词混合"这类具体手段,不是空谈
展开参考答法要点
  • 混合检索:向量检索(懂语义)+ BM25 关键词检索(抓专有名词/编号),两者结果融合,互补短板。
  • rerank(重排):先用向量快速召回较多候选(如 top-50),再用一个更强的重排模型精挑出最相关的 top-5,兼顾速度和准确。
  • 其他手段:调整 chunk 大小、加 overlap、按元数据过滤(如只搜某部门文档)、优化查询(query 改写/扩展)。
  • 关键心态:检索优化要靠评测驱动(hit rate / MRR),不能凭感觉。
回看 Day 26 rerank&混合检索、Day 27 RAG 评测。
L03

上下文工程问答卡(3 题)

🤔 痛点"上下文窗口""上下文工程"听着玄乎。面试官问"上下文太长了怎么办",你答不上来就露怯——这恰恰是实战里天天遇到的问题。
💡 本质把上下文窗口想成模型的"办公桌":桌子就那么大(有 token 上限),桌上放什么、放多少、放的顺序,直接决定它干得好不好。上下文工程 = 学会整理这张桌子
Q5:什么是上下文窗口?满了会怎样?
🎯 考点:知道窗口=一次能"看到"的 token 上限(输入+输出共享),超了要么报错要么截断
展开参考答法要点
  • 一句话:上下文窗口是模型一次能处理的 token 总量上限,像办公桌的桌面面积。
  • 包含什么:系统提示 + 历史对话 + 检索到的资料 + 用户当前问题 + 留给回答的空间,全都占额度。
  • 满了怎样:超出会报错或被截断(前面的内容被丢),导致模型"忘了"早先说过的话。
  • 还有个坑:窗口大不等于用得好——放太多无关内容反而干扰(见下题)。
回看 Day 10 大模型是什么、Day 18 上下文工程。
Q6:什么是 "lost in the middle"?怎么应对?
🎯 考点:知道模型对上下文"中间"的信息注意力弱,要把关键信息放两头 + 只放相关内容
展开参考答法要点
  • 现象:一大段上下文里,模型对开头和结尾的信息记得牢,中间的容易被忽略——像读长文只记得头尾。
  • 应对:① 只放真正相关的内容(检索精一点,别一股脑全塞);② 把最关键的信息放在开头或结尾;③ 历史太长就压缩/摘要。
  • 一句话总结:上下文不是越多越好,而是"少而精、位置对"
回看 Day 18 上下文工程。
Q7:对话越来越长,历史怎么管理?
🎯 考点:能说出"摘要压缩 / 滑动窗口 / 只留关键轮 / 外置到向量库"等策略
展开参考答法要点
  • 滑动窗口:只保留最近 N 轮对话,老的丢掉。
  • 摘要压缩:把早期对话让模型总结成几句话,用摘要替代原文,省 token 又保留要点。
  • 外置记忆:把长期信息存到向量库(长期记忆),需要时再检索回来,而不是一直挂在上下文里。
  • 取舍:压缩会丢细节,要在"省 token"和"保信息"之间权衡。
回看 Day 18 上下文工程、Day 36 记忆。
L04

幻觉问答卡(3 题)

🤔 痛点"幻觉"是面试官最爱挖的坑,因为它直接关系到产品能不能上线。只会说"模型会瞎编"是不够的,得说清为什么会编、怎么防
💡 本质幻觉就像一个不肯说"我不知道"的学生:不会的题也硬编一个答案,还编得一本正经。防幻觉 = 想办法让它"有据才答、没据就承认不知道"。
Q8:幻觉是什么?为什么会产生?
🎯 考点:能解释"模型本质是预测下一个词,追求流畅而非真实",所以会一本正经胡说
展开参考答法要点
  • 一句话:幻觉 = 模型生成了听起来合理、但实际错误或凭空捏造的内容。
  • 根因:模型本质是"预测下一个最可能的词",目标是语言流畅,并不是查证真伪;训练数据没有的、或它"记混了"的,它也会自信地补出来。
  • 高发场景:问具体数字/日期/人名、问它不知道的私有信息、问超出知识截止时间的事。
回看 Day 10 大模型是什么。
Q9:怎么减少幻觉?(答得出 3 招以上就很稳)
🎯 考点:能给出组合拳:RAG 提供证据 + 提示词约束 + 结构化引用 + Critic 校验
展开参考答法要点
  • 给证据:用 RAG 检索真实资料,让它"看着资料答"而非凭记忆。
  • 提示约束:明确要求"只根据给定资料回答,资料里没有就说不知道"。
  • 带出处:让它每句话标注引用的资料 ID,逼它有据可依,也方便核对。
  • 加 Critic 校验:用第二个模型/步骤核对答案里的说法是否有证据支撑,拦下编造(可信工程的核心)。
  • 降 temperature:需要事实性回答时调低随机性。
回看 Day 21 RAG、Day 53 防幻觉 Critic。
Q10:怎么"衡量"幻觉?(进阶,答得出加分)
🎯 考点:能提到 faithfulness(忠实度)——答案是否都能从检索到的资料里找到依据
展开参考答法要点
  • faithfulness / 忠实度:检查答案里的每个说法能否被检索到的资料支撑;不能支撑的就是幻觉。
  • 怎么测:常用 LLM-as-Judge——让一个模型逐句判断"这句话有没有资料依据",算出忠实度分数。
  • 关键观点幻觉不是靠感觉说"变少了",要靠评测量化,才能证明改动真的有效。
回看 Day 27 RAG 评测、Day 50 LLM-as-Judge。
L05

工具调用问答卡(3 题)

🤔 痛点Function Calling / 工具调用 / MCP 这几个词容易搅在一起。面试官问"模型怎么调用外部工具",很多人只会含糊说"它自己会调"——其实模型不会真的执行,得说清这个机制。
💡 本质工具调用像老板派活给助理:老板(模型)不亲自动手,只说"帮我查下今天天气"(吐出"要调哪个工具+参数"),助理(你的代码)去执行,把结果拿回来给老板继续说。模型只负责"决定调什么",执行是你的程序干的。
Function Calling 的真实流程(模型不执行,只决定) ① 模型 吐出:调 get_weather ② 你的代码 真正执行函数 ③ 外部世界 天气 API 返回 ④ 结果回填模型 继续生成最终回答
图注:面试必答点——"模型只决定调哪个工具、传什么参数;执行是宿主程序做的,结果再回填给模型"。
Q11:Function Calling 是怎么工作的?
🎯 考点:必须点破"模型不执行代码,只输出结构化的调用意图;宿主执行后回填结果"
展开参考答法要点
  • 你先把可用工具的"说明书"(名字、功能、参数 schema)告诉模型。
  • 模型根据用户问题,判断需不需要调工具;需要就输出"调哪个工具+参数"(一段结构化 JSON),它本身不执行。
  • 你的程序解析这段输出,真正调用对应函数/API,拿到结果。
  • 把结果回填给模型,模型据此生成最终自然语言回答。
回看 Day 29 Function Calling 原理。
Q12:怎么写一个"安全好用"的工具?
🎯 考点:清晰的描述/schema + 幂等 + 错误不抛异常而返回结构化错误
展开参考答法要点
  • 描述清晰:工具名和参数说明要让模型"看名字就知道啥时候用",写不清模型就乱调。
  • 幂等:同样的调用多次执行结果一致,避免重试造成重复下单之类的事故。
  • 错误结构化:出错时返回一个说明错误的结果(如 {"error":"城市不存在"}),而不是抛异常崩掉——这样模型能"看到错误"并自己纠正。
  • 权限最小化:危险动作(删数据、发钱)要加确认/审批。
回看 Day 30 写安全工具、Day 54 护栏。
Q13:MCP 是什么?和 Function Calling 什么关系?
🎯 考点:MCP 是"统一外挂协议/标准接口",让工具能被不同应用复用;不是替代 function calling,是标准化它
展开参考答法要点
  • 一句话:MCP(Model Context Protocol)是一套统一的"外挂"标准,让 Agent 连接工具/数据源有个通用插口。
  • 类比:像 USB 接口——工具做成 MCP server,任何支持 MCP 的应用(client)都能插上用,不用为每个应用重写一遍。
  • 关系:Function Calling 是"模型决定调工具"的机制;MCP 是"工具怎么被标准化地接进来"的协议。二者互补,不冲突。
回看 Day 31 MCP 入门、Day 46 协作协议。
L06

Agent & 评测问答卡(4 题)

🤔 痛点"Agent 和普通调用有啥区别""为什么说评测最重要"——这两个是拉开分数的题。答好了,面试官会觉得你真上过手;答虚了,就像只看过教程。
💡 本质Agent 像一个会自己想办法办事的员工:给他目标,他能"想→动手→看结果→再想",直到把活干完;普通一问一答只是"你问一句它答一句"。而评测就像员工的 KPI 考核——没有考核,你根本不知道改动是变好还是变坏。
Q14:Agent 是什么?和普通"一问一答"有什么区别?
🎯 考点:点出"主循环:感知→决策→行动→观察→再决策",能自主用工具多步完成任务
展开参考答法要点
  • 一问一答:你问一句,模型答一句,一次性,不会自己动手。
  • Agent:给它一个目标,它在一个循环里自己"想下一步该干嘛→调工具动手→看结果→再想",多步推进直到完成或达到上限。
  • 关键能力:会用工具、有记忆、能规划、能根据观察调整——所以能处理"订一趟差旅"这种需要多步的复杂任务。
  • 代价:更慢、更贵、更难控(可能绕圈/失控),所以要加循环上限、护栏和评测。
回看 Day 33 Agent 是什么、Day 34 ReAct。
Q15:ReAct 是什么?
🎯 考点:Thought(想)→Action(调工具)→Observation(看结果) 交替循环
展开参考答法要点
  • 一句话:ReAct = Reasoning(推理) + Acting(行动)交替进行的一种 Agent 模式。
  • 三步循环:Thought(我该干嘛)→Action(调某个工具)→Observation(工具返回啥),然后基于观察再 Thought,如此往复。
  • 好处:把"思考"显式写出来,模型决策更靠谱、也更好调试(能看到它每步怎么想的)。
回看 Day 34 ReAct。
Q16:为什么说"评测最重要"?没评测会怎样?
🎯 考点:没评测=盲改(改了不知道好坏);面试官极爱问;要能说离线vs在线、成功率等指标
展开参考答法要点
  • 核心观点:LLM 应用是概率性的,改一句 prompt 可能这好了那坏了。没有评测,你就是在盲改,凭感觉说"好像变好了"
  • 怎么做:攒一个"标准答案集"(golden set),每次改动都跑一遍,用指标对比。
  • 指标:任务成功率、检索命中率、忠实度、延迟 P50/P95、成本、失败模式分类。
  • 离线 vs 在线:离线=上线前用测试集跑;在线=上线后监控真实流量表现。
回看 Day 49 为什么评测最重要、Day 51 指标体系。
Q17:LLM-as-Judge 是什么?有什么坑?
🎯 考点:用模型给输出打分(省人力);坑=有偏见(偏长、偏位置),要用 rubric+成对比较缓解
展开参考答法要点
  • 是什么:用一个(通常更强的)模型来给另一个模型的输出打分/判断好坏,替代昂贵的人工评估。
  • 怎么做靠谱:给清晰的评分标准(rubric)、用成对比较(A/B 哪个好)而非打绝对分。
  • 坑/偏见:会偏好更长的答案、偏好排在前面的答案、偏好自己风格的输出;要通过打乱顺序、明确标准来缓解,并偶尔用人工抽检校准。
回看 Day 50 LLM-as-Judge。

👶 小白:面试官如果问一个我完全没准备过的概念,怎么办?

👨‍🏫 老师:三步。① 别装懂——瞎编比说"这块我了解得不深"扣分更狠(尤其做 Agent 的岗位最忌讳"幻觉式"回答,面试官会当场看穿)。② 用你会的去靠:"我没直接用过 X,但它要解决的问题应该和我熟悉的 Y 类似,我猜思路是……"——展示你的推理能力。③ 反问澄清:"您指的是 A 场景下的还是 B?"——既争取思考时间,也显得你在乎精确。诚实 + 会推理 + 会提问,这本身就是 Agent 工程师最值钱的素质。

L07

今日小结 + 动手 10 分钟

🧠 今天你应该能脱口而出

  • 概念题万能结构:一句话 → 为什么 → 取舍 → 例子。
  • RAG 是什么、为什么、六步、切块/embedding/检索优化的取舍。
  • 上下文窗口 = 办公桌;lost in the middle;长历史怎么压缩。
  • 幻觉为什么产生、3 招以上怎么防、用 faithfulness 量化。
  • Function Calling 真实流程(模型只决定不执行)、MCP 是统一外挂协议。
  • Agent vs 一问一答、ReAct、为什么评测最重要、LLM-as-Judge 的坑。

✋ 动手 10 分钟:给自己录一份"口述答案"

别只看不练——概念题是"说"出来的。挑今天 3 道你最没底的卡盖住答案,用手机录音,把答案讲一遍(每题 30~60 秒),再回放对照得分点,把漏掉的补上。可以照这个自测清单打勾:

# 面试概念题·自测清单(打钩就算过关,讲不顺的回看对应 Day)
[ ] Q1  RAG 是什么 & 为什么          (Day21)
[ ] Q2  chunking 切太大/太小的问题   (Day22)
[ ] Q3  embedding 为什么能语义检索   (Day23/25)
[ ] Q4  检索不准怎么优化/rerank      (Day26/27)
[ ] Q6  lost in the middle 怎么应对  (Day18)
[ ] Q9  减少幻觉的 3+ 招            (Day21/53)
[ ] Q11 Function Calling 真实流程    (Day29)
[ ] Q13 MCP 是什么 & 与FC关系        (Day31)
[ ] Q14 Agent vs 一问一答           (Day33)
[ ] Q16 为什么评测最重要            (Day49/51)
📝 举个例子:把答案"绑"到你的项目上 每道题答完,强行加一句"我在 ___ 项目里就是这么做的"。比如答完 RAG,接:"我的知识库助手就是切块入库、带出处回答的。"——概念+自己的项目=面试官最想听的组合,比纯背概念高一个档次。回看 Day 62~64 的三个作品集,正好一一对应这些概念。
明日预告 · Day 68(收官🎓):概念题过关后,明天挑战更硬的系统设计题——"设计一个客服/文档 Agent"该怎么答(需求澄清→架构→检索/工具→评测→成本→上线的框架)。然后是68 天全程大复盘,给你一份下一步行动清单(投递策略 + 持续学习),正式毕业!坚持到这儿,你已经很了不起了。
← Day 66 · 简历 & 项目包装 Day 68 · 系统设计 + 收官 🎓 →