← 路人甲官网 ← 三层深度地图
团队能力训练 · 自测与练习

自测与练习

检验「深入」是否到位的自测题(点击展开答案),以及逼出深度的动手练习。全部能从机制答出、不靠背诵,就算验收通过。

怎么用:先自己在心里(或对同事)把答案讲一遍,再点开对照。答不出来、或答得含糊的那几题,就是你下一步要补的洞——把它标记下来,回到「三层深度地图」找对应模块和课程去补。

自测清单

共 51 题,按五类组织。点击任意问题展开参考答案。
A

大模型底层

核心必懂 · 9 题
1大模型的本质是什么?为什么说它不是「检索」或「数据库」?
指向:它是逐 token 的概率预测——根据前文一个词一个词地生成最可能的下一个词。不查表、不检索,所有输出都是「算」出来的,这是理解它一切行为的起点。
2为什么模型会一本正经地编造事实(幻觉)?
指向:它在生成「最像正确答案」的文字,而不是核查真伪。幻觉是逐 token 概率生成的结构性必然,不是能彻底修掉的 bug。
3为什么同一个 prompt 两次结果不一样?
指向:采样带随机性。模型给出的是一个概率分布,每次从中抽样,所以结果会变;调低 temperature 会更稳定。
4为什么它数不清 strawberry 里有几个 r?
指向:tokenization——模型看到的是 token(词块),不是一个个字母,所以字符级任务天然吃亏。
5上下文窗口是什么?窗口外的内容模型知道吗?
指向:上下文窗口是单次能「看到」的输入上限(有限预算)。窗口外的内容它完全不知道,超出就被丢掉或需另想办法(如 RAG)。
6模型在两次对话之间有记忆吗?
指向:没有。每次调用都是无状态的,「记得」是把历史重新塞进上下文造成的错觉。
7预训练和后训练(指令微调 / RLHF)分别做什么?
指向:预训练在海量文本上学语言和世界知识;后训练(指令微调、RLHF)教它「听懂指令、有用、无害」。很多「性格」来自后训练。
8「知识截止」是什么意思?
指向:训练完成后模型知识就定格在某个时间点,之后发生的事它并不知道,除非通过检索或工具喂给它。
9注意力机制在概念层做了什么?
指向:让每个词在生成时「看」上下文里所有词、按相关性加权组合信息。它是 Transformer 的核心。
B

大模型进阶

10 题
10为什么长文档里中间那句指令容易被忽略?
指向:注意力有位置效应(lost in the middle),开头结尾权重高、中间易被稀释。多是位置问题,不是模型变笨。
11模型爱道歉、爱附和、爱列点,这些「性格」从哪来?
指向:主要来自后训练(RLHF)的塑造,包括谄媚(sycophancy),不是模型「本性」,也不是预训练里的知识。
12为什么它错得很自信?
指向:校准问题——它输出的「确定语气」和「实际正确率」是脱钩的,对错误答案也可以一样自信。
13为什么给几个例子(few-shot)它就会照做?
指向:上下文学习(in-context learning)。它在做模式匹配而非真正「理解」,所以例子和措辞影响很大。
14为什么厂商也说不准下一代能干什么?
指向:能力是「涌现」的(scaling laws 下),某个能力何时出现无法精确预测,所以行业在「炼丹」。
15为什么不能盲信模型跑分(benchmark)?
指向:benchmark 会被污染、被过拟合刷分,「测得好」不等于「真的好」,跑分要留一手。
16temperature 调高调低分别影响什么?
指向:调高更发散、更有创造性也更易跑偏;调低更确定、更稳定。它是「确定 vs 发散」的旋钮。
17模型是「冻结」的,怎么让它用上实时 / 私有知识?
指向:用 RAG 把资料检索出来喂进上下文。模型本身没「学到」,只是当场「查着答」。
18Transformer 的核心结构是什么?
指向:自注意力:每个词加权组合全上下文的信息,可并行处理长文本。现在几乎所有大模型都以它为骨架。
19什么是对齐(Alignment)?包含哪些方法?
指向:让模型行为符合人类意图与价值观的一整套方法:RLHF、宪法式 AI、RLAIF、DPO 等。「有用又无害」就属于对齐。
C

Agent 与 Harness

10 题
20一个 Agent 本质上是什么?
指向:模型 + 工具 + 把工具结果喂回上下文的控制循环(think→act→observe)。「智能」还是那个模型在选下一个 token。
21模型真的「执行」了函数吗?
指向:没有。它只输出一段结构化文本(function call),由 harness 去解析、执行、再把结果喂回。它始终只是在生成文本。
22Agent 多步任务为什么越走越歪?
指向:错误会跨步累积、上下文被污染、模型一旦「迷路」很难自我纠偏。
23什么是 Harness?为什么同一模型换个产品行为就变?
指向:Harness 是模型外的脚手架:系统提示、上下文管理、工具定义、护栏等。它们塑造了你看到的行为,所以换 harness 行为就变。
24为什么很多「模型不行」其实是 harness 问题?
指向:你观察到的大量行为是 harness 塑造的。「模型做不了 X」追下去常是「harness 没让它行」。
25Agent 的「记忆」是模型自带的吗?
指向:不是。是外部存储 + 检索拼出来的:短期记忆在上下文里、长期记忆在外面。
26为什么 Agent 又慢又贵?
指向:每走一步都要一次模型推理,还按 token 计费,所以天然又慢又贵。
27为什么 Agent 的可靠性是全新问题?
指向:传统软件是确定性的,Agent 是概率性的,每次都可能不同,所以测试、可靠性、上线都得重新想。
28什么是上下文工程?为什么说它是真正瓶颈?
指向:决定给 Agent 喂什么、怎么组织、何时清理上下文。它往往比换更强的模型更决定成败。
29为什么危险操作要 human-in-the-loop?
指向:Agent 的自主性边界是设计出来的。发钱、删数据、对外发送等必须卡人工审批,防止失控。
D

应用层

14 题
30MCP、Skill、RAG、微调分别解决什么,别搞混?
指向:MCP=统一接线口(连工具),Skill=说明书(教做这类事),RAG=记忆外挂(补事实),微调=改模型行为倾向。
31MCP 和 A2A 有什么区别?
指向:MCP 解决「Agent 连工具」,A2A 解决「Agent 连 Agent」。二者互补,不是替代。
32Tool、MCP、Plugin 的关系?
指向:Tool 是「手」(能做动作),MCP 是「统一的接线标准」,Plugin 是把这些打包分发的「盒子」。
33定制模型的三条路径及取舍?
指向:提示工程(最轻,改说法)、RAG(补事实、接私有知识)、微调(最重,改行为倾向)。先用轻的,不够再上重的。
34Embedding / 向量库在 RAG 里起什么作用?
指向:把文字变成向量,用语义距离找相似内容,是 RAG 的检索地基。检索不准常错在这一层。
35为什么要 JSON mode(结构化输出)?
指向:强制模型输出可被程序解析的固定格式,才能把「会聊天的模型」接进真实系统。
36为什么 AI 回复是一个字一个字出来的?
指向:流式输出——逐 token 生成、边生成边吐出,「打字机效果」是它的自然呈现。
37提示缓存(prompt caching)省了什么?
指向:把重复用的长上下文缓存起来,省去每次重算,大幅降本降延迟。
38什么是量化与蒸馏?
指向:两种模型压缩手段:量化降精度省显存,蒸馏用大模型教出能力接近的小模型。让模型能跑在本地 / 手机。
39合成数据是什么?有什么隐忧?
指向:用 AI 生成的数据训练 AI,已成训练核心一环。隐忧是「模型崩溃」——在自产数据上反复训练会退化。
40什么是提示注入(prompt injection)?
指向:攻击者把恶意指令藏在网页 / 文档 / 邮件里,Agent 读进上下文后被劫持。是 Agent 时代最独特的安全风险。
41护栏(guardrails)是什么?
指向:加在模型输入 / 输出两端的安全层:过滤有害内容、拦越界、校格式。独立于模型本身。
42什么是 Eval / LLM-as-Judge?
指向:Eval 是系统化衡量质量;LLM-as-Judge 是用一个模型给另一个模型的输出打分,替代昂贵人工评测(但裁判本身可能带偏差)。
43开源 vs 闭源、API vs 本地部署怎么取舍?
指向:权衡性能、成本、隐私、可控性。敏感行业常选本地 / 开源,哪怕性能略逊。
E

前沿热概念

8 题
44什么是推理 / 思维模型?为什么更慢更贵?
指向:它在给答案前先生成一段内部「思考」(推理链),用更多计算换更高准确率,所以更慢更贵。
45什么是测试时计算(test-time compute)?
指向:不靠把模型练更大,而靠回答时多花计算(想更久、试多条路)来提升表现。是近一年最重要的范式转变。
46什么是 RLVR?推理能力怎么「自我练出来」?
指向:可验证奖励强化学习:对数学、代码等能自动判对错的任务,模型自己生成多条解法、按对错强化。DeepSeek-R1、o 系列即此。
47什么是 Agentic Loop(长时程自主循环)?
指向:Agent 在一个目标下持续自主循环——规划、执行、观察、再规划——跑很多步完成复杂任务。步数一多也更易跑偏。
48什么是机制可解释性(interpretability)?
指向:试图打开黑箱,找出模型内部的「特征」和「回路」,看它到底怎么想。是 2026 年热门方向和安全审计基础。
49多智能体编排是什么?
指向:用一个「编排者」协调多个各司其职的子智能体,完成单个 Agent 搞不定的复杂任务。带来新的协调与失控风险。
50Mamba/SSM、世界模型、扩散语言模型各是什么方向?
指向:Mamba/SSM 是「后 Transformer」的高效长序列架构;世界模型让 AI 学「环境如何演变」;扩散语言模型并行「去噪」生成文本。
51什么是 Vibe Coding?在往什么方向演进?
指向:用自然语言「凭感觉」让 AI 生成可用代码,2025 年爆火;2026 年正演进为「你定目标并验收、一队 Agent 自主实现」。

动手练习

看十篇解读,不如自己搓一个跑起来。前两个逼出「机制深度」,后三个逼出「日常内功」。
练习 A

最小 Agent 循环

用几十行代码手搓:模型 + 一个工具 + 把结果喂回去。跑通后刻意把它搞崩,观察它在哪一步开始迷路——亲手体会错误累积和上下文污染。

练习 B

最小 Harness

自己拼系统提示、自己管上下文预算、自己决定工具结果怎么截断格式化。改一处就看行为怎么变——亲手体会「harness 在塑造模型行为」。

练习 C

预测-验证日课

每次动手前,先写下你对模型行为的预测;跑完再写实际与预测的差异。让「使用」升级成「校准」——这一个习惯顶得上十篇教程。

练习 D

拆解优秀样本

每周挑 2–3 篇公认讲得好的 AI 内容,逐句标注它用了什么手法:哪里用了类比、哪里先讲「跟你有什么关系」、哪里把术语换成大白话。

练习 E

三约束仿写

对同一个技术点,用三种约束各写一遍:一句话讲清、讲给完全不懂的人听、只能用一个类比。带镣铐的练习最长「浅出」的能力。