跳到正文

面试高频:LLM、Token、上下文、Agent 到底是什么

复用站内概念图,把这几个被问烂的词讲到你能上手、也能讲清

一句话:这几个词面试几乎必问。别背定义,建立一个能上手的心智——后面所有动手内容都建在它上面。 LLM:一个「下一个 token 预测器」 大语言模型的本质很朴素:给定前面的文字,预测下一个最可能的 token,再把它接上去,循环。所谓「会聊天、会写代码」,都是这个预测循环的涌现结果。 记住三个面试常考的「它不会」: 它不联网、不实时:知识停在训练截止那一刻,问它今天的新闻只会编(这正是 RAG 要解决的)。 它不记忆:一次请求就是一次性的,上一轮说过什么,全靠你这轮再喂给它(这正是「上下文」「记忆」要解决的)。 它不执行:它只会「输出文字」,真要查数据库、跑代码,得你给它工具(这正是 Function Calling / Agent 要解决的)。 Token:模型眼里的「文字最小单位」 模型不是按「字」处理文本,而是按 token(子词片段)。粗略记:英文 ≈ 1 token/词,中文 ≈ 1~2 字/token。 为什么面试爱问 token?因为它直接决定两件钱事: 成本:API 按 token 计费(输入 + 输出)。 上下文上限:模型一次能"看"的 token 有上限,超了就得截断或压缩。 上下文窗口:模型一次能看多少 「上下文窗口」= 模型单次请求能容纳的 token 总量(输入 + 已生成)。它是个硬上限: 塞太多 → 注意力被稀释,关键信息被淹没,效果反而下降(不是越长越好)。 快满了 → 要么报错,要么硬截断丢信息 → 长任务必须做截断 / 摘要 / 外部记忆(后面手搓 Agent 会踩到)。 Agent:LLM + 工具 + 循环 + 记忆 直接调一次 LLM 是「问一句答一句」。Agent 在它外面套了一层自治循环: 一句话:Agent = LLM(大脑) + 工具(手脚) + 循环(自治) + 记忆(状态)。面试官问「Agent 比直接调 LLM 多了什么」,答的就是这后三样。 配套站内概念图:题库里 Transformer、注意力、KV Cache、RAG、Agent 等都配了示意图,看图理解更快。 面试常踩的点 「大模型为什么会幻觉?」→ 它是概率预测,不是知识库;不知道也会"流畅地编"。 「上下文越长越好吗?」→ 不是,注意力稀释 + 成本 + 延迟,够用就好。 「Token 和字符是一回事吗?」→ 不是,token 是子词,中英文切分粒度不同。 关联面试题(去站内练手) 「请解释一下大语言模型的基本原理 / 为什么会产生幻觉?」 「什么是 Token?它和上下文长度、推理成本有什么关系?」 「Agent 和直接调用 LLM 有什么区别?」 👉 去 题库 搜 大模型原理 / 幻觉 / Agent,配套真题边学边刷。 训练营延伸 这些概念再往底层走——注意力机制、KV Cache、上下文如何在显存里摆放、长上下文怎么外推——是训练营「Memory & Transformer 基础」那条线在讲的,也是大模型岗底层加分项。