Agent 核心定义与关键能力
对比传统模型,Agent 需具备规划、工具调用与记忆等架构特征
原题:在AI领域,'智能体(Agent)'这一概念的核心定义是什么?与传统模型相比,Agent需要具备哪些关键能力和架构特征?
Agent · 腾讯真题
30 秒回答
- 明确定义Agent与传统模型的核心区别(被动响应vs主动交互)
- 阐述工具调用(Tool Use)的必要性
- 说明规划与推理能力的重要性
- 提及记忆机制(短期/长期)
回答与解析
答案要点
- 明确定义Agent与传统模型的核心区别(被动响应vs主动交互)
- 阐述工具调用(Tool Use)的必要性
- 说明规划与推理能力的重要性
- 提及记忆机制(短期/长期)
- 强调与环境/外部系统的交互闭环
Agent的核心定义
Agent = 大模型 + 工具 + 规划 + 记忆 + 环境交互
传统模型是被动响应器:输入→推理→输出,单次调用即结束。
Agent是自主行动体:能持续与环境交互,通过多轮决策完成复杂目标。
关键能力(vs 传统模型)
| 能力 | 说明 |
|---|---|
| 工具调用 | 主动调用API、数据库、计算器等外部工具,突破模型参数知识边界 |
| 规划与推理 | 将复杂任务拆解为多步骤,动态调整执行路径(如ReAct:Thought→Action→Observation循环) |
| 记忆机制 | 短期记忆(对话上下文)+ 长期记忆(向量库存储历史经验) |
| 环境感知 | 接收工具返回的结果,形成"执行-观察-再决策"的闭环 |
架构特征
用户请求 → 规划模块(Planning)→ 工具选择 → 执行调用 → 观察结果
↑___________________________________________↓
(反馈循环,可能多轮)
- 控制流:传统模型是线性,Agent是循环/图结构
- 状态管理:需维护执行状态、中间结果、错误处理
- 安全边界:工具权限管控、输出校验、人工确认节点(Human-in-the-loop)
一句话总结
传统模型"只会想",Agent"能想能做",核心差异在于与外部世界建立可迭代的交互闭环。
口语版讲法(约4分钟)
- 一句话定位:Agent 本质是让模型从被动响应变成主动闭环
- 边界划分:传统模型适合单次推理,Agent 适合需要多步交互的落地场景
- 核心能力展开:工具调用、规划推理、记忆、环境感知
- 业务例子:客服退款场景,对比纯模型 vs Agent 的差异
- 落地风险:工具权限、状态维护、安全边界,以及我的取舍
这道题其实问的是,当大模型要从一个被动的问答工具变成一个能自主完成任务的执行体时,核心变化在哪里。用一句话定位就是:传统模型是输入输出的一次性响应,Agent 是感知-推理-行动-观察的持续闭环。
先说边界。纯模型适合什么?比如翻译、摘要、单轮问答,输入明确,输出直接,一次调用就够了。但一旦任务需要跟外部系统打交道,比如查数据库、调用API、按流程操作,模型就抓瞎了,因为它没有手。Agent 就是给模型装上手脚和眼睛。但落地时常常不是非黑即白,我会把纯模型和 Agent 结合起来:简单请求走模型直出,复杂任务才走 Agent 编排,这样既保速度又保能力。
具体说一下 Agent 需要哪些关键能力。先看 Tool Use,也就是工具调用。模型不能只靠参数里的知识,得能主动去查实时库存、调计算器、发邮件。接着说规划与推理,也就是 ReAct 那种思考-行动-观察的循环。模型把一个复杂指令拆成几步,每步选工具、执行、看结果,再决定下一步。再补充记忆,短期记忆就是对话上下文,长期记忆可以存到向量库,比如之前处理过的相似案例。最后补充环境感知,工具返回的结果可能报错、可能超时,模型得能理解并调整策略。
举个例子,客服退款场景。用户说“我下单了但没收到货,退钱”。纯模型只会生成一段“请提供订单号”的回复,但 Agent 可以这样做:先调订单系统查订单状态,发现已发货但物流异常,于是调物流API确认包裹丢失,再调退款接口发起流程,同时生成安抚话术。整个过程是多步交互,每一步依赖上一步的观察结果。
这里有个坑,就是落地风险。前提是工具接口要稳定、权限要管控好。如果一个调用返回了意外的数据,模型可能误解并做错决策。常见失败场景是模型陷入无限循环,或者调用了一个不该调的高危接口。所以上线我会特别关注几点:给每个工具设置安全边界,比如只读操作自动放行,写操作必须人工确认;还有状态管理,每轮执行完要保存中间结果,方便回滚和调试。
另外,现在有个趋势是把规划能力从模型本身剥离出来,比如用专门的规划器或者 Multi-Agent 协作,这样能降低单点失效风险,但也带来了协调复杂度。
所以说到底,我会把 Agent 看成一种架构模式,而不是某个模型的能力。我更倾向在真实系统中,先给模型配上少量高可靠的工具,跑通闭环,再逐步扩展。如果工具不稳定或者业务逻辑太模糊,宁可先退回到人工加半自动,别让 Agent 全权处理。
关键一句:规划能力可以外挂专门的规划器或用 Multi-Agent 协作,降低单点风险但增加协调复杂度。
面试官还可能这样问
- 问法 1 · 场景切入
假设我们要做一个智能客服,用户问‘帮我查一下上个月的订单’,然后又说‘把那个订单取消掉’。你设计的系统是会直接调用API,还是得先理解上下文再执行?这背后其实就涉及Agent和传统模型的一个核心区别。
- 问法 2 · 层层追问
你觉得大模型在应用中最大的局限是什么?……如果它不能调用外部工具,很多事就做不了,对吧?……那除了工具调用,一个真正的智能体还需要哪些能力才能自主完成复杂任务?比如规划、记忆什么的。
- 问法 3 · 直球架构
请用一句话定义智能体Agent,并说明它相比传统大模型需要哪些额外的关键能力和架构特征。重点讲清工具调用、规划、记忆和交互闭环这几个点。