Agent 基础能力怎么定义?
感知、规划、工具调用等核心要素的依赖与评估标准
原题:如何定义智能体(Agent)的‘基础能力’?请列举并解释构成 Agent 基础能力的核心要素(如感知、规划、工具调用等),并讨论这些能力之间的依赖关系与评估标准。
评估与监控 · 美团真题
30 秒回答
- 明确定义Agent"基础能力"的边界(与通用LLM能力的区分)
- 列举核心要素并解释各自作用(感知、记忆、规划、工具调用、行动执行)
- 阐述能力间的依赖关系(如规划依赖记忆、行动依赖工具调用)
- 给出可量化的评估标准(非泛泛而谈)
回答与解析
答案要点
- 明确定义Agent"基础能力"的边界(与通用LLM能力的区分)
- 列举核心要素并解释各自作用(感知、记忆、规划、工具调用、行动执行)
- 阐述能力间的依赖关系(如规划依赖记忆、行动依赖工具调用)
- 给出可量化的评估标准(非泛泛而谈)
- 结合美团业务场景举例说明
Agent"基础能力"的定义
Agent的基础能力是指将LLM的通用推理能力转化为自主解决复杂任务所需的专项能力模块,区别于纯文本生成的"被动响应",强调目标驱动下的主动决策与环境交互。
五大核心要素
| 要素 | 核心作用 | 关键实现 |
|---|---|---|
| 感知 | 理解环境状态与任务输入 | 多模态输入解析、用户意图识别、实时数据接入 |
| 记忆 | 维持上下文与经验积累 | 短期工作记忆(对话历史)+ 长期知识记忆(向量库/知识图谱) |
| 规划 | 将目标拆解为可执行步骤 | 任务分解(CoT/ToT)、动态 replanning、依赖关系管理 |
| 工具调用 | 扩展能力边界,与外部系统交互 | Function Calling、API编排、工具选择策略 |
| 行动执行 | 将决策转化为实际输出 | 代码执行、事务提交、多轮确认机制 |
能力依赖关系
感知 → 记忆(写入)
↓ ↓
└────→ 规划 ←→ 记忆(读取)
↓
工具调用 ←→ 外部世界
↓
行动执行 → 感知(反馈闭环)
关键依赖:
- 规划强依赖记忆:缺乏历史经验的规划是盲目的
- 工具调用约束规划:规划必须基于可用工具的能力边界
- 感知-行动形成闭环:执行结果反馈驱动下一轮迭代
评估标准(可量化)
| 维度 | 指标示例 |
|---|---|
| 感知准确性 | 意图识别F1、关键信息抽取完整率 |
| 规划合理性 | 任务完成率、步骤冗余度、replanning频次 |
| 工具调用成功率 | API调用成功率、参数正确率、工具选择准确率 |
| 端到端效果 | 任务完成时间、人工介入率、用户满意度 |
美团场景示例
外卖调度Agent中:感知(订单/骑手/路况实时数据)→ 记忆(历史调度策略效果)→ 规划(派单路径优化)→ 工具调用(骑手APP推送、地图API)→ 行动执行(派单指令下发),形成分钟级闭环。
口语版讲法(约4分钟)
- 一句话定位:本质是LLM到自主系统的能力映射
- 核心要素:感知、记忆、规划、工具调用、行动执行
- 依赖关系和评估标准
- 美团外卖调度案例
- 落地风险与可延伸点
这道题其实问的是,怎么把LLM的通用推理能力,拆成一套能自主解决复杂任务的专项能力模块。它跟纯文本生成不一样,不是被动响应,而是目标驱动下的主动决策和环境交互。
我通常会把Agent的基础能力拆成五个核心要素,但你别把它们看成并列的模块,更像是一个闭环流水线。先说感知,这是Agent理解外部世界的入口,比如解析用户意图、接入实时数据。然后是记忆,它分两个层次:短期工作记忆就是对话上下文,长期知识记忆靠向量库或者知识图谱来存经验。这里有个关键点,规划是强依赖记忆的,没有历史经验的规划就是瞎拆任务。规划本身是把目标拆成可执行步骤,我常用Chain-of-Thought或者树状搜索的思路,但落地时一定要动态replanning,因为现实任务经常变。规划完了就得调工具,这是工具调用,通过Function Calling跟外部系统交互,比如查API、发指令。最后是行动执行,把决策变成实际输出,比如提交事务或者推消息。执行结果再通过感知反馈回来,形成闭环。
这些能力不是孤立的。规划依赖记忆提供上下文,工具调用反过来约束规划,你只能规划现有工具能做的事。感知和行动必须闭环,不然Agent就瞎了。评估标准我一般看几个量化指标:感知准确性用意图识别F1和关键信息抽取完整率;规划合理性看任务完成率和replanning频次;工具调用成功率看API调用和参数正确率;端到端就看任务完成时间和人工介入率。
举个例子,美团外卖调度Agent。感知模块接入订单、骑手位置和路况的实时数据,记忆模块存历史调度策略的效果,规划模块做派单路径优化,工具调用调用骑手APP推送和地图API,最后行动执行下发派单指令。整个流程分钟级闭环。
不过这里有个常见失败场景,就是感知和记忆如果不同步,规划会基于错误信息做决策。比如路况数据延迟了,规划出来的路径就不准。所以上线我会特别关注感知数据的时效性和记忆的一致性,否则整个闭环都会崩。
说到这,其实还有一个更前沿的方向,Multi-Agent协作。不同Agent承担不同能力模块,比如一个专门感知,一个专门规划,但协调机制就变成了新挑战。这个点可能值得深入聊。
所以我会把Agent的基础能力看成一套工程化的能力映射,而不是简单的LLM包装。核心是闭环和依赖管理,评估必须量化,落地要警惕数据质量。
关键一句:感知和记忆不同步会导致规划基于错误信息,是常见失败场景
面试官还可能这样问
- 问法 1 · 场景切入
咱们做客服Agent,用户说“帮我查上个订单”,它得能记住之前聊了什么。你觉得一个Agent要具备哪些基础能力才能把这种事儿干好?往大了说,怎么定义它的“基础能力”,跟普通大模型有啥区别?
- 问法 2 · 层层追问
你觉得一个智能体要完成复杂任务,需要哪些基本功?……比如感知、规划这些,它们之间有没有依赖关系?……那怎么判断这些能力好不好用,能不能量化评估?
- 问法 3 · 直球架构
说说你对Agent基础能力的理解。列举核心要素,解释它们的作用、依赖关系,以及怎么设定可量化的评估标准。