跳到正文

Agent 基础能力怎么定义?

感知、规划、工具调用等核心要素的依赖与评估标准

原题:如何定义智能体(Agent)的‘基础能力’?请列举并解释构成 Agent 基础能力的核心要素(如感知、规划、工具调用等),并讨论这些能力之间的依赖关系与评估标准。

评估与监控 · 美团真题

30 秒回答

  1. 明确定义Agent"基础能力"的边界(与通用LLM能力的区分)
  2. 列举核心要素并解释各自作用(感知、记忆、规划、工具调用、行动执行)
  3. 阐述能力间的依赖关系(如规划依赖记忆、行动依赖工具调用)
  4. 给出可量化的评估标准(非泛泛而谈)

回答与解析

答案要点

  • 明确定义Agent"基础能力"的边界(与通用LLM能力的区分)
  • 列举核心要素并解释各自作用(感知、记忆、规划、工具调用、行动执行)
  • 阐述能力间的依赖关系(如规划依赖记忆、行动依赖工具调用)
  • 给出可量化的评估标准(非泛泛而谈)
  • 结合美团业务场景举例说明

Agent"基础能力"的定义

Agent的基础能力是指将LLM的通用推理能力转化为自主解决复杂任务所需的专项能力模块,区别于纯文本生成的"被动响应",强调目标驱动下的主动决策与环境交互


五大核心要素

要素 核心作用 关键实现
感知 理解环境状态与任务输入 多模态输入解析、用户意图识别、实时数据接入
记忆 维持上下文与经验积累 短期工作记忆(对话历史)+ 长期知识记忆(向量库/知识图谱)
规划 将目标拆解为可执行步骤 任务分解(CoT/ToT)、动态 replanning、依赖关系管理
工具调用 扩展能力边界,与外部系统交互 Function Calling、API编排、工具选择策略
行动执行 将决策转化为实际输出 代码执行、事务提交、多轮确认机制

能力依赖关系

感知 → 记忆(写入)
  ↓      ↓
  └────→ 规划 ←→ 记忆(读取)
           ↓
        工具调用 ←→ 外部世界
           ↓
        行动执行 → 感知(反馈闭环)

关键依赖

  • 规划强依赖记忆:缺乏历史经验的规划是盲目的
  • 工具调用约束规划:规划必须基于可用工具的能力边界
  • 感知-行动形成闭环:执行结果反馈驱动下一轮迭代

评估标准(可量化)

维度 指标示例
感知准确性 意图识别F1、关键信息抽取完整率
规划合理性 任务完成率、步骤冗余度、replanning频次
工具调用成功率 API调用成功率、参数正确率、工具选择准确率
端到端效果 任务完成时间、人工介入率、用户满意度

美团场景示例

外卖调度Agent中:感知(订单/骑手/路况实时数据)→ 记忆(历史调度策略效果)→ 规划(派单路径优化)→ 工具调用(骑手APP推送、地图API)→ 行动执行(派单指令下发),形成分钟级闭环。

口语版讲法(约4分钟)

  • 一句话定位:本质是LLM到自主系统的能力映射
  • 核心要素:感知、记忆、规划、工具调用、行动执行
  • 依赖关系和评估标准
  • 美团外卖调度案例
  • 落地风险与可延伸点

这道题其实问的是,怎么把LLM的通用推理能力,拆成一套能自主解决复杂任务的专项能力模块。它跟纯文本生成不一样,不是被动响应,而是目标驱动下的主动决策和环境交互。

我通常会把Agent的基础能力拆成五个核心要素,但你别把它们看成并列的模块,更像是一个闭环流水线。先说感知,这是Agent理解外部世界的入口,比如解析用户意图、接入实时数据。然后是记忆,它分两个层次:短期工作记忆就是对话上下文,长期知识记忆靠向量库或者知识图谱来存经验。这里有个关键点,规划是强依赖记忆的,没有历史经验的规划就是瞎拆任务。规划本身是把目标拆成可执行步骤,我常用Chain-of-Thought或者树状搜索的思路,但落地时一定要动态replanning,因为现实任务经常变。规划完了就得调工具,这是工具调用,通过Function Calling跟外部系统交互,比如查API、发指令。最后是行动执行,把决策变成实际输出,比如提交事务或者推消息。执行结果再通过感知反馈回来,形成闭环。

这些能力不是孤立的。规划依赖记忆提供上下文,工具调用反过来约束规划,你只能规划现有工具能做的事。感知和行动必须闭环,不然Agent就瞎了。评估标准我一般看几个量化指标:感知准确性用意图识别F1和关键信息抽取完整率;规划合理性看任务完成率和replanning频次;工具调用成功率看API调用和参数正确率;端到端就看任务完成时间和人工介入率。

举个例子,美团外卖调度Agent。感知模块接入订单、骑手位置和路况的实时数据,记忆模块存历史调度策略的效果,规划模块做派单路径优化,工具调用调用骑手APP推送和地图API,最后行动执行下发派单指令。整个流程分钟级闭环。

不过这里有个常见失败场景,就是感知和记忆如果不同步,规划会基于错误信息做决策。比如路况数据延迟了,规划出来的路径就不准。所以上线我会特别关注感知数据的时效性和记忆的一致性,否则整个闭环都会崩。

说到这,其实还有一个更前沿的方向,Multi-Agent协作。不同Agent承担不同能力模块,比如一个专门感知,一个专门规划,但协调机制就变成了新挑战。这个点可能值得深入聊。

所以我会把Agent的基础能力看成一套工程化的能力映射,而不是简单的LLM包装。核心是闭环和依赖管理,评估必须量化,落地要警惕数据质量。

关键一句:感知和记忆不同步会导致规划基于错误信息,是常见失败场景

面试官还可能这样问

  1. 问法 1 · 场景切入

    咱们做客服Agent,用户说“帮我查上个订单”,它得能记住之前聊了什么。你觉得一个Agent要具备哪些基础能力才能把这种事儿干好?往大了说,怎么定义它的“基础能力”,跟普通大模型有啥区别?

  2. 问法 2 · 层层追问

    你觉得一个智能体要完成复杂任务,需要哪些基本功?……比如感知、规划这些,它们之间有没有依赖关系?……那怎么判断这些能力好不好用,能不能量化评估?

  3. 问法 3 · 直球架构

    说说你对Agent基础能力的理解。列举核心要素,解释它们的作用、依赖关系,以及怎么设定可量化的评估标准。

同模块相关题目