跳到正文

Agent 必备基础能力有哪些?

感知、规划、工具调用、记忆管理如何协作完成复杂任务

原题:从技术角度看,一个智能体(Agent)应具备哪些基础能力才能完成复杂任务?例如感知、规划、工具调用、记忆管理等,并说明这些能力之间的协作关系。

Agent · 美团真题

30 秒回答

  1. 能清晰列举Agent四大核心能力(感知、规划、执行/工具调用、记忆)
  2. 能说明各能力的职责边界
  3. 能解释能力间的协作流程(如规划→调用→观察→再规划的循环)
  4. 能结合具体框架(如ReAct)说明

回答与解析

答案要点

  • 能清晰列举Agent四大核心能力(感知、规划、执行/工具调用、记忆)
  • 能说明各能力的职责边界
  • 能解释能力间的协作流程(如规划→调用→观察→再规划的循环)
  • 能结合具体框架(如ReAct)说明
  • 能提及反思/自我修正机制

Agent完成复杂任务需要四大核心能力,形成"感知→规划→执行→记忆"的闭环:

1. 感知(Perception)

  • 接收多源输入:用户指令、环境状态、工具返回结果
  • 关键:将非结构化信息转化为模型可理解的上下文

2. 规划(Planning)

  • 任务拆解:把复杂目标分解为可执行的子步骤
  • 策略选择:决定下一步动作(调用工具/直接回答/继续推理)
  • 常用模式:ReAct(推理+行动交替)、CoT(链式思考)、ToT(树状搜索)

3. 工具调用(Tool Use / Action)

  • Function Calling:结构化输出工具名和参数
  • 执行反馈:获取工具返回后,判断任务是否完成或需调整

4. 记忆(Memory)

  • 短期记忆:当前对话上下文(受限于上下文窗口)
  • 长期记忆:向量数据库存储历史经验、用户偏好、领域知识

协作关系——以ReAct为例:

Thought(规划)→ Action(调用工具)→ Observation(感知结果)→ Thought(重新规划)...

循环直至任务完成。记忆模块贯穿全程:短期记忆维护当前轨迹,长期记忆支持知识检索。

关键设计点:反思机制(Self-reflection)——执行失败后能回溯重规划,而非简单报错。

口语版讲法(约4分钟)

  • 一句话定位:这道题本质考的是Agent在真实落地中如何组织能力
  • 感知和记忆:数据入口与缓存,边界在哪里
  • 规划与工具调用:ReAct循环和反思机制
  • 协作关系:以订单异常处理为例串起来
  • 落地风险与取舍:别把Agent当神,要防死循环和幻觉

这道题其实问的是,一个Agent要完成复杂任务,到底需要哪些底层能力,以及这些能力怎么配合才能跑得起来。很多人喜欢把感知、规划、工具调用、记忆一个一个列出来,但我觉得更重要的是理解它们之间的协作关系,就像流水线一样,缺一个环节就会卡住。

先说感知和记忆。感知就是Agent的“眼睛和耳朵”,接收用户指令、环境状态、工具返回的结果,把非结构化信息转化成模型能理解的上下文。记忆呢,分短期和长期。短期就是当前对话上下文,受限于上下文窗口;长期靠 Vector Database 存历史经验、用户偏好、领域知识。这里有个边界划分:感知负责“当下看到什么”,记忆负责“过去知道什么”。落地时,如果任务依赖历史交互,比如客服要查用户之前的退款记录,那长期记忆就是必须的;如果只是单次问答,短期记忆就够了,没必要每次都去向量库检索,否则延迟和成本都上去了。

再讲规划和工具调用。规划负责把复杂目标拆成可执行的子步骤,决定下一步是调用工具还是直接回答。常用模式是 ReAct,也就是推理和行动交替。工具调用就是 Function Calling,结构化输出工具名和参数,然后获取反馈。这里有个关键点:规划不是一次性的,而是循环的。比如Thought→Action→Observation→Thought,直到任务完成。如果执行失败,还需要反思机制,也就是回溯重规划,而不是简单报错。

举个例子,订单异常处理。用户说“我昨天买的手机没收到,但物流显示已签收”。Agent先感知到这句话,从短期记忆里知道这是售后场景。然后规划:第一步,调用物流查询工具查实际配送记录;第二步,调用订单系统查签收人;第三步,根据结果决定是补发还是退款。工具返回物流记录显示“代收点签收”,Agent再规划:调用客服工具发短信提醒用户去代收点取件。整个过程,短期记忆维护当前轨迹,长期记忆可能存了用户偏好“喜欢放快递柜”,但这里没用上,因为场景不依赖历史。如果工具调用失败,比如物流接口超时,Agent会反思:重试一次,或者换备选工具。

协作关系说白了就是:感知给规划提供原料,规划决定调什么工具,工具返回结果又变成新的感知,记忆则贯穿全程做上下文支撑。就像做菜,感知是看菜谱和食材,规划是决定先切菜还是先热油,工具调用是动手操作,记忆是记住刚才放了多少盐。

这里有个落地风险我得提一下。很多人把Agent想得太万能,但实际中常见失败场景是规划陷入死循环,或者工具调用返回的数据格式不对导致幻觉。所以上线前我会特别关注两点:一是给规划加最大步数限制和超时退出,二是对工具返回做格式校验和置信度过滤。我更倾向于把Agent看成“带策略的自动化流程”,而不是一个会思考的机器人,这样设计边界更清晰,出问题也好排查。

总结一下,Agent的核心能力是感知、规划、工具调用、记忆,但真正让它们生效的是协作循环和反思机制。面试官如果感兴趣,我可以再聊聊多Agent协作或者如何用 Self-RAG 让模型自己学会反思。

关键一句:Agent落地中常见的失败场景是规划死循环或工具返回导致幻觉,需要加步数限制和格式校验

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你做一个订单客服Agent,用户说‘帮我查昨天那单,然后退款,再重新下单’。这听起来简单,但Agent得自己拆步骤、调API、记状态。你觉得一个Agent要具备哪些基础能力才能把这一串活儿干完?

  2. 问法 2 · 层层追问

    你觉得一个Agent要完成复杂任务,最关键的能力是什么?……那它怎么知道下一步该干啥?……如果调用工具后结果不对,它能自己纠正吗?……这些能力之间怎么配合才能形成一个闭环?

  3. 问法 3 · 直球架构

    从技术架构角度,一个能够自主完成复杂任务的Agent,你认为它必须拥有哪几项核心能力?请具体列出,并说明这些能力之间如何协作,比如参考ReAct这样的框架。

同模块相关题目