长期记忆 (Long-term Memory)
执行控制逻辑
长期记忆:向量检索与知识图谱
执行环境管理
将高层目标分解为可执行步骤评估不同行动方案的代价与收益生成最优或满意解的行动序列处理动态环境下的重规划
多轮对话连贯性评分 4.5/5.0长期任务完成率提升 42%个性化推荐准确率 91%经验学习效率提升 38%
输出格式验证预期结果匹配参数自适应调整失败原因分析
设计3:性能优化
记忆系统性能评估
ExperienceReplay.periodic_review()
先生成完整计划,再逐步执行:Plan: Step 1: 查询用户画像 Step 2: 获取推荐候选集 Step 3: 排序并筛选 Step 4: 生成推荐话术 Step 5: 发送推荐Execute Step 1... ✅Execute Step 2... ✅Execute Step 3... ❌ (API超时)Replan: 用缓存数据替代...Execute Step 3 (revised)... ✅优点:全局视野、效率高。缺点:计划可能因环境变化而失效。
工具描述标准化(OpenAI格式)工具发现与注册机制工具调用权限控制工具组合与编排
知识图谱构建
在同一任务中实时学习将反馈转化为经验教训注入工作记忆(高优先级)指导后续步骤的决策
设计2:错误处理与鲁棒性
范式 3:Tree-of-Thought(思维树搜索)
向量检索准确率 92.3%知识图谱推理准确率 88.7%记忆召回率 89.5%用户满意度提升 40%
异常处理策略
反馈层的价值定位
实践 2:记忆的遗忘机制
反馈驱动的自我进化
工作记忆效率测试
SelfReflection._decide_action()
ExecutionEngine 类结构
execute_step 方法
时间衰减:6 个月前的对话权重减半冲突覆盖:用户说「我搬到上海了」,自动更新之前的「住在北京」主动清理:用户可以要求「忘记我的所有信息」
作品声明,参考来源微信公众号:https://mp.weixin.qq.com/s/Ve1E7L4qOQPapiRpDQcYYw作者:TinkingAgent
执行引擎核心架构设计
上下文压缩率 > 60%关键信息保留率 > 95%响应时间延迟 < 200ms任务完成率提升 35%
离线学习(Experience Replay)
1、过度规划:10 步能解决的事拆成 30 步解决办法:设置最大步骤数,鼓励简洁2、规划僵化:计划失败后不会灵活调整解决办法:实现渐进式 replan 而非全量重规划3、上下文窗口溢出:长计划的 prompt 超出上下文限制分层压缩,只保留当前层级+摘要
结果验证与调整
范式 1:ReAct(Reasoning + Acting)
感知核心技术:意图识别与多模态理解
Agent进化的关键驱动从单次执行中学习与改进避免能力停滞与固化实现持续性能优化
感知层
三种核心反馈类型
感知层在做什么?
InContextLearner.update_context()
信号量并发控制重试循环机制超时异常处理参数动态调整
工具层是 Agent 与外部世界交互的接口。没有工具,LLM 只能「说话」;有了工具,LLM 才能「做事」。工具的本质是:把 LLM 的语言能力转化为操作能力。
核心机制
1、用户明确提及:0.4,用户主动说的优先级最高2、任务相关性:0.3,与当前任务目标的相关程3、新颖性:0.2,已有记忆中不包含的信息4、时效性:0.1,越新的信息权重越高
最经典的 Agent 规划范式。每一步都是「思考→行动→观察」的循环:Thought: 我需要查用户的历史订单来了解偏好Action: search_orders(user_id=12345)Observation: 找到3个历史订单,都是电子产品...Thought: 用户偏好电子产品,推荐最新款...Action: recommend_product(category=\"electronics\
用户自然语言指令 → 解析意图、实体、约束多模态输入(图片、语音、视频) → 跨模态对齐、特征提取环境状态(API返回、文件内容、网页DOM) → 结构化、过滤噪声工具执行结果 → 解析返回值、识别错误
统一内部表示
规划层在做什么?
工作记忆:上下文窗口管理策略
信号量限制并发数异步任务调度资源竞争避免性能优化策略
步骤迭代执行依赖关系验证失败检测与重规划结果收集与返回
多模态记忆查询上下文相关记忆召回记忆置信度评估新旧记忆融合策略
嵌入模型选择与优化向量数据库集成元数据关联存储相似度检索算法
依赖关系检查步骤顺序调度并发执行控制结果验证机制
异步并行处理缓存中间结果增量式更新资源感知调度
永久性知识存储
基于LLM的摘要生成重要性评分排序结构化信息提取增量式更新策略
存储用户偏好与经验教训容量理论上无限生命周期为永久基于向量检索与知识图谱
记忆层的工程实践
核心组件设计
保留系统提示与最近对话压缩旧对话为结构化摘要动态重组上下文序列防止信息丢失与失真
方法 1:Reflexion(反思式学习)Agent 在任务失败后,生成自然语言形式的「反思笔记」,作为未来任务的参考。
反馈层
系统整体性能
计划与步骤执行流程
规划层核心功能
计划执行算法实现
常见踩坑
4种规划范式对比
MCP 的核心价值
用户自然语言指令 ↓ 解析意图、实体、约束多模态输入(图片、语音、视频) ↓ 跨模态对齐、特征提取环境状态(API返回、文件内容、网页DOM) ↓ 结构化、过滤噪声工具执行结果 ↓ 解析返回值、识别错误
压缩算法实现
结果验证(is_valid)目标进展评估(goal_progress)上下文一致性检查潜在异常检测
规划算法与技术
规划成功率:计划能完全执行的比例> 80%重规划次数:完成任务平均需要重新规划几次< 2步骤效率:实际步骤数 / 最优步骤数< 1.5x上下文利用:计划是否有效利用已有信息> 90%
反思流程
并发执行控制
组件层 | 控制层 | 管理层
SelfReflection.reflect()
自我反馈机制设计
核心职责
工程实践:感知层关键设计
工作记忆 (Working Memory)
信息来源与示例
把任务分成多个粒度层级,高层规划器做战略决策,底层规划器做战术执行:L0(战略层):完成Q3营销目标 → L1(策略层):制定内容策略 + 投放策略 + 转化优化 → L2(执行层):写文案 + 设置广告 + A/B测试 → L3(操作层):调API + 监控数据 + 调整参数 2026 年多 Agent 系统的主流架构:高层用大模型做决策,底层用专用模型或小模型做执行。
恢复与重规划
失败步骤记录经验记忆存储重规划触发条件替代方案生成
输入类型与处理
存储近期交互历史容量为最近N轮对话/K个任务生命周期跨轮次不跨会话支持会话内经验复用
多源异构数据归一化
向量记忆存储
工具层设计原则
1:最小权限:Agent 只获得完成任务所需的最小工具权限。2:幂等性:工具操作应该尽幂等,重复调用不会产生副作用。3:超时与熔断:每个工具调用必须有超时和熔断机制
实体关系抽取图数据库存储语义推理增强动态图谱更新
输入格式异常检测语义歧义消解上下文补全机制降级处理策略
滑动窗口与摘要压缩
决策与行动
execute_plan 方法
当前任务上下文管理
工作记忆 | 短期记忆 | 长期记忆
规划层的关键指标
实体与关系识别决策路径记录任务目标保持错误与成功标记
资源与状态管理
实践 1:记忆的重要性评分
将原始输入转化为结构化表示确保Agent理解正确(避免垃圾进垃圾出)为后续所有层提供可靠输入
对复杂推理任务,探索多条路径,选择最优:\t\t\t\t\t[目标:优化系统性能] / \\ [优化数据库] [优化应用层] / \\ / \\ [加索引] [分库分表] [缓存策略] [异步处理] ↓ ↓ ↓ ↓ 效果:高 效果:中 效果:高 效果:中 成本:低 成本:高 成本:低 成本:低 风险:低 风险:中 风险:低 风险:高 \\ / \\___最优路径: 加索引 + 缓存___/
会话级知识管理
设计1:输入归一化管道
短期记忆 (Short-term Memory)
记忆层
记忆检索与融合
规划层
长期记忆检索效果
并发与异常处理机制
关键信息保留机制
经验回顾与分析
容量受上下文窗口限制存储当前任务状态与中间结果生命周期为单次任务需实时压缩与摘要
范式 4:Hierarchical Planning(层级规划)
方法 3:Trajectory Optimization(轨迹优化)记录完整的任务执行轨迹,用强化学习优化策略。成功轨迹增强,失败轨迹抑制。
在线学习(In-Context Learning)
方法 2:Self-Play(自我对弈)两个 Agent 实例互相评测,通过对抗来提升能力。一个生成方案,另一个挑错。
环境反馈:工具/API返回值(如200/500)自我反馈:Agent自身评估与反思人类反馈:用户评价与直接指导
工具注册表集成记忆系统接口并发信号量控制执行结果容器
工具核心本质
工具发现:Agent 可以动态发现可用工具,不需要硬编码类型安全:严格的 JSON Schema 保证参数正确上下文管理:工具可以声明自己的上下文需求权限控制:工具可以声明权限等级,敏感操作需要人类确认
定期获取历史执行记录聚类分析失败模式提取可复用的规则与策略构建失败模式知识库
超时异常捕获工具执行异常依赖失败处理重试逻辑设计
执行层
记忆的三层架构模型
结果无效 → 重试(retry)检测到异常 → 调查(investigate)方向错误 → 重新规划(replan)一切正常 → 继续执行(continue)
范式 2:Plan-then-Execute(先规划后执行)
文本解析器(TextParser)图像解析器(ImageParser)音频解析器(AudioParser)API响应解析器(APIResponseParser)低置信度时请求用户澄清(阈值<0.7)
工具实例管理内存状态维护并发度配置超时控制策略