拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【Day 11】Agent做错了怎么办?让它自己检查

摘要try-except只能捕获代码崩溃发现不了逻辑错误。本文实现Reflexion模式执行后LLM自我评估不通过则反思错因并存入记忆带着反思重试。核心约80行免费运行。你让Agent算购物总价3本书每本45元、2支笔每支12元、1个书包88元。它调了calculate(3*452*12)返回159。代码没报错工具也调对了但结果是错的——漏了书包的88元3×452×12159加上书包才是247。try-except在这种情况下完全没用因为程序层面一切正常错的是逻辑。人遇到这种情况会怎么做做完检查一遍发现不对想想哪里错了重新算。Reflexion模式就是让Agent学会这件事。四步闭环Reflexion的思路特别朴素就四步循环通过不通过1.执行 Act选工具、传参、跑2.评估 EvaluateLLM检查结果对不对返回结果3.反思 Reflect错在哪下次怎么改反思存入记忆4.重试带着反思记忆重新执行关键在第三步和第四步之间反思不是用完就扔而是存进记忆下次执行时一起传给LLM。这样它不是盲目重试而是知道上次为什么错了换个方式。核心代码ReflexionAgent只有三个核心方法对应执行、评估、反思importjsonfromllm_clientimportLLMClientclassReflexionAgent:def__init__(self,max_attempts3):self.llmLLMClient(providerglm)self.max_attemptsmax_attempts self.reflections[]# 反思记忆跨尝试累积def_act(self,task):执行选工具并调用。如果有反思记忆附加到system prompt里systemTOOL_PROMPTifself.reflections:system\n之前的反思避免重复犯错\nfori,rinenumerate(self.reflections,1):systemf{i}.{r}\nrespself.llm.chat_json(f任务{task}\n选工具完成。,system_promptsystem,temperature0.1)decisionjson.loads(resp)returnexecute_tool(decision.get(tool),decision.get(args,{}))def_evaluate(self,task,result):评估让LLM判断结果对不对promptf评估执行结果是否正确完整。 任务{task}结果{result}返回JSON{{passed: true/false, reason: 理由}}returnjson.loads(self.llm.chat_json(prompt,temperature0.1))def_reflect(self,task,result,eval_result):反思分析错因生成改进策略promptf任务执行失败分析原因并给出改进建议。 任务{task}结果{result}失败原因{eval_result.get(reason)}用2-3句话总结错在哪下次怎么做不要JSON。returnself.llm.chat(prompt,temperature0.3)defrun(self,task):forattemptinrange(1,self.max_attempts1):print(f\n── 第{attempt}次尝试 ──)resultself._act(task)evaluationself._evaluate(task,result)ifevaluation.get(passed):print(f✅ 第{attempt}次通过)returnresult reflectionself._reflect(task,result,evaluation)self.reflections.append(reflection)print(f❌ 未通过 → 反思{reflection[:80]}...)returnresult# 达上限仍未通过返回最后一次结果max_attempts3防止死循环。真正起作用的是self.reflections列表——第一次失败后反思被追加进去第二次执行时LLM能看到第一次的反思不会在同一个坑里摔两次。工具注册和执行部分保持简单importdatetime TOOLS{calculate:{func:lambdaexpr:str(eval(expr)),desc:数学计算参数expression为算术表达式,},get_time:{func:lambda:datetime.now().strftime(%Y-%m-%d %H:%M:%S),desc:获取当前时间无需参数,},}TOOL_PROMPT可选工具\n\n.join(f-{n}:{t[desc]}forn,tinTOOLS.items())TOOL_PROMPT\n返回JSON{tool:名,args:{}}defexecute_tool(name,args):ifnamenotinTOOLS:returnf未知工具:{name}returnTOOLS[name][func](**args)真实运行过程agentReflexionAgent(max_attempts3)resultagent.run(计算购物总价3本书每本45元2支笔每支12元1个书包88元。用calculate工具。)第一次尝试LLM写的表达式漏了书包── 第1次尝试 ── tool: calculate args: {expression: 3*452*12} 结果: 159 评估: ❌ 不完整。漏了书包的88元3×452×12159加上书包应为247。 反思: 表达式漏了书包应该写成3*452*1288结果才是完整总价247。第二次尝试反思记忆被传入LLM看到了上次错在哪── 第2次尝试 ── tool: calculate args: {expression: 3*452*1288} 结果: 247 评估: ✅ 正确。1352488247。 第2次尝试通过说明上面是第一次漏项→反思→补全的典型流程示意。实际运行时 LLM 也可能第一次就写对比如直接给出完整表达式3*452*1288247此时评估直接通过、不进入反思——反思只在结果不对时才触发。注意第二次的system prompt里多了一段之前的反思避免重复犯错 1. 表达式漏了书包的88元应该写成3*452*1288...这就是Reflexion和简单重试的本质区别。简单重试是把同样的事情再做一遍大概率还错Reflexion是带着经验教训做错一次学一次。实际运行效果try-except和Reflexion的区别维度try-exceptReflexion发现什么代码崩溃、异常逻辑错误、结果不对怎么处理捕获异常、返回错误信息LLM分析原因、生成改进策略重试方式原样重试或跳过带反思记忆重试换策略能发现除零、文件不存在算错数、选错工具、参数语义错两者不是替代关系。try-except兜住代码层面的崩溃Reflexion兜住逻辑层面的错误。完整版里两者配合使用工具函数内try-except防崩溃Agent外层Reflexion检查逻辑。完整版包含5个工具、置信度判断简单错误不浪费反思、人工确认机制、反思停滞检测连续两次反思相同则提前终止放在CSDN下载区。GLM-4.7-Flash永久免费200K上下文注册地址https://open.bigmodel.cn/下一篇Day12讲工具生态每加一个工具就要改代码重启用注册中心实现插件化。本文由「梅雅达编程笔记」原创首发CSDN。AI Agent实战系列共18篇从Function Calling到多Agent协作全程用免费模型GLM-4.7-Flash点个关注不迷路✨CSDN博客https://blog.csdn.net/2601_96428997/
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门