拓冰建站拓冰建站
首页 / 资讯中心 / 正文

LLM进化论:Agent = Model + Harness

LLM 当“大脑”有了“肉身”如果把大语言模型比作一颗泡在罐子里的大脑——它能思考、能推理、能生成代码——但你让它凌晨三点去修一个挂掉的CI任务它做不到。不是它不够聪明是它没有“肉身”。Harness就是给这颗大脑装上肉身的那套系统。一、Harness 和 Agent到底什么关系先给结论Agent Model Harness。这个公式意味着什么模型是“大脑”Harness是“身体、手脚和工具”。没有Harness模型只能思考无法行动。更精确地说Agent由三层构成层级是什么负责什么Model模型裸的大语言模型GPT、Claude、DeepSeek等推理、决策、生成Scaffold脚手架模型“看到”的一切系统提示词、工具描述、输出格式定义行为边界和身份Harness线束驱动模型运行的执行层调用模型、执行工具、判断停止、处理错误 日常讨论中人们常把 Scaffold 和 Harness 打包统称为 Harness。重点不是咬文嚼字而是理解模型只是Agent的一部分。同一个模型被不同的Harness包起来体验可以完全不同。反过来同一个Harness换个更强的模型体验也会提升。这也是为什么黄仁勋会说“未来的公司会把越来越多能力建在Harness上。”二、为什么要有 Harness——裸模型的三道坎一个“裸模型”在生产环境里根本跑不起来。原因有三1. 没有记忆——操作者一关标签页记忆全没。一个真正的工程任务跨好几天没有任何一次LLM调用能hold住这个状态。2. 不会反应——外部世界变了它不知道。reviewer下午四点发了条评论、CI被搞挂了Agent必须被事件唤醒而不是傻等。3. 不会自救——Agent push了一个commitCI炸了或者session中途过期整条pipeline静默死亡。解决这些问题的全是Harness的工程活儿。三、Harness 和 Agent Framework 的区别别搞混了很多人把Harness和Agent Framework混为一谈它们是不同层面的概念Agent Framework框架Harness线束解决什么问题“如何开发一个Agent”“如何让一个Agent长期可靠地运行”类比招聘手册——教你怎么创建员工企业管理系统——安排任务、提供工具、监督执行、保存经验状态需要开发者组装开箱即用人类只需提供目标Framework像是“工具箱”Harness则是“操作系统”——Agent时代大模型好比芯片Harness就是那个操作系统。四、Harness 到底长什么样——三层架构拆解一个完整的Harness通常包含三层第一层执行能力层Action Layer——给模型“手脚”为模型提供行动能力文件系统操作增删读写、操作系统访问执行命令、代码解释器运行Python/Node.js。⚠️ 关键陷阱工具配置必须与Agent角色绑定——代码审查Agent只能配置只读工具不能拥有删除权限。第二层上下文环境层Context Layer——给模型“记忆”管理模型工作时的上下文和状态KV Cache模型推理的缓存状态Memory长期存储用户偏好、历史经验上下文卸载窗口满时写入文档供后续加载第三层治理编排层Orchestration Layer——多Agent的“指挥官”多Agent协同时的组织问题任务如何分配写代码的和测试的怎么协作哪些模块可以并行权限如何治理测试Agent能不能直接改代码五、四种 Harness 架构同一个任务四种玩法同一个LLM、同一个任务不同架构的Harness可能让成功率相差3到5倍。以“重构用户服务将单体拆分为三个独立服务”为例架构类型怎么玩结果循环驱动型LoopAgent进入ReAct循环边想边做30轮后上下文爆炸关键约束被淹没直接改了接口签名下游全挂图执行型Graph任务拆成8个节点每个节点保存检查点第5个节点失败从检查点恢复无需重来微内核型Microkernel控制平面监控token、轮次超预算时暂停等人工审核成本可控有人把关多Agent型MultiAgent4个专业Agent并行执行总耗时不到单Agent的1/3 目前主流Harness收敛为两大家族家族A循环Harness控制流交给模型工程做厚“壳”——代表Claude Code、Codex CLI家族B图运行时控制流写进代码建模为显式图——代表LangGraph、Microsoft Agent Framework一个能“自己干活”的Harness长什么样案例1生产环境跑了好几个月的多Agent管线一个真实团队在Claude Code上面搭了一套Harness已经连续运转了几个月起点一个Slack频道每周收约30张工单每张都需要排查并在五个仓库之一改代码Harness三层职责Investigate排查——新工单出现跨仓库收集上下文贴结构化分析Fix修——操作者批准后开MR回reviewer评论盯CICI挂了就修Self-improve自我进化——每个关闭的case都被复盘总结实际效果能在凌晨回Slack、自己修挂掉的CI、记住reviewer的评论案例2WorkBuddy——基于国产模型的可用Agent产品WorkBuddy的Harness工程重点围绕Context Engineering如何选择和组织上下文Harness Engineering前馈、反馈、权限、验证、编排、可观测性结果让Agent不只是能执行任务而是更稳定、更可控地完成任务案例3金融研发的Harness Engineering体系腾讯云在金融研发中构建了三层递进的AI Coding工程体系Harness层系统层负责控制流、约束与反馈核心动作建设反馈回路目标解决大模型“不可靠/不可控”问题关键数据同一个模型在不同Harness配置下任务完成率最多可以相差27.4个百分点。不换模型只调整外围执行框架结果就能差出近三成。七、怎么从零开始落地HarnessStep 1先搭最小可用循环一个Harness最核心的就是一个while循环whilenotdone:prompt组装提示(系统提示工具列表历史当前任务)response调用LLM(prompt)ifresponse包含工具调用:result执行工具(response.tool_call)把result塞回上下文else:输出最终答案 doneTrue这就是最简Harness的核心——调用模型 → 执行工具 → 观察结果 → 继续或停止。Step 2逐步加厚Harness从最简循环开始逐步叠加会话持久化让Agent跨会话记住东西权限与审批敏感操作需要人工确认钩子Hook任务完成后的自动处理子Agent复杂任务分拆可观测性每一步都有日志可追溯Step 3用工程文档“锁住”行为企业内部落地Harness时通过AGENTS.md、ARCHITECTURE.md等规范文档管控编码AgentAGENTS.mdAgent唯一可信行为总纲——产品目标、目录结构、完成标准ARCHITECTURE.md系统架构骨架效果Agent不会随意变更技术栈所有开发动作留有文档记录结语模型决定上限Harness决定你能拿到多少2026年Agent工程的重心已经从“框架”转移到了“Harness执行壳”。模型决定上限Harness决定你能拿到上限的百分之多少。大模型已经够强了可以参与研发交付。但没有Harness它充其量是个高级玩具有了Harness它才能成为研发链路中可靠的协作者。程序员的核心价值正在迁移从“亲手写出每一行代码”转向“定义目标、卡住边界、掌控节奏、验收结果”。而这套转变的前提就是先建好Harness。 动手时间如果你心动了建议马上做这三件事手写一个最简Agent循环——不用任何框架就一个while循环 模型API调用给你的Agent加一个工具——比如读写文件、执行命令感受“模型工具”的威力记录每一次失败——思考怎么通过Harness的“重试校验恢复”机制来提高成功率Harness不是技术债是你未来AI应用的护城河。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门