AI不好用?先分清是循环、框架还是上下文哪层出了问题

三个「工程」,其实是一句话的三层展开
最近围绕 AI 智能体的讨论里,出现了三个都带「工程」二字的概念:循环工程(Loop Engineering)、框架工程(Harness Engineering)、上下文工程(Context Engineering)。很多人第一反应是——这到底是三个东西,还是同一件事换了三种说法?
答案是:它们是同一句话在三个不同层次上的展开。这句话就是——「模型不是产品,围绕模型搭建的那套系统才是产品」。
把这三层拼在一起,会得到一张从外往里收束的地图。理解这张图最大的价值,不在于记住术语,而在于当你的 AI「不好用」时,你能迅速判断:这到底是哪一层出了问题,该去哪一层修。
循环层:管节奏,让 AI 自己跑起来
循环工程的核心观点来自 Andy Osmedie:别再亲自一句句提示 AI,你要设计一套替你提示它的系统。 循环就是一个递归的目标——把目的定好,让 AI 自己接力,直到达成为止。
Claude Code 的负责人 Boris Cherney 说得更直白:「我已经不亲自提示 Claude 了,我的工作就是写循环。」搭一个循环需要五个要素:自动化工作流、技能、连接器、子智能体,外加一个落在硬盘上的记忆。
循环工程根植于 AI 智能体架构的核心设计模式——ReAct(Reasoning + Acting)循环。这一架构由普林斯顿大学 2022 年提出,让模型在每一步推理后执行动作、观察结果、再继续推理,形成自驱动的迭代闭环。现代智能体框架如 LangGraph、AutoGen、CrewAI 都在此基础上实现了多智能体协作和子任务分发。「记忆落到硬盘」对应的是智能体记忆架构中的「长期记忆(Long-term Memory)」层,区别于仅存在于单次对话的「工作记忆(Working Memory)」。代码仓库作为外部持久化存储,天然具备版本控制、变更追踪等特性,弥补了大语言模型**无状态(stateless)**的本质缺陷——这正是循环层能持续运转的技术根基。

为什么记忆要落到硬盘、落到代码仓库?因为 AI 会忘,但代码仓库不会。这是循环层能够持续运转的关键——它需要一个不依赖模型短期记忆的外部锚点。
用工厂来打比方,循环就是流水线:管的是节奏——什么时候开工、任务怎么排、做完了谁来验收。
框架层:管环境,配置往往比模型更重要
框架工程同样来自 Andy Osmedie 的定义:一个智能体 = 模型 + 你围着模型搭的一切(提示词、工具、钩子、沙箱)。
这一层最重要的结论是:一个普通模型配上好框架,能打败一个顶级模型配上烂框架。 这不是嘴上说说,而是有数据支撑的——在 Terminal Bench 上,某个模型在模型本身完全不动、只改框架的情况下,排名从三十名开外冲进了前五。
Terminal Bench 是专门评测 AI 智能体在终端环境下完成工程任务能力的基准测试集,测试项目涵盖文件操作、代码调试、系统配置等真实工作场景,其评测结果能较好地反映「模型+框架」组合的实际工程能力,而非模型的孤立推理能力。框架层的核心组件包括:提示词模板(Prompt Templates)、工具调用接口(Tool Use/Function Calling)、钩子系统(Hooks,如执行前后的校验逻辑)、沙箱环境(Sandbox,如容器化隔离执行环境),以及近期兴起的 MCP(Model Context Protocol,由 Anthropic 主导的开放工具互联标准)。这些组件共同构成了模型与真实世界交互的「适配层」,决定了模型能力能被释放多少百分比——这也是为何同样底层模型、不同工具用起来差距悬殊的根本原因。

所以框架层的核心结论是:很多时候这不是模型问题,是配置问题。 用工厂来比方,框架是工位:管的是环境——工具怎么摆、护栏在哪里、出错了怎么兜底。工位没打好,流水线再聪明也白搭。
上下文层:管注意力,不是塞满而是策展
上下文工程来自 Anthropic 官方的说法:它是框架里单点杠杆最高的那一层。它管的是——模型每一步推理时,到底让哪些信息进入它有限的注意力窗口。
上下文工程的理论基础来自 Transformer 架构的注意力机制(Self-Attention)。现代大语言模型的上下文窗口(Context Window)虽已从最初的 4K Token 扩展至 200K 甚至 100 万 Token,但研究一再表明**「Lost in the Middle」现象依然存在——模型对上下文首尾的信息处理更准确,对中段信息容易忽视或混淆。这意味着窗口大小与实际可用信息量并不线性对应,单纯堆砌内容并不能提升推理质量,反而会稀释信噪比。策展(Curation)在工程上对应 RAG(检索增强生成)、动态上下文压缩、记忆摘要等技术手段,本质是在有限的注意力预算(Attention Budget)**内最大化信息密度。Token 不只是长度的度量,更是模型推理成本与质量的核心计量单位。
这里的关键认知是:窗口再大,能塞和该塞是两回事。 一句话总结——不是塞满,而是策展(curation)。

用工厂比方,上下文是工人此刻手里的那张图纸:管的是这一步他眼睛里到底看着什么。工位再好,图纸上写满废话,活照样干砸。
三层地图:对号入座,快速定位问题所在
把你平时接触的工具对个号,这张图会更清楚:
- 上下文层:你每天敲给 AI 的那条消息、贴进去的那段资料。人人都在这一层,只是多数人没意识到自己在做策展。
- 框架层:你装的 Claude Code、Cursor 这些工具,连同里面的规则文件、MCP、钩子。底层模型有时是同一个,用起来却差很多,差的就是这一层。
- 循环层:定时自己起来跑任务、自己排进度、自己写记录的那套系统。大部分人还没到这一层,这很正常。
AI不好用时,三层的病症状完全不同
这张地图最实用的地方,是让你在 AI 不好用时先分清是哪一层出了问题:

- 同一个错反复犯,上次踩的坑这次又踩 → 框架层的问题。缺的是机制,要把每一个失败变成一条永久规则,而不是「重试一下」就算了。
- 资料塞得越多反而越糊涂,长对话越聊越笨 → 上下文层的问题,也叫「上下文腐烂」(Context Rot)。这一现象描述的是随着对话轮次增加,无关信息不断积累、注意力预算被低价值内容占满,导致推理质量持续下降的过程。从机制上看,每一轮对话都会将历史消息原封不动地追加进上下文窗口,早期的闲聊、已过期的指令、错误的中间结论都会持续占用宝贵的 Token 配额,同时增加模型在「中段」丢失关键信息的概率。工程上的对策包括:定期对长对话做摘要压缩(Summarization)、使用**滑动窗口(Sliding Window)策略只保留最近 N 轮、或通过外部向量数据库实现语义检索(Semantic Retrieval)**替代全量上下文传递。注意力预算被填满了,药方是做减法而不是加法。
- 所有活都得你亲自盯着,你一走它就停 → 循环层压根没搭起来。
- 它自己跑得欢,却说不清交付的东西对不对 → 也是循环层的问题。记住这句话:完成是一个声明,不是一个证明。
模型变强后,哪一层会消失?
一个值得思考的问题是:模型持续变强之后,这三层哪个会消失?答案是——都不会,但方式很不一样。
- 框架是流动的:它的每个组件都编码着一个「关于模型做不到什么」的假设。模型变强了,旧部件该拆,但新需求又得搭新的。它永远在换零件,但永远存在。
- 上下文这层最难消失:注意力窗口的限制是 Transformer 架构层面的问题,窗口再大也「多则乱」。策展是一门永久的手艺。即便未来出现突破性的记忆架构,「向模型传递什么信息、如何组织信息」的工程问题本身不会消失,只会迁移到新的形式上。
- 循环这层最不会消失的是验证:验证永远在你身上,工具越自动,你的判断力反而越值钱。
入门建议:从里往外打地基
如果你想系统上手 AI 智能体,建议倒着来,从内层往外走:
- 先练上下文:哪怕只用网页聊天,学会「少塞、塞对」,效果立竿见影。
- 再打框架:建一个规则文件,把自己踩过的每个坑积累进去。
- 最后才是循环:让整套东西自己跑起来。
别一上来就追求全自动——地基是从你自己往外打的。三层读完最大的收获,仍然是那句话:模型不是产品,围绕模型的那套系统才是。而这套系统,最终要落回到你自己身上。
核心要点
核心要点
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。