返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

2026循环工程报告

提示词工程正在让位于循环工程——当AI Agent从单次对话走向持续作业,真正的效率不再来自更长的提示词,而是来自更少轮次得到可证明的结果。清新研究团队这份报告系统定义了循环工程的完整架构:从Loop Stack六件套到11种工程模式,从9个原创设计概念到三条生产底线,为构建可持续的Agent工作流系统提供了完整的方法论框架。

核心判断:循环工程是提示词工程的系统化

循环工程出现的根本原因是模型能力、工具生态与长任务界面三股力量的同时成熟。大模型不再仅仅“能对话”,而是“能调用工具、能执行长任务、能持续运行”。提示词没有消失,而是进入了技能(Skills)、规格(Specs)、评估(Evaluators)和停止条件(Stop Conditions)的更系统化形态。循环工程的核心结论是:循环工程是提示词工程的系统化。它不再追求单次对话的完美输出,而是追求构建一个能够持续运行、自我修正、产出可验证结果的作业系统。Build the loop, stay the engineer——Agent负责执行,循环可以提示Agent,但工程判断不能外包。

Loop Stack六件套:构建可持续作业系统的产品底座

循环工程需要一套完整的产品能力底座。Automations(心跳)——负责定时、事件或目标驱动地唤醒Agent,好的心跳不只是频率,而是知道何时不必打扰。Worktrees(隔离层)——多Agent并行必须先解决文件冲突,每个并行Agent需要独立工作区。Skills(项目知识)——SKILL.md让项目知识外化,记录可复用流程,减少重复粘贴长说明的成本。Connectors(外部触手)——MCP/插件让循环触达真实业务系统。Triage(审查缓冲区)——把后台发现变成可管理收件箱,归档、修复、交接。Memory(记忆)——Agent会忘,但仓库不会,状态不应只留在上下文中。六件套合成一条从心跳到记忆的可持续作业系统。

三条底线与11种模式:从技术可行到生产可用

六件套零件不够,还需要三条底线决定循环是否可生产。预算——控制每轮可消耗的token数、工具调用次数和总运行成本。权限——最小权限原则,默认只给当前任务需要的工具。停止条件——每条Loop启动前先写清楚验收标准,完成不是声明而是证据。11种典型循环模式覆盖从低风险到高风险的全谱系:CI失败修复Loop(最稳的首条)、PR评论处理Loop、依赖升级Loop、文档漂移Loop、上线验证Loop、缺陷回收Loop、技术债清理Loop、设计一致性Loop、安全修复Loop(高风险人类门控)、Backlog Triage Loop、Agent Improvement Loop。

9个原创概念:循环工程的理论骨架

报告提出了九个原创设计概念。Loop Kernel——循环像一个微型操作系统。Proof-of-Done——完成是证据,不是声明。Repo Memory——状态不应只留在上下文,长期记忆写入仓库。No-Gate Evaluator——循环必须有能说“不”的角色。Triage Buffer——把后台发现变成可管理收件箱。Loop Ledger——循环要像服务一样记账。Worktree Fleet——并行不是开更多窗口,而是管理舰队。Entropy Janitor——循环不只生成代码,也要删除复杂度。Engineer Seat——人必须保留工程师席位。

风险治理与运营成熟度:从个人终端走向组织资产

五大核心风险:自我确认(模型把半成品当完成)、上下文腐烂(长会话不等于长期记忆)、权限扩散(连接器越强边界越重要)、成本黑洞(每一轮都是推理和工具执行)、理解债(没读过的代码越多系统越陌生)。六大治理原则:最小权限、工具网关、SSDF化、AIRMF化、人类交接、可关闭。运营模型要求每条循环都像服务一样登记,集中管理,按团队、仓库、风险级别过滤。成熟度模型按能力层级推进,落地不应按时间强推,而应按能力成熟度推进。
点击阅读报告原文: 清华大学:2026循环工程研究报告(89页)
相关报告