返回顶部
返回首页 会员充值 我的足迹 返回上一页
具身智能
情绪经济
商业航天
十五五
银发经济

自改进AI Agent框架

每次对话结束后自动决定什么该记住、完成复杂任务后自动提炼Skill、每次使用后根据反馈自动改进——Hermes Agent的核心机制让AI从“静态工具”进化为“自改进系统”。花叔指南指出,Hermes的创新在于把学习循环、三层记忆、Skill自进化三个机制组成了一个正反馈闭环。用得越多,每个环节都在变强。这不是营销话术,是一个可观察、可验证的工程事实。

自改进AI Agent的核心理念

从Harness Engineering到自改进

LangChain团队用同一个模型只调整“缰绳”配置,成绩从52.8%涨到66.5%。Mitchell Hashimoto(Terraform创造者)给这件事命名:Harness Engineering——每次AI犯错就加一条规则。Hermes做的事情是把这套手动流程变成了一个自动运行的系统,从“你给AI造缰绳”变成“AI自己给自己造缰绳”。

学习循环——五个环节一个闭环

策划记忆(每轮对话后主动决定哪些信息值得记住)→自主创建Skill(完成复杂任务后提炼解决方案)→Skill自改进(根据每次使用反馈自动修改)→FTS5跨会话召回(按需检索历史记忆)→用户建模(从行为模式推断深层特征)。五个环节有因果关系:记忆提供Skill素材,Skill使用中积累反馈触发改进,FTS5让历史经验被精准召回,用户建模把碎片拼成完整画像。

三层记忆与Skill自进化

三层记忆系统

会话记忆回答“发生了什么”——存入SQLite+FTS5全文索引,按需检索而非全量加载。持久记忆回答“你是谁”——编码偏好、项目结构习惯、工具链等跨会话保持。Skill记忆回答“怎么做事”——每个Skill是markdown文件,可读可编辑。Honcho用户建模(可选外挂)通过辩证用户建模覆盖技术水平、工作节奏、沟通风格、情绪模式等多维身份。

Skill自进化的闭环

执行Skill→收集反馈→更新Skill→下次执行新版本。一个GitHub日报Skill的例子:第一次需要详细说明需求,第三次后Hermes自动提炼成Skill,后续只需说“看看GitHub”就自动执行。如果用户说“这次把Discussion也加上”,Hermes不仅当次执行,还会更新Skill文件。这是“自我进化”的实际含义——用户纠正→规则更新→下次执行自动化。

自改进的边界与技术约束

受控可审计的自改进

Hermes的自改进有三个约束:Skill是可读的markdown(不是黑箱),记忆在本地SQLite(可查看删除),工具权限有沙箱(不能随意获取新权限)。从技术上看是受控的、可审计的。但核心矛盾是:自主Agent的价值在于“不用盯着”,安全需要“盯着”。

自改进的天花板

天花板不在技术,在反馈信号。Hermes的自改进依赖一个关键假设——它能判断自己的改进是好是坏。如果用户在场给反馈,循环有效。如果用户不在场,Agent只能用自己的评估标准。有些错误需要领域知识才能发现,Agent不知道自己不知道什么。自改进让Agent在已知方向上越跑越快,但方向本身还得人来定。
点击阅读报告原文: 花叔:Hermes Agent 从入门到精通橙皮书(63页)
相关报告