给 AI agent 的「自我改进方法论」技能:遇到工作方式问题时,自动走完 数据诊断 → 业界调研 → 系统反思 → 现成方案吸收 → 落地技能 → 沉淀方法论 六步闭环,自主学习改进,不需要人类逐步指导。
这个技能本身就是用这套闭环训练出来的:第一版沉淀自「多 agent 协作学习」实战,第二版把闭环用在自己身上(元学习),吸收 Reflexion / Voyager / skill-creator 规范 / 失效模式研究后升级为带闸门、带尺子、带节奏的完整闭环。
LLM agent 踩坑是常态(任务跑太久、产出丢失、重复劳动、技能越积越乱)。常见反应是头痛医头:改一次 prompt、加一条规则。这套闭环提供的是系统化改进流程:
- 触发分级 L0-L3:不是所有问题都值得大动干戈——一次性问题不触发、新坑顺手记、同类坑第二次轻量反思、反复出现/有复用价值才走完整闭环
- 验收标准(eval 先行):没有可验证验收标准的改进不落地——改进必须是「可测量的变好」,不是「感觉更好了」
- 失效模式表:六步每一步最可能踩的坑和防法都写死
- 防膨胀机制:技能库越积越乱是真实风险——该不该沉淀四问、token 预算、定期清理
支持 SKILL.md 技能的 agent 客户端(Claude Code / Codex / Hermes 等):
# 克隆后把技能目录放入你的 skills 目录
git clone https://github.com/2008924/self-improvement-loop.git
# 复制 SKILL.md + references/ 到你的技能目录,重启会话即可触发示例(自然语言):
- 「为什么子代理任务总是跑这么久」
- 「反思一下我们最近的工作方式,给出改进方案」
- 「调研一下 XX 领域的最佳实践,沉淀成技能」
- 「搜索一下有没有现成的 skill 可以吸收」
self-improvement-loop/
├── SKILL.md # 技能正文(六步闭环 + 分级 + 验收 + 失效模式 + 防膨胀)
├── CASE_STUDY.md # 实战案例:子代理耗时优化(完整六步的脱敏通用版)
├── references/
│ └── self-improvement-research.md # 深化调研:agent 自我改进机制(599 行,11 论文 + 官方文档)
└── LICENSE # MIT
| 指标 | 改进前 | 改进后 |
|---|---|---|
| 同性质调研任务耗时 | 24.6 分钟(网络无限重试) | 8 分钟(短超时纪律) |
| 任务成功率 | 92%(25 任务 23 完成) | — |
| 触顶截断导致成果丢失 | 2 次(各 24.6 分钟白费) | 通过任务拆分 + 落盘协议避免 |
| 技能重复/膨胀 | 手动更新与后台审查撞车 | 已记录防法 + 合并去重脚本 |
MIT