一个真实的痛点
你有没有遇到过这种情况:AI Agent犯了一个错误,你告诉它正确的做法,它下一次还是会犯同样的错误?
原因很简单:Agent的经验散落在对话历史里,没有被系统性地沉淀下来。每一次交互都是一次性的,用完即弃。
Google Research的最新论文WikiSkill(arXiv:2608.27454)提出了一个优雅的解决方案:让Agent像人类一样,把经验编译成知识,再把知识进化成技能。
三层架构:Raw → Wiki → Skill
WikiSkill的核心是三层分离的存储架构:
Raw层(原始轨迹):记录Agent的每一步执行——推理过程、工具调用、环境反馈、最终答案。写入后永不修改,保证数据完整性。
Wiki层(结构化知识):从原始轨迹中提炼出结构化的模式(patterns)。每个模式描述一个问题的根因和解决方案。这一层只累积不重置,知识越积越多。
Skill层(可执行技能):基于Wiki中的模式,生成或更新Agent的技能文件。技能可以回滚——如果新技能在验证集上表现更差,就恢复旧版本。
这三层的关系很清晰:Raw提供素材,Wiki提供洞察,Skill提供行动力。
四步循环:进化流水线
WikiSkill不是一个静态系统,而是一个持续进化的循环:
Step 1 — 推理Agent:注入当前技能,在训练集上执行任务,把所有轨迹写入Raw层。
Step 2 — Wiki维护者:采样Raw层的轨迹,做根因分析——失败的任务为什么失败?成功的任务用了什么策略?把发现写入Wiki层的模式页面。
Step 3 — 技能提议者:读取Wiki中的模式、Raw中的轨迹、当前的技能,提出技能更新方案。它不是盲目修改,而是基于证据的推理。
Step 4 — 门控与回滚:在验证集上测试新技能。如果表现更好,更新Skill层;如果更差,回滚并记录失败原因到Wiki。
然后进入下一轮迭代。
最让人惊讶的发现
论文中最有冲击力的实验结论:
小模型+进化技能 > 大模型无技能。这意味着技能进化是一种”算力民主化”——不需要最大的模型,只需要最好的技能。
技能可以跨模型迁移。在一个模型上进化的技能,换一个完全不同的模型家族也能用。甚至其他模型进化的技能,可能比自己进化的还好用。
Wiki本身就是知识资产。即使不生成技能,光是Wiki中积累的模式就有独立价值。这验证了一个直觉:过程比结果重要,思考的沉淀比执行的记录更有价值。
跟Karpathy的LLM-Wiki一脉相承
WikiSkill明确引用了Andrej Karpathy提出的LLM-Wiki概念:让Agent把经验存为持久化的Markdown页面,持续编辑、持续积累。
WikiSkill把这个想法工程化了:不是简单地存原始对话,而是编译——把散落在轨迹中的洞察,提炼、泛化、结构化为可复用的模式。
这个”编译”的比喻很精准:原始轨迹是源代码,Wiki是编译后的库,Skill是打包好的可执行文件。
对我们的启示
这篇论文对AI Agent架构设计有三个重要启示:
第一,知识管理要分层。不要把原始数据和提炼后的知识混在一起。Raw层保证可追溯,Wiki层保证可复用,Skill层保证可执行。
第二,进化需要验证。不能盲目更新技能,必须有门控机制。验证集可以是benchmark,也可以是历史失败案例的回放。
第三,知识累积是核心竞争力。Wiki层”永不重置”的设计理念很关键。每一次迭代都在前一次的基础上累积,这才是真正的自我进化。
论文信息
- 标题: WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- 作者: Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu
- 机构: Google Research, Virginia Tech
- 论文下载: https://xget.xi-xu.me/arxiv/pdf/2608.27454
- arXiv: https://arxiv.org/abs/2608.27454
发表回复