引言
当前大模型智能体(Agent)的技能(Skill)已经成为拓展Agent工具执行能力的主流方案。Agent技能本质是封装好的可复用工作流、工具调用序列与业务操作模板,让智能体无需每次从零推理复杂任务。
在已有的技能自发现研究中,主流思路是直接从Agent任务执行轨迹提取技能。但这类方案普遍存在一个短板:每一轮迭代只依赖近期的任务样本,历史经验、反复出现的失败模式无法长期保存;经验随迭代周期丢弃,系统难以持续沉淀”机构记忆”,同类错误反复出现。
Google Research发布的WikiSkill框架(arXiv:2608.27454),并没有提出一套覆盖全部Agent技能领域的通用理论,而是针对技能迭代流程提出了一种全新架构范式:将原始执行轨迹、编译后的结构化知识、可执行技能三层解耦,通过循环流水线实现知识库与技能协同进化。这套方案虽然只是单一框架,但其设计思想,对构建通用型Agent Skill系统具备很强的参考价值。
一、对WikiSkill论文核心理解
WikiSkill的核心创新一句话概括:把Agent的执行经验,先提炼沉淀为持久化Wiki知识库,再基于知识库生成、迭代技能,而不是直接从原始轨迹一次性生成技能。
整套框架划分为三层存储结构:
1. 原始轨迹层:完整保存每一次任务的全部执行记录,包括任务输入、模型思考过程、工具调用、返回结果、任务成败。原始轨迹作为原始素材库,追加写入,不可修改。
2. Wiki知识库层:由独立的Wiki维护智能体,对采样后的成功、失败轨迹做归纳、根因分析,提炼通用任务模式、故障原因、边界场景,以Markdown页面增量保存。Wiki保存的是描述性知识,回答”发生了什么、为什么成功/失败”,属于编译后的长期记忆。
3. 技能层:存储可直接执行的Agent技能,也就是过程性知识,定义”应该怎么做”。技能支持版本管理,可回滚。
搭配四段式闭环流水线:推理智能体执行任务并产生轨迹 → Wiki维护器提炼经验更新Wiki → 技能生成器基于Wiki产出候选技能 → 门禁校验模块在独立验证集评估新技能,仅保留性能提升的版本,性能退化则直接回滚旧技能。
实验层面,WikiSkill在网页导航、代码编辑、表格推理、数学求解、文档问答五类工具类基准任务上,稳定优于传统无Wiki的技能挖掘方案。同时得出两个关键结论:技能进化与模型能力是互补关系;小模型搭配WikiSkill迭代出的技能,性能能够超过没有技能的更大基础模型;迭代得到的技能还支持跨模型、跨相近领域迁移。
论文同时明确框架局限性:Wiki知识库由大模型自动归纳,存在幻觉风险,错误结论写入Wiki后会持续污染后续迭代;整套迭代流程计算开销较高;知识库持续膨胀后,会遇到上下文窗口、检索瓶颈;当前仅在工具调用类任务验证,未验证高度开放的创意任务。
重点区分:WikiSkill≠通用Skill理论。它只是Agent技能进化方向中的一种实现方案,核心贡献是增加独立编译知识库,实现经验和技能解耦迭代,而不是覆盖所有类型Agent技能的设计方法论。
二、WikiSkill带给通用型Skill体系设计的启发
传统通用Agent技能系统普遍存在几个工程痛点:技能静态固化、经验难以沉淀、技能迭代缺少校验机制、技能与底层业务经验脱节、跨Agent复用困难。WikiSkill的分层思想,恰好可以用来解决这些共性问题。
启发1:经验、知识、技能三层解耦,是通用技能平台的合理架构
很多通用Skill项目,直接把执行经验和技能写在一起,日志、业务规则、执行流程混杂。一旦修改技能,历史经验就丢失。
WikiSkill给出的思路:
- 原始执行轨迹:永久保存原始证据,用于追溯、采样复盘;
- 编译知识库(Wiki):存放经验、根因、业务模式,独立于技能;
- 可执行技能:仅保留执行流程。
价值:同一套Wiki知识,可以支撑多个不同技能;技能迭代、修改、下线,不会破坏长期沉淀的业务经验。对于多Agent集群(例如OpenMate多Agent系统),Wiki可以作为所有Agent共享的公共经验库,实现经验跨Agent共享。
启发2:技能迭代必须增加门禁校验与版本回滚机制,避免能力退化
很多通用技能系统的自动更新逻辑:只要生成新技能就直接上线。劣质技能一旦发布,会持续导致Agent任务失败,并且不断污染后续迭代样本,形成负向循环。
WikiSkill的门禁校验机制是通用技能平台非常关键的工程设计:任何候选技能上线前,必须在独立、固定的验证数据集上评估,对比旧版本任务成功率;只有指标正向提升才允许上线,效果变差直接拒绝更新。
放到通用场景,这套机制可以推广:所有技能变更(新增、修改、废弃)都必须经过离线验证,版本化管理,支持一键回滚,保障整个Skill系统的稳定性。
启发3:技能具备跨模型迁移潜力,通用技能不必绑定特定大模型
传统思路:技能是针对某一个大模型专门调优的提示词、调用模板,换模型就要全部重写。
WikiSkill实验证明:技能本质封装的是任务执行流程,不是特定模型独有的输出习惯。在A模型上迭代生成的技能,可以直接交付其他模型使用。
这个结论对通用Skill平台意义重大:通用技能资产应该做到模型无关。技能定义标准化(例如MCP协议),一套技能包,可以在不同模型、不同Agent之间分发复用,降低多模型场景下技能开发成本。
启发4:失败样本具备极高学习价值,采样策略需要兼顾正负样本
大部分技能挖掘方案优先采样成功案例,忽略失败轨迹。WikiSkill采用分层采样,均衡选取成功样本和失败样本,并且对失败案例做根因分析。
通用技能平台设计时,不能只从成功任务提炼技能。大量失败案例里蕴含边界条件、错误触发条件、风险点,这些信息沉淀进知识库后,能显著提升Agent鲁棒性,减少同类错误重复发生。
启发5:要区分”描述性知识”和”过程性技能”,二者各司其职
很多项目把业务知识、执行流程全部塞进同一个Prompt或者同一个Skill文件中,上下文臃肿、职责混乱。
WikiSkill的划分思路可以借鉴:
- 知识库(Wiki):回答原理、背景、风险、历史踩坑记录,属于描述性知识;
- Skill:定义操作步骤、工具调用顺序、判断分支,属于过程性知识。
推理阶段Agent读取Wiki获取背景,加载Skill执行任务;技能迭代阶段,依靠Wiki提供的经验生成新流程。二者分离,可以减少技能本体的内容体积,降低上下文压力。
三、需要理性看待的边界与约束
WikiSkill的设计同样存在局限,在落地通用Skill平台时不能直接照搬,需要取舍:
- 知识库由LLM自动提炼,存在幻觉风险。通用生产环境下,需要增加人工复核、知识冲突检测机制,防止错误经验持续累积;
- 整套迭代流水线算力开销大。大规模持续迭代场景,需要设计采样策略,不需要保存全部任务轨迹;
- Wiki规模持续膨胀带来检索问题。长期运行的通用技能平台,必须配套检索增强机制,否则读取Wiki时会超出上下文限制;
- WikiSkill仅验证工具类任务。如果通用Agent包含创意、开放式对话等场景,这套迭代方案不一定适用。
四、总结
WikiSkill不是一套通用Agent技能的完整理论,而是一套面向工具型Agent的技能协同进化框架。它最核心的贡献,是打破了”直接从原始轨迹生成技能”的传统范式,引入独立的编译式持久知识库,实现经验、知识、技能分层闭环迭代。
这套思路对通用Skill体系建设带来明确启发:构建通用技能平台,不只是开发一个个独立的技能脚本,更要搭建一套配套的经验沉淀、知识提炼、技能验证、版本治理的基础设施。在多Agent集群场景下,共享Wiki知识库+可迁移、可回滚的标准化技能,可以持续提升Agent集群的执行稳定性,降低技能持续维护成本。
论文信息
- 标题: WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- 作者: Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu
- 机构: Google Research, Virginia Tech
- 论文下载: https://xget.xi-xu.me/arxiv/pdf/2608.27454
- arXiv: https://arxiv.org/abs/2608.27454
发表回复