做Agent的同行应该都有体会——模型选对了、工具接好了、架构搭好了,最后效果好不好,往往就取决于那份技能文件写得怎么样。也就是system prompt加上各种指令、约束、示例,那个用自然语言写出来的markdown文档。
但问题是,这个文件的迭代方式,到今天还是纯手工活。跑一下看看效果,不行就改两句,改完再跑,又不行,再改。没有loss function,没有validation set,没有收敛保证,全凭经验和直觉。你压根不知道这次改动到底是全面变好了,还是拆了东墙补西墙。
微软研究院五月份放出来的SkillOpt,试图把这件事从手工调参变成系统化训练。它的核心主张很干脆:Agent的技能文件就是一种参数,跟神经网络的权重一样,应该能被自动优化。区别只在于权重是浮点数,技能是自然语言文本,所以需要的不是SGD,而是一个文本空间的优化器。
核心类比:把深度学习的范式搬到文本上
要真正理解SkillOpt,关键在于把握它背后的类比。一旦这个对应关系建立起来,后面所有的设计就都顺理成章了。
| 深度学习 | SkillOpt |
|---|---|
| 模型权重 (float tensor) | 技能文件 (Markdown文本) |
| 前向传播 (inference) | Agent执行任务 (rollout) |
| Loss / Score | 任务成功率 / 评分 |
| 梯度 (gradient) | 编辑提案 (add/delete/replace) |
| 学习率 (learning rate) | 验证门控 (只接受改善的编辑) |
| 训练完部署 | 优化完的技能直接丢进system prompt |
模型权重是数字空间的参数,用梯度下降来优化;技能文件是文本空间的参数,用有界编辑来优化。两者在概念上是对称的。SkillOpt的关键洞察在于:Agent跑得好不好,相当大一部分方差来自技能文件的质量,但这份文件至今没有一套类似深度学习那样可复现、有反馈、能收敛的优化范式。它要做的,就是补上这块拼图。
四步循环:文本空间的训练loop
具体实现是一个四步的迭代循环,结构上和深度学习的训练loop几乎是同构的。

Rollout:冻结的目标模型(可以是GPT-5.5、Claude、Qwen,任何一个)带着当前版本的技能文件去执行一批任务,每次执行产生一条带分数的轨迹。这相当于前向传播。
Reflect:一个独立的优化器模型(注意,是另一个模型,不是目标模型自己)去分析这批成功和失败的轨迹,找出规律——哪些情况下当前技能处理得好、哪些不行、不行的原因是什么。这步相当于算loss和分析梯度方向。
Edit:优化器模型根据分析结果,对技能文件提出一组有界的编辑操作——添加一条规则、删除一条过时的约束、替换一个表述。操作是有界的(bounded),每一轮只能改有限的内容,防止一步跳太远。
Validate:把修改后的技能文件拿到一组held-out的验证任务上跑一遍,看分数是否严格高于修改前。如果高了,接受这次编辑;如果没高,拒绝,而且把被拒的编辑存进一个负反馈缓冲区,告诉优化器下次别往这个方向走。
这个循环反复运行,技能文件一轮一轮地变好,直到验证集上的分数收敛。
效果:52个格子全部best或tied-best
SkillOpt在6个benchmark上做了测试,覆盖搜索问答、具身任务、文档理解、数学、电子表格操作、办公场景。
| Benchmark | 任务类型 |
|---|---|
| SearchQA | 搜索问答 |
| ALFWorld | 具身交互(agent在虚拟环境里操作) |
| DocVQA | 文档视觉问答 |
| LiveMathematicianBench | 数学推理 |
| SpreadsheetBench | 电子表格操作 |
| OfficeQA | 办公场景综合 |
每个benchmark在7个模型(包括GPT-5.5、GPT-5.4-nano、Qwen3.5-4B等)和3种执行环境(直接对话、Codex agent loop、Claude Code)下都跑了一遍,总共52个评测格。结果是全部best或tied-best,没有任何一格输给基线。
几个有代表性的提升数字:在GPT-5.5上,对话模式提了23.5分,Codex环境提了24.8分,Claude Code环境提了19.1分;在小模型GPT-5.4-nano上提了24.9%,在开源模型Qwen3.5-4B上提了19.2%。
它和DSPy、TextGrad有什么不同?
做过prompt优化的人会想到几个先行者:DSPy把prompt拆成模块化的签名来优化,TextGrad用LLM生成文本梯度来改prompt,OPRO让LLM自己迭代优化prompt。SkillOpt和它们的核心区别在于两点。
第一个是严格验证门控。DSPy和TextGrad生成候选后不一定有严格的held-out验证步,它们可能会接受一些看起来好、但实际上在分布外数据上会退步的修改。SkillOpt每一步都卡验证,只接受严格提升,保证优化轨迹单调向上,不会振荡。
第二个是零推理时开销。优化的全部成本在训练阶段支付,训练完得到的就是一个纯文本的Markdown文件,部署时直接当system prompt丢进去就行。不需要额外的运行时调用、不需要特殊的框架、不加一行代码。这和DSPy那种需要在运行时维持模块pipeline的做法有本质区别。
还有一个容易被低估的优势:技能跨模型迁移。一份在GPT-5.5上优化好的技能文件,可以直接给Qwen3.5或Claude用,效果也有明显提升——虽然不如专门针对那个模型优化的版本,但省掉了重头训练。这是因为好的技能文件本质上是好的任务知识(该注意什么、常见坑在哪),这些知识不绑定特定模型。
为什么这件事重要?
把视角从论文拉到产业。SkillOpt重要,不是因为它是一个聪明的优化算法,而是因为它指向了一个新的工程层。
目前Agent生态里,模型层有一整套成熟的训练范式(预训练、SFT、RLHF),推理层也有一整套优化工具(vLLM、KV Cache压缩、量化)。但中间那个把模型能力转化为具体任务表现的技能层,至今还是手工作坊的状态。每家公司的Agent好用不好用,很大程度取决于它的prompt engineers写得好不好、迭代得勤不勤,而这个过程没有工具化、没有可复现性、没有收敛保证。
SkillOpt给这个层提供了一个可能的答案:把技能文件的优化从手工经验活,变成一个有反馈、有验证、能收敛的系统工程。如果这条路走通,Agent开发的瓶颈可能会从「找一个好的prompt engineer」变成「跑一个好的训练流程」,门槛降低,可复现性提升。
几个还没看清楚的点
6个benchmark都是可自动评分的任务,但很多真实场景的Agent技能(比如写作风格、沟通策略、创意任务)没有清晰的自动评测标准。SkillOpt的优化循环能否迁移到这类主观评判的场景,论文没有涉及。
优化器模型本身需要多强,论文也没有给出详细的ablation分析。用GPT-5.5当优化器去优化GPT-5.5的技能,和用一个小模型当优化器,效果差多少,资源要求差多少——这些对实际落地很重要的问题,还需要更多实验数据来回答。
和持续学习、在线学习的关系也没有讲清楚。SkillOpt目前是离线优化然后部署,如果任务分布变了——用户需求变了、环境变了——技能文件需要重新跑优化吗?能不能做增量更新?这些工程问题目前还处在开放状态。
写在最后
SkillOpt做的事,说起来很简单:给Agent的技能文件加了一套训练范式。但它触及的是整个Agent工程里一个长期被忽视的断层——模型有训练、推理有优化,唯独中间那个把能力翻译成任务表现的技能层,还在靠手写手调。
它用深度学习的类比把这件事讲得很清楚:技能文件是参数,执行任务是前向传播,编辑是梯度,验证门控是学习率。整套范式是成立的,52个评测格全部best或tied-best也证明它真的work。如果只记一件事,那就记住那个洞察——Agent效果的方差,远比你以为的更多来自技能文件的质量,而不是模型本身。写好一份技能,可能比换一个更贵的模型更管用。而SkillOpt,给了我们一条把这件事从经验变成工程的路。
References
- Yang et al., 「SkillOpt: Executive Strategy for Self-Evolving Agent Skills」, Microsoft Research, 2026-05, https://arxiv.org/abs/2605.23904
- Microsoft, 「SkillOpt Project Page」, https://microsoft.github.io/SkillOpt/
- Microsoft GitHub, 「SkillOpt - text-space optimizer for reusable agent skills」, https://github.com/microsoft/SkillOpt
- Microsoft Research, 「SkillOpt Publication」, https://www.microsoft.com/en-us/research/publication/skillopt-executive-strategy-for-self-evolving-agent-skills/
- Flowtivity, 「Microsoft SkillOpt: How to Train AI Agent Skills Like Neural Networks」, https://flowtivity.ai/blog/microsoft-skillopt-train-ai-agent-skills/
- Hugging Face Papers, 「SkillOpt」, https://huggingface.co/papers/2605.23904
- 智源社区, 「SkillOpt: Executive Strategy for Self-Evolving Agent Skills」, https://hub.baai.ac.cn/paper/f902956e-64d7-4054-b5da-217182b07676
- 齐思洞见, 「SkillOpt将Markdown技能文件视为可训练参数」, 2026-05-27, https://news.miracleplus.com/share_link/132700
