游乐游手机版
首页/AI教程/文章详情

微软SkillOpt用Markdown训练神经网络权重实现Agent技能梯度下降

时间:2026-08-17 13:08
微软研究院提出SkillOpt,将Agent技能文件(Markdown文本)视为可优化参数,通过Rollout、Reflect、Edit、Validate四步循环自动迭代,如同深度学习训练。在52个评测格子中全部取得最佳或持平,零推理时开销,技能文件可跨模型迁移。

做Agent的同行应该都有体会——模型选对了、工具接好了、架构搭好了,最后效果好不好,往往就取决于那份技能文件写得怎么样。也就是system prompt加上各种指令、约束、示例,那个用自然语言写出来的markdown文档。

但问题是,这个文件的迭代方式,到今天还是纯手工活。跑一下看看效果,不行就改两句,改完再跑,又不行,再改。没有loss function,没有validation set,没有收敛保证,全凭经验和直觉。你压根不知道这次改动到底是全面变好了,还是拆了东墙补西墙。

微软研究院五月份放出来的SkillOpt,试图把这件事从手工调参变成系统化训练。它的核心主张很干脆:Agent的技能文件就是一种参数,跟神经网络的权重一样,应该能被自动优化。区别只在于权重是浮点数,技能是自然语言文本,所以需要的不是SGD,而是一个文本空间的优化器。


核心类比:把深度学习的范式搬到文本上

要真正理解SkillOpt,关键在于把握它背后的类比。一旦这个对应关系建立起来,后面所有的设计就都顺理成章了。

深度学习 SkillOpt
模型权重 (float tensor) 技能文件 (Markdown文本)
前向传播 (inference) Agent执行任务 (rollout)
Loss / Score 任务成功率 / 评分
梯度 (gradient) 编辑提案 (add/delete/replace)
学习率 (learning rate) 验证门控 (只接受改善的编辑)
训练完部署 优化完的技能直接丢进system prompt

模型权重是数字空间的参数,用梯度下降来优化;技能文件是文本空间的参数,用有界编辑来优化。两者在概念上是对称的。SkillOpt的关键洞察在于:Agent跑得好不好,相当大一部分方差来自技能文件的质量,但这份文件至今没有一套类似深度学习那样可复现、有反馈、能收敛的优化范式。它要做的,就是补上这块拼图。


四步循环:文本空间的训练loop

具体实现是一个四步的迭代循环,结构上和深度学习的训练loop几乎是同构的。

Rollout:冻结的目标模型(可以是GPT-5.5、Claude、Qwen,任何一个)带着当前版本的技能文件去执行一批任务,每次执行产生一条带分数的轨迹。这相当于前向传播。

Reflect:一个独立的优化器模型(注意,是另一个模型,不是目标模型自己)去分析这批成功和失败的轨迹,找出规律——哪些情况下当前技能处理得好、哪些不行、不行的原因是什么。这步相当于算loss和分析梯度方向。

Edit:优化器模型根据分析结果,对技能文件提出一组有界的编辑操作——添加一条规则、删除一条过时的约束、替换一个表述。操作是有界的(bounded),每一轮只能改有限的内容,防止一步跳太远。

Validate:把修改后的技能文件拿到一组held-out的验证任务上跑一遍,看分数是否严格高于修改前。如果高了,接受这次编辑;如果没高,拒绝,而且把被拒的编辑存进一个负反馈缓冲区,告诉优化器下次别往这个方向走。

这个循环反复运行,技能文件一轮一轮地变好,直到验证集上的分数收敛。


效果:52个格子全部best或tied-best

SkillOpt在6个benchmark上做了测试,覆盖搜索问答、具身任务、文档理解、数学、电子表格操作、办公场景。

Benchmark 任务类型
SearchQA 搜索问答
ALFWorld 具身交互(agent在虚拟环境里操作)
DocVQA 文档视觉问答
LiveMathematicianBench 数学推理
SpreadsheetBench 电子表格操作
OfficeQA 办公场景综合

每个benchmark在7个模型(包括GPT-5.5、GPT-5.4-nano、Qwen3.5-4B等)和3种执行环境(直接对话、Codex agent loop、Claude Code)下都跑了一遍,总共52个评测格。结果是全部best或tied-best,没有任何一格输给基线。

几个有代表性的提升数字:在GPT-5.5上,对话模式提了23.5分,Codex环境提了24.8分,Claude Code环境提了19.1分;在小模型GPT-5.4-nano上提了24.9%,在开源模型Qwen3.5-4B上提了19.2%。


它和DSPy、TextGrad有什么不同?

做过prompt优化的人会想到几个先行者:DSPy把prompt拆成模块化的签名来优化,TextGrad用LLM生成文本梯度来改prompt,OPRO让LLM自己迭代优化prompt。SkillOpt和它们的核心区别在于两点。

第一个是严格验证门控。DSPy和TextGrad生成候选后不一定有严格的held-out验证步,它们可能会接受一些看起来好、但实际上在分布外数据上会退步的修改。SkillOpt每一步都卡验证,只接受严格提升,保证优化轨迹单调向上,不会振荡。

第二个是零推理时开销。优化的全部成本在训练阶段支付,训练完得到的就是一个纯文本的Markdown文件,部署时直接当system prompt丢进去就行。不需要额外的运行时调用、不需要特殊的框架、不加一行代码。这和DSPy那种需要在运行时维持模块pipeline的做法有本质区别。

还有一个容易被低估的优势:技能跨模型迁移。一份在GPT-5.5上优化好的技能文件,可以直接给Qwen3.5或Claude用,效果也有明显提升——虽然不如专门针对那个模型优化的版本,但省掉了重头训练。这是因为好的技能文件本质上是好的任务知识(该注意什么、常见坑在哪),这些知识不绑定特定模型。


为什么这件事重要?

把视角从论文拉到产业。SkillOpt重要,不是因为它是一个聪明的优化算法,而是因为它指向了一个新的工程层。

目前Agent生态里,模型层有一整套成熟的训练范式(预训练、SFT、RLHF),推理层也有一整套优化工具(vLLM、KV Cache压缩、量化)。但中间那个把模型能力转化为具体任务表现的技能层,至今还是手工作坊的状态。每家公司的Agent好用不好用,很大程度取决于它的prompt engineers写得好不好、迭代得勤不勤,而这个过程没有工具化、没有可复现性、没有收敛保证。

SkillOpt给这个层提供了一个可能的答案:把技能文件的优化从手工经验活,变成一个有反馈、有验证、能收敛的系统工程。如果这条路走通,Agent开发的瓶颈可能会从「找一个好的prompt engineer」变成「跑一个好的训练流程」,门槛降低,可复现性提升。


几个还没看清楚的点

6个benchmark都是可自动评分的任务,但很多真实场景的Agent技能(比如写作风格、沟通策略、创意任务)没有清晰的自动评测标准。SkillOpt的优化循环能否迁移到这类主观评判的场景,论文没有涉及。

优化器模型本身需要多强,论文也没有给出详细的ablation分析。用GPT-5.5当优化器去优化GPT-5.5的技能,和用一个小模型当优化器,效果差多少,资源要求差多少——这些对实际落地很重要的问题,还需要更多实验数据来回答。

和持续学习、在线学习的关系也没有讲清楚。SkillOpt目前是离线优化然后部署,如果任务分布变了——用户需求变了、环境变了——技能文件需要重新跑优化吗?能不能做增量更新?这些工程问题目前还处在开放状态。


写在最后

SkillOpt做的事,说起来很简单:给Agent的技能文件加了一套训练范式。但它触及的是整个Agent工程里一个长期被忽视的断层——模型有训练、推理有优化,唯独中间那个把能力翻译成任务表现的技能层,还在靠手写手调。

它用深度学习的类比把这件事讲得很清楚:技能文件是参数,执行任务是前向传播,编辑是梯度,验证门控是学习率。整套范式是成立的,52个评测格全部best或tied-best也证明它真的work。如果只记一件事,那就记住那个洞察——Agent效果的方差,远比你以为的更多来自技能文件的质量,而不是模型本身。写好一份技能,可能比换一个更贵的模型更管用。而SkillOpt,给了我们一条把这件事从经验变成工程的路。


References

  1. Yang et al., 「SkillOpt: Executive Strategy for Self-Evolving Agent Skills」, Microsoft Research, 2026-05, https://arxiv.org/abs/2605.23904
  2. Microsoft, 「SkillOpt Project Page」, https://microsoft.github.io/SkillOpt/
  3. Microsoft GitHub, 「SkillOpt - text-space optimizer for reusable agent skills」, https://github.com/microsoft/SkillOpt
  4. Microsoft Research, 「SkillOpt Publication」, https://www.microsoft.com/en-us/research/publication/skillopt-executive-strategy-for-self-evolving-agent-skills/
  5. Flowtivity, 「Microsoft SkillOpt: How to Train AI Agent Skills Like Neural Networks」, https://flowtivity.ai/blog/microsoft-skillopt-train-ai-agent-skills/
  6. Hugging Face Papers, 「SkillOpt」, https://huggingface.co/papers/2605.23904
  7. 智源社区, 「SkillOpt: Executive Strategy for Self-Evolving Agent Skills」, https://hub.baai.ac.cn/paper/f902956e-64d7-4054-b5da-217182b07676
  8. 齐思洞见, 「SkillOpt将Markdown技能文件视为可训练参数」, 2026-05-27, https://news.miracleplus.com/share_link/132700
来源:https://cloud.tencent.com.cn/developer/article/2684155
上一篇阿里云618活动攻略:新老用户福利与AI算力服务器优惠 下一篇钉钉与企业邮箱结合使用的方法与操作指南
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
CAD零基础入门教程:坐标输入、图层管理与基础绘图命令
AI教程 · 2026-09-01

CAD零基础入门教程:坐标输入、图层管理与基础绘图命令

本文面向CAD零基础学习者,系统讲解坐标输入、图层管理与基础绘图命令的核心用法。通过分步实操与常见问题排查,帮助新手建立精确绘图习惯,掌握规范出图的基础能力。

CAD从入门到项目交付:绘图、标注、图块与实战工作流
AI教程 · 2026-09-01

CAD从入门到项目交付:绘图、标注、图块与实战工作流

掌握CAD的核心在于建立“画得准、标得清、复用快、交付稳”的工作流。本文提供从环境设置、高频命令组合、标注规范、图块标准化到项目分阶段交付的完整路径,帮助初学者避免常见返工陷阱,独立完成可检查、可复用、可打印的工程图纸。

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤
AI教程 · 2026-09-01

Claude Code 登录指南:个人、Teams 与企业账号区分与授权步骤

本文详细解析 Claude Code 登录前的账号类型区分方法,涵盖个人订阅、Teams 席位与企业 Enterprise 席位的授权路径差异。提供终端登录命令、环境变量排查及常见异常处理步骤,帮助用户快速完成正确授权并避免登录路径混淆。

Claude Code 文件修改前的权限模式配置与命令审批指南
AI教程 · 2026-09-01

Claude Code 文件修改前的权限模式配置与命令审批指南

本文详细介绍Claude Code在修改文件前的权限模式配置方法,包括defaultMode可选值、permissions allow与deny规则设置、多层级配置文件管理以及 status验证技巧,帮助开发者安全高效地使用AI编程助手。

Claude Code接入VS Code后先测扩展和终端命令
AI教程 · 2026-09-01

Claude Code接入VS Code后先测扩展和终端命令

在VS Code中接入Claude Code后,建议优先验证扩展面板与集成终端两条入口。本文提供标准检查顺序、关键命令与常见故障排查路径,帮助你快速确认环境就绪,避免后续开发受阻。