微软SkillOpt新发现:优化后的Agent技能文件可跨模型和Codex/Claude Code迁移
微软与多所高校合作的SkillOpt研究显示,优化后的Agent技能文件best_skill.md可跨模型规模及Codex/Claude Code环境迁移,SpreadsheetBench技能在Claude Code上得分超原生训练。本文解析迁移机制、任务类型差异及对中文开发者的启示。
一句话看懂
微软SkillOpt研究发现,优化后的Agent技能文件(best_skill.md)可跨模型规模和不同编码环境迁移。Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,超过其原生训练的80.4。
详细发生了什么
微软联合上海交大、同济大学和复旦大学的团队开发了SkillOpt,这是一种文本空间优化器。它训练单个自然语言技能文档,同时保持目标模型冻结。优化器模型读取评分轨迹,提出有界的增删改编辑,仅当分数严格提升时才接受。导出的产物是单个文件best_skill.md。
研究重点在跨环境迁移。跨模型测试中,GPT-5.4训练的SpreadsheetBench技能部署到mini变体保留了82%的域内增益,而nano变体仅保留16%。跨harness测试更引人注目:Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,略高于Claude Code自己训练的80.4。但LiveMath任务迁移效果差,Codex到Claude Code仅保留10%增益。跨基准测试(OlympiadBench到Omni-MATH)增益虽为正但较小。
论文指出,技能可迁移性源于共享的文件格式和程序性技能(如检查、验证、格式化)的通用性,而推理密集型技能更依赖训练环境。技能文件长度379到1995 token,由1到4个编辑构成。
中文圈视角
对国内开发者而言,SkillOpt的跨环境迁移能力意味着可以降低Agent开发成本。目前国内主流Agent框架(如Dify、FastGPT)和模型(如DeepSeek、Kimi)生态与OpenAI/Anthropic不同,但技能文件是纯文本,理论上可适配。不过,跨家族迁移(如GPT到Qwen)未测试,国内模型能否直接复用需验证。
此外,技能文件的可审计性(每个编辑记录在edit_apply_report.json)符合国内对AI可解释性的监管趋势,相比微调权重更易合规审查。但需注意,研究基于英文基准,中文场景(如中文表格处理)的迁移效果未知,建议开发者在小规模测试后再采用。
几条值得记住的细节
- 跨harness测试中,Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,超过原生训练的80.4。
- 跨模型迁移中,SpreadsheetBench在GPT-5.4-mini上保留82%增益,但在nano上仅16%。
- LiveMath任务迁移效果差,Codex到Claude Code仅保留10%增益。
- 技能文件长度379到1995 token,中位数约920,由1到4个编辑构成。
- 训练成本一次性支付,部署时零额外推理调用,SpreadsheetBench每个测试点仅需0.6M训练token。
一句话总结
技能文件可跨环境复用,但效果因任务类型而异,程序性任务迁移更可靠,值得国内开发者关注。