AI 快讯 编译自 marktechpost #模型发布#功能更新#行业分析

微软SkillOpt新发现:优化后的Agent技能文件可跨模型和Codex/Claude Code迁移

微软与多所高校合作的SkillOpt研究显示,优化后的Agent技能文件best_skill.md可跨模型规模及Codex/Claude Code环境迁移,SpreadsheetBench技能在Claude Code上得分超原生训练。本文解析迁移机制、任务类型差异及对中文开发者的启示。

编译发布 2026/08/06 原文发布 2026/08/06

一句话看懂

微软SkillOpt研究发现,优化后的Agent技能文件(best_skill.md)可跨模型规模和不同编码环境迁移。Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,超过其原生训练的80.4。

详细发生了什么

微软联合上海交大、同济大学和复旦大学的团队开发了SkillOpt,这是一种文本空间优化器。它训练单个自然语言技能文档,同时保持目标模型冻结。优化器模型读取评分轨迹,提出有界的增删改编辑,仅当分数严格提升时才接受。导出的产物是单个文件best_skill.md。

研究重点在跨环境迁移。跨模型测试中,GPT-5.4训练的SpreadsheetBench技能部署到mini变体保留了82%的域内增益,而nano变体仅保留16%。跨harness测试更引人注目:Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,略高于Claude Code自己训练的80.4。但LiveMath任务迁移效果差,Codex到Claude Code仅保留10%增益。跨基准测试(OlympiadBench到Omni-MATH)增益虽为正但较小。

论文指出,技能可迁移性源于共享的文件格式和程序性技能(如检查、验证、格式化)的通用性,而推理密集型技能更依赖训练环境。技能文件长度379到1995 token,由1到4个编辑构成。

中文圈视角

对国内开发者而言,SkillOpt的跨环境迁移能力意味着可以降低Agent开发成本。目前国内主流Agent框架(如Dify、FastGPT)和模型(如DeepSeek、Kimi)生态与OpenAI/Anthropic不同,但技能文件是纯文本,理论上可适配。不过,跨家族迁移(如GPT到Qwen)未测试,国内模型能否直接复用需验证。

此外,技能文件的可审计性(每个编辑记录在edit_apply_report.json)符合国内对AI可解释性的监管趋势,相比微调权重更易合规审查。但需注意,研究基于英文基准,中文场景(如中文表格处理)的迁移效果未知,建议开发者在小规模测试后再采用。

几条值得记住的细节

  • 跨harness测试中,Codex训练的SpreadsheetBench技能在Claude Code上得分81.8,超过原生训练的80.4。
  • 跨模型迁移中,SpreadsheetBench在GPT-5.4-mini上保留82%增益,但在nano上仅16%。
  • LiveMath任务迁移效果差,Codex到Claude Code仅保留10%增益。
  • 技能文件长度379到1995 token,中位数约920,由1到4个编辑构成。
  • 训练成本一次性支付,部署时零额外推理调用,SpreadsheetBench每个测试点仅需0.6M训练token。

一句话总结

技能文件可跨环境复用,但效果因任务类型而异,程序性任务迁移更可靠,值得国内开发者关注。