跳到正文
原文
MarkTechPost(RSS)· MarkTechPost(RSS)·· 2026-08-06精选AI 评分70

Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

AI 导读

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。

推荐理由

跨 harness 迁移实验把 agent 技能从单环境优化推进到可复用文本技能文件,Codex 练出的技能在 Claude Code 上超过域内训练结果,对维持多工具一致行为提供直接实证。

正文

SkillOpt 是由来自 Microsoft、上海交通大学、同济大学和复旦大学的研究团队开发的一款文本空间优化器。

SkillOpt 训练单个自然语言技能文档,而目标模型保持冻结。一个优化器模型读取带评分的 rollout,并提出有界的添加/删除/替换编辑。一个留出的选择集仅在分数严格提升时才接受编辑。导出的产物是一个文件,best_skill.md。

迁移表格报告三列。Baseline 是目标模型的无技能得分。Direct 是在该确切目标上进行域内训练的 SkillOpt。Transferred 应用在其他地方训练的技能,且不再进行进一步优化。

有用的比较不是迁移与直接之间的比较,而是域内增益在迁移后有多少得以保留。

跨模型迁移:同族内,保留情况参差不齐

技能在 GPT-5.4 上训练,并部署到更小的变体上。

SpreadsheetBenchGPT-5.4-mini36.147.545.5+9.482%
SpreadsheetBenchGPT-5.4-nano23.542.526.5+3.016%
LiveMathGPT-5.4-mini14.732.819.2+4.525%
LiveMathGPT-5.4-nano23.227.228.8+5.6140%

有两行值得关注。GPT-5.4-mini 上的 SpreadsheetBench 保留了 82% 的域内增益。这几乎相当于免费复用。GPT-5.4-nano 上的 LiveMath 一行则更为奇特:迁移后的技能得分为 28.8,而域内 SkillOpt 结果为 27.2。论文将此解读为某些习得流程与目标模型无关的证据。

GPT-5.4-nano 的 SpreadsheetBench 一行是最弱的,仅为 16%。保留率并不一致,论文也未声称其一致。其所述界限更为狭窄:没有任何一行低于目标的无技能基线。

注意范围。所有四行都保持在同一个 GPT 系列内。跨系列迁移,例如 GPT 到 Qwen,并未测试。

跨 harness 迁移:最强结果

这是对部署最为关键的一节。所有行均使用 GPT-5.5。

基准源 → 目标基线直接迁移后收益域内收益占比
SpreadsheetBenchCodex → Claude Code22.180.481.8+59.7102%
SpreadsheetBenchClaude Code → Codex27.585.071.1+43.676%
LiveMathClaude Code → Codex35.278.448.0+12.830%
LiveMathCodex → Claude Code40.856.542.4+1.610%

第一行是头条结果。一个在 Codex 内部优化过的技能,将 Claude Code 从 22.1 提升到了 81.8。这略微超过了 Claude Code 从零开始训练自身技能所达到的 80.4。

这两个运行框架暴露了不同的工具与文件 API,以及不同的命令接口。一个能在这种切换中存活的技能,并不是在编码命令配方。研究论文将 SpreadsheetBench 的可移植性归因于工作簿级别的流程:结构优先的检查、公式感知的验证,以及静态值物化。无论由哪个 CLI 运行 Python,这些流程都成立。

LiveMath 则讲述了相反的故事。Codex → Claude Code 仅保留了 10% 的域内增益。这种不对称值得深思。程序性技能——如何检查、验证和格式化——似乎属于可移植的那一类。而推理密集型的技能,似乎与其训练环境的绑定更为紧密。

跨基准迁移:真实存在但幅度很小

源 → 目标模型基线迁移后增益
OlympiadBench → Omni-MATHGPT-5.456.660.3+3.7
OlympiadBench → Omni-MATHGPT-5.4-mini34.836.6+1.8
OlympiadBench → Omni-MATHGPT-5.4-nano38.840.1+1.3

这里没有 Direct 列。没有报告在 Omni-MATH 上运行域内 SkillOpt 的结果,因此对比仅针对无技能的情况。三个模型规模上的增益均为正,但幅度很小。研究论文的解读是:在测试实例和答案格式约定都发生变化之后,该技能仍保留了可复用的数学解题流程。

该产物为何仍能迁移

研究论文中明确阐述了其机制。三种执行模式:直接对话、Codex、Claude Code——都消费同一种 best_skill.md 文件格式。正是这一共享契约,才使得跨 harness 实验从一开始就成为可能。

Codex harness 将当前技能渲染为与任务文件并列的每任务 SKILL.md,然后读回一份紧凑的执行轨迹。Claude Code harness 通过 claude CLI 镜像了相同的工作区契约。两个 harness 都没有获得专属的技能格式。

该产物的形态也支持可移植性。最终技能在六个基准上运行消耗 379 到 1,995 个 token,中位数接近 920。它们由 1 到 4 个被接受的编辑组装而成。论文的图 4 为每个基准抽取了一条学到的规则作为示例,所有规则都是流程性的,而非针对具体实例。SpreadsheetBench 的规则原文如下:检查工作簿结构和公式,然后在完整的请求目标范围内写入求值后的静态值,而不是依赖 Excel 重新计算。

这对可移植性意味着什么

训练成本只需支付一次,离线进行,并且是可衡量的。该研究论文报告称,每个绝对测试点需要 0.6M 到 46.4M 个训练 token,具体取决于基准测试。SpreadsheetBench 为每个点 0.6M;DocVQA 为 46.4M。优化器模型仅在训练期间运行,在部署时不增加任何推理时调用。

如果在一个 harness 中训练出的技能在另一个中依然有效,那么这笔一次性成本就会分摊到多个环境中。Codex → Claude Code 的 SpreadsheetBench 结果就是存在性证明。它还意味着你可以在工具链成本最低的地方进行优化,并在产品实际运行的地方进行部署。

审计角度是另一个独立且被低估的方面。部署的产物是一个文本文件,领域从业者可以在几分钟内读完。对其的每一次更改都是可追溯的:每一步都记录一个 edit_apply_report.json,并带有每次编辑的接受和跳过状态。可移植性加上可检查性,是一种与交付微调权重不同的运营姿态。

核心要点

  • 证据覆盖一个 GPT 系列和每个维度两个基准,因此可移植性得到了验证,但尚未推广。
  • 一个经 Codex 训练的 SpreadsheetBench 技能在 Claude Code 中得分 81.8,高于该框架自身在域内的 80.4 结果。
  • 全部 4 行跨模型、4 行跨框架和 3 行跨基准迁移结果均高于目标的无技能基线。
  • 迁移强度与任务类型相关:程序性电子表格技能迁移效果好,数学推理技能迁移效果弱。
  • 可移植单元是一个由 379 到 1,995 个 token 组成的 best_skill.md,由 1 到 4 个被接受的编辑构建而成。

资源: 论文、GitHub、项目页面、文档、PyPI 和 演示视频

参考基线: GEPA、TextGrad、EvoSkill 和 Trace2Skill

参考基准: SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench 和 ALFWorld

来源:MarkTechPost(RSS) · marktechpost.com