SCLATE:持续学习智能体的训练与评估执行基座
SCLATE 是持续学习智能体的训练与评估执行基座,基准测试和未修改的智能体可通过适配器把事件加入同一个开放事件调度器。
SCLATE 是持续学习智能体的训练与评估执行基座,基准测试和未修改的智能体可通过适配器把事件加入同一个开放事件调度器。
Neighborhood OPSD(N-OPSD)把局部参数扰动产生的互补参考修正转化为监督,改进数学推理模型的在线策略自蒸馏(OPSD)。在 AIME 2024、AIME 2025 和 HMMT February 2025 上,Qwen3-1.7B、4B、8B 的三基准 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。
新算法 LIPPAX 面向联邦随机变分不等式优化,可缓解 Local Extra SGD 的客户端漂移问题,并在有界 Hessian、有界算子和低方差等场景取得更优收敛保证。论文还用精细化分析收紧了经典 Local Extra SGD 的收敛界,并把结果扩展到联邦复合变分不等式。