更好的监督近在咫尺:邻域在线策略自蒸馏(Neighborhood OPSD)
Neighborhood OPSD(N-OPSD)把局部参数扰动产生的互补参考修正转化为监督,改进数学推理模型的在线策略自蒸馏(OPSD)。在 AIME 2024、AIME 2025 和 HMMT February 2025 上,Qwen3-1.7B、4B、8B 的三基准 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。
Neighborhood OPSD(N-OPSD)把局部参数扰动产生的互补参考修正转化为监督,改进数学推理模型的在线策略自蒸馏(OPSD)。在 AIME 2024、AIME 2025 和 HMMT February 2025 上,Qwen3-1.7B、4B、8B 的三基准 Average@12 分别比 OPSD 提升 2.75、1.67、1.94 分。
FlexRouter 是显式建模模型互补性的 LLM 路由框架,通过最大化答案覆盖率来选取互补模型集,避免独立打分选 top-k 导致的冗余。它用 DPP 建模路由策略,以失败集边缘化的训练目标直接优化覆盖率,推理时按边际增益贪心选取,无需预设预算即可自适应确定子集大小。在 RouterEval 基准上,其域内与域外任务的覆盖率更高、冗余更低。
Prompt2Skill 是一个仅凭自然语言任务描述构建技能的框架,能从提示词推导任务规范、发现或合成数据集,并通过反思式编辑闭环优化技能。在问答、阅读理解、电子表格操作与数学推理四个领域,它平均比直接提示基线提升 10.8 分,覆盖开源与前沿模型。
SECRET(SourcE-Conditioned RElay sTeering)是一种免训练方法,在 question relay 处抑制跨模态干扰,缓解音视频大语言模型(AVLLM)的源混淆 grounding 幻觉。