选择多样化的 SFT 轨迹可提升后 RL 泛化能力
一项研究提出用轻量级规则指纹筛选 SFT 数据中的"推理路径多样性",即推理步骤序列的差异。在合成实验中,路径多样化的 SFT 让 OLMo3-7B 在 SFT 未见过环境上的 pass@8 提升 16.9 分;单模型条件下,跨 10 个数学基准的平均 pass@8 最高提升 6.2 分。该仅用 CPU、无需模型调用的选择器在 3 个开源语料上均优于更昂贵的替代方案。
一项研究提出用轻量级规则指纹筛选 SFT 数据中的"推理路径多样性",即推理步骤序列的差异。在合成实验中,路径多样化的 SFT 让 OLMo3-7B 在 SFT 未见过环境上的 pass@8 提升 16.9 分;单模型条件下,跨 10 个数学基准的平均 pass@8 最高提升 6.2 分。该仅用 CPU、无需模型调用的选择器在 3 个开源语料上均优于更昂贵的替代方案。
VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。
一项研究系统消融了 EEG 基础模型的时空掩码策略,在 MAE 和 JEPA 两种自监督框架下预训练 58 个模型,并在 OpenEEGBench 的 12 个数据集上用线性探针评测。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
一项覆盖3132名参与者、共五个实验的研究发现,仅当AI建议可用时,人们放弃回答的比例从36-44%骤降至3-6%。由于所用模型Step 3.5 Flash对所测试的电影视觉细节问题几乎全错,参与者正确率反而从27.5%降至9.2%;财务激励能减少求助AI并略提升弃答比例,但未能扭转效应,即使AI答案自动展示时弃答率也降至1-7%。
小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。
推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。
Anthropic 宣布 Claude 在 Claude Science 系统中仅凭一条提示词、无人监督连续运行数天,算出平面 N=4 超杨-米尔斯理论六粒子振幅的九圈结果,超越 Lance Dixon 团队 2023 年的八圈纪录,总成本几千美元,其中直接自举路线的 Python 运行成本仅约 100 美元。
斯坦福大学 Safavi-Naeini 团队首次实时观测到单个声子消失的量子跃迁过程,论文于 9 月 17 日发表于《科学》。团队将寿命约 2 毫秒的微型机械谐振器与超导量子比特连接,通过数百次连续测量捕捉到从 1 到 0 的跃迁瞬间。
Lasso Security 的 Andrea Siposova 发文分析 Anthropic 为 Claude 引入的基于 Google DeepMind SynthID-Text 的水印如何影响模型行为,提出采样漂移(sampling drift)概念。
Nvidia 研究人员提出 SoL-Pi 系统,用研究 agent 自动优化编码 agent 的控制层(harness),在 EdgeBench 上相比 Codex 节省 50%、相比 Claude Code 节省 54.3% 的 token,性能与原 Pi harness 大致持平。
研究者提出低秩双线性打分的偏差-方差理论,证明双投影在方向信号平方超过其额外自由度估计成本时风险更低,并据此设计出 Cross-fitted Asymmetry Risk Selector(CARS)。
Allspark 是一个通过交替思维链实现弱到强迁移的训练与推理框架:弱教师模型与同模型冻结副本交替推理、由冻结模型给出最终答案,推理时用更强的学生模型替换冻结伙伴,两者均保持固定。
RoboFoundry 提出“自演化系统即策略”的具身智能体框架,将执行轨迹转化为经验证的任务级系统更新,并沉淀为通用系统能力。在 EmbodiedBench 上,它把 GPT-5.5 提升 27.8%,并让 Qwen3.7-Plus 达到 70.3%、接近 GPT-5.5 的 72.7%。
研究者提出 IntentFlux 可执行基准,将可验证任务转为带受控意图变更的多轮对话,在 627 个案例的校准中,任务平均分随被取代和撤回信息增多从 0.476 降至 0.384。
ExpVoyager 将 LLM 智能体的技能合成重构为对历史经验的动态导航问题,由 skill curator 按当前任务需求在不同视图与分辨率下探索原始轨迹,边识别可复用过程知识边追踪剩余知识需求以决定下一步导航方向。实验显示其在下游任务性能上持续提升,经验空间扩大时收益持续增长,并能在高效经验访问下与现有技能兼容。
PrismQuant 是一种量化器感知的旋转框架,通过将激活值主特征空间与非对称分组 INT4 的常量组子空间对齐,把旋转设计建模为 Ky Fan 迹最大化并给出可证明最优的闭式解。
针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究发现,MoE 模型合并后大部分专家重分配源于输入偏移而非同层参数变化,源路由差异难以预测恢复源路由带来的下一 token 似然增益。
研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。
Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。
AdaTutoRank 是一种集合级重排序器,采用自适应辅导优化(ATO)训练,在九项评分维度、三级层次结构下为冷启动提供银标签、为强化学习提供奖励、为蒸馏提供提示。
论文提出 AgentTell 基准,研究 browser-use 智能体的行为侧信道泄露,即智能体的操作无意间暴露从先前网站获取的秘密。基准含 20 个场景、100 个任务,在六个骨干模型上共 9,760 次会话的评估显示 61.1% 的会话中智能体通过行为泄露秘密;即使记忆中明确要求不透露,泄露率仍达 56.7%,且 34.5% 的泄露会话最终回复还向用户保证未泄露。
WaveFront Decoding(WFD)是一种面向循环语言模型的无训练自推测解码框架,利用中间循环输出作为草稿预测、并借助权重共享批量处理不同位置与循环深度的 token 状态。
GAGAR 是一个面向代码智能体强化学习的质量感知信用重分配框架,通过 SFT 训练的智能体评分器在同一工作区内联合检查并排序通过测试的轨迹,对低排名轨迹降权并按比例重缩放优势值以保持总和不变。
SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。
研究揭示同策略蒸馏(OPD)在弱到强、同基座、强到弱教师-学生设置中的缩放规律:早期训练中,留出准确率(gold score)随学生初始化 token 级反向 KL 散度平方根近似线性上升,形成"有效迁移"区间。
研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。
研究者训练强化学习智能体直接在半边数据结构上做局部编辑,构建达到离散 Gauss-Bonnet 下界(称为 par)的四边形网格分解,并通过在最优网格上的行为克隆加 PPO 突破稀疏奖励的探索瓶颈。
VoxMem 是面向大型音频语言模型(LALM)的多模态记忆基准,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
针对 LLM 智能体在长序列依赖任务中决策漂移的问题,研究者提出 Adaptive Consistency Graph(ACG),将执行证据及其来源增量组织进持久图,并在有限上下文预算下为每次决策构建以需求为中心的临时视图。
针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。
针对 Direct-OPD 的 token 级 log-ratio 只衡量相对变化、在概率质量消失时仍可能不变的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复只保留前 10% 状态。
研究者提出融合注意力原语 MALA,按归一化贡献分配 post-score 计算,在 8K 匹配工作量下平均遗漏质量仅 0.0188%,接近逐实例参考质量 oracle 的 0.0182%。
研究者推出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六个原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。
研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证改动后的软件是否满足需求并保持既定行为。该工作评估前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件变更。
FlashForward 直接复用当前 chunk 去噪前向中已算出的 in-flight KV cache,省去为更新缓存而做的额外前向,并生成稀疏的干净锚点 latent 以稳定生成轨迹。
研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。
研究者提出结构化注意力架构 CoWA,将因果历史访问分散到各 KV head:所有 head 共享近对角与 prefix-sink 窗口,互补的长程窗口划分其余历史,其并集实现完整因果覆盖,且无需学习型 router 或 indexer。
BiasReducer 提出一种轻量框架,仅编辑奖励模型的线性奖励头,并为每个新数据集自动选择相关编辑,无需重训练。它先用 SAE 风格编码器识别奖励模型敏感的属性(如长度、置信度),再学习调整奖励头的方向和幅度,最后按属性影响力排序筛选编辑。
研究者推出 DepthBench,一个在固定模型规模与预训练配方下系统改变宽深比(d_model/n_layer)的受控基准,用于衡量架构深度能否转化为有效计算深度。
LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 1 万条高频序列的 5000 万对关系中产出 62 条已验证关联,其中 13 条值得展示、9 条具信息量或洞察力,4 条在 OEIS 与定向文献检索中均未出现。整个流程含分类器训练、候选排序、过滤与验证耗时不到 8 小时。