EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键
EasyPPO 通过仅对 actor 做超长过滤、按采样回报标准差倒数加权 critic 回归、并适度缩小 critic mini-batch,解决了 PPO 中 critic 的两类失稳问题。
EasyPPO 通过仅对 actor 做超长过滤、按采样回报标准差倒数加权 critic 回归、并适度缩小 critic mini-batch,解决了 PPO 中 critic 的两类失稳问题。
Tacit-TTS 是蒸馏自 IndexTTS2 的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度的估计与 ReFlow 蒸馏加速流匹配渲染器。在 2 个英语和 2 个普通话数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,且无需参考语音转写,可支持跨语言及婴儿咿呀、合成乱语等非词汇参考。
WUSH-KV 是一种面向低比特 KV cache 的量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,为 key 和 value 分别构造变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
研究者提出免训练的后门移除方法 NEEDLE,通过激活向量估计后门方向与拒绝子空间,再施加顺序权重正交化,在压制后门的同时避免改变拒绝相关表征。该方法无需干净参考模型或原始投毒训练数据,在多种模型家族与攻击类型上取得最低平均攻击成功率,其中代码注入攻击为 0%,同时 KL 散度最低,能力与安全性变化极小。
研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。
多模态智能体框架 VideoLoop 通过外循环推理视频、内循环从无界文件系统检索历史观察并重写有界工作记忆,解决长视频理解中"语义抖动"导致的注意力崩溃问题。
ThinkV2V 是一个推理驱动的指令引导视频编辑框架,通过 MLLM-to-DiT 架构让 MLLM 在视觉生成前先对源视频和指令进行显式思考,生成精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,大幅超越 10B 规模基线。
研究者提出一种针对黑盒 LLM 的越狱框架,仅通过纯文本续写接口即可实施受控解码攻击,无需访问模型权重或 token 概率。
针对传统 token-wise MoE 因均匀专家使用正则化导致的"均匀性陷阱",SplitMoE 提出分角色稀疏架构,将专家池拆分为语义专家与通用专家,配合原型引导路由和拉推正则化,让 token 按语义属性自然聚类。在等效激活参数预算下,SplitMoE 在收敛速度、路由一致性和视频生成质量上均优于传统负载均衡 MoE。
研究提出 MIST(Misleading-Image Stress Test),用 200 个可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
一项研究通过配对预测框架测量科学解释对实验预测的增益,覆盖 336 个前瞻状态、12 个 Tox21 端点和 24 个 OpenML 任务,v5 的冻结信用判定为不确定。
针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并把裁剪区域的视觉 IDS 预测与目标序列对齐,配合整字语义奖励提供细粒度反馈。
针对现有主动测试时适应(ATTA)方法默认每个测试批次都可请求监督、导致长测试流标注成本过高的问题,研究者提出预算受限 ATTA 设定,即仅少部分测试批次可获得标签,并将核心挑战从"批内标注什么"转为"何时施加监督"。
研究者提出全自主框架 Agentic Idea Manager(AIM),用于管理并探索"想法驱动"的自动化研究,通过 Agentic Surrogate 与 Agentic Acquisition 机制组织并筛选研究想法,并以 Solution Auditor 维护想法与实现的一致性。
针对在线策略蒸馏(OPD)中教师模型需监督学生生成前缀、但自身仅按自有策略前缀优化导致续写性能随前缀变长而下降的问题,研究者提出协同训练框架 SCOUT,通过带可验证奖励的强化学习定期优化教师对学生前缀的条件续写能力。在多种教师—学生配置、模型规模和推理领域上,SCOUT 均持续提升在线策略蒸馏效果。
WorldLine 是一个动作驱动的视觉模拟器,将可迁移的动力学学习与异构动作对齐解耦,基于超过 10,000 小时无动作机器人视频学习操作动力学,并用超过 2,000 小时、覆盖十余种本体的动作轨迹完成对齐。
针对 LLM 智能体在多步决策中难以迁移到未见环境的问题,研究者提出后训练方法 EVOKE,通过在固定状态下引入目标多样性,迫使同一候选动作在不同目标下重新排序,从而激发预训练中已内化的世界知识。在三种骨干模型的多类任务上,EVOKE 提升了任务表现、未见环境泛化能力与数据效率。
OTRetarget 提出一种统一方法,可从人类演示中联合重定向机器人与多物体运动,通过带符号距离、最近表面点和相对方向表示表面交互,并用熵最优传输在人体、机器人与物体几何间迁移这些量。
FocusVTC 通过自适应分辨率打破视觉文本压缩的固定分辨率权衡,在保留通用多模态能力的同时压缩输入长度。在 RULER v1 上以 72 DPI 取得 87.4 分、2.9 倍输入压缩,超过 Glyph 的 57.5 分;LongBench 得分 56.40 高于文本输入基线的 55.86,MRCR 宏平均提升 13.91 分,在线端到端延迟较纯文本提速 2.79 倍。
TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据,恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。
SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,其训练流程包含高分辨率持续训练、强化学习后训练与最终的单步蒸馏。
研究者推出 LibraryDesignBench,一个两阶段基准,让智能体根据只定义能力与用例、不规定设计的规格实现完整代码库,再由来自不同模型族的三个用户智能体以程序正确性和简洁性评估。
研究者提出 RouteFM,通过跨异构路由环境的片段式预训练学习可复用的 LLM 路由能力,让冻结的路由器仅靠上下文即可适配新环境,而非绑定固定模型身份。在未参与预训练的 MMR-Bench 上,每个候选模型仅用 8 条观测,RouteFM 就比最强基线高出 2.23 个质量分。代码已公开。
研究在 470 万条关于提示注入与隐瞒行为的解释上,比较了模型计算信号与仅用聊天结构训练的排序器,发现聊天结构通常能选出更相关的解释,且无需为位置选择做一次模型前向传播。在四个数据集中的三个上,只解释 5% 的位置就能保留解释全部位置时几乎全部的成功率。预训练 verbalizer 还能在无需额外训练的情况下还原模型经微调学会隐瞒的词语。
一篇论文在六个领域系统评测 GPT-6 Astra 作为通用具身策略的能力,覆盖直接控制、与学习策略协作及反馈驱动适应。
论文提出 TabFM,一个 400M 参数的表格基础模型,将监督式表格预测建模为 in-context learning,单次前向传播即可产生校准的零样本预测,无需任务特定调参。
研究提出 Meta-Skill 方法,让 Builder 在模型权重冻结的测试时 AI4AI 场景中,从 Target 在开发集上的执行反馈里学习"何时需要支持、提供什么资源"的原则,再用冻结的技能库为未见任务构建执行环境。
研究者提出 SMART,一个面向长篇幅字幕翻译的自进化多智能体系统,通过测试时训练构建剧集级持久记忆,并用动态路由与 Mixture-of-Agents 层完成翻译。
Prompt2Skill 框架仅凭自然语言任务描述即可为 LLM 构建技能:从提示词推导任务规范、发现或合成数据集,并通过反思式编辑的闭环迭代优化技能。在问答、阅读理解、表格操作和数学推理四个领域,该方法在开源与前沿模型上平均提升 10.8,稳定优于直接提示基线。
HeteroFold 是一种免预填充的跨模型族 KV cache 传输方法,可在发送方与接收方均冻结的前提下,对齐模型结构、将发送方 cache 映射到接收方空间并校准以保持接收方行为。
AdviSD 让小型可训练顾问模型用自然语言指导冻结的 LLM 执行器,方法将结果导向的强化学习与选择性自蒸馏结合,用反馈条件下的顾问副本筛选反思修正。用 Qwen3-8B 顾问指导 Gemini 和 Claude 时,AdviSD 在 BFCL-v3 上比 advisor-GRPO 高 4.2-6.4 个百分点,在 EnvScaler 上高 3.9-5.1 分。
针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。
EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——连接问题级记忆演化与持久经验库,实现不同智能体之间的经验复用。在覆盖四个多模态任务域的 11 个基准上,第二个 harness 将原系统宏平均分提升 2.6 分;四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,记忆操作时间减少 67% 至 74%。
研究团队提出 LIFT,一个统一的图像到视频生成框架,用末帧布局作为显式控制信号,让用户指定未来视角中出现什么内容及其位置。由于稀疏布局引导比逐帧密集布局更难学习,LIFT 引入 on-policy self-distillation(OPSD),将密集布局教师模型的控制能力迁移给末帧布局学生模型。
研究发现,Latent WAM 虽在分布内任务上与 Explicit WAM 持平,却丢失了 WAM 原本的泛化优势,在环境扰动、数据效率和任务泛化三个维度上均出现一致退化,差距几乎全部来自第一步去噪。
研究对比六款预训练语言模型的中间残差状态与自身最终状态及其他上下文的最终状态,发现模型自身终点在早期就优于平均替代项,但许多单个终点距离更近。竞争终点集合随深度总体收缩,但其成员不断变化,存活终点之间未必更相似;方向对齐和终点排名可以改善,而到最终状态的欧氏距离变化很小。
论文提出 Context Language Models(CLMs),将上下文视为文件、由模型自由更新以原生管理自身上下文。
针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。
Real2Gym 是一个 Real2Sim2Real 智能体框架,能把人类和机器人演示视频转成可交互仿真训练场,并将仿真中学到的技能迁移到实体机器人。其仿真环境重建成功率比 GPT-6 Astra Direct Mode 高 16.7%,策略执行 token 减少约 74.9%;在真实 Franka 机器人四项任务上,实体执行成功率高出 33.3%。
PRISM 是一个 real-to-sim-to-real 框架,通过视频到视频(V2V)生成将少量真实视频扩增为数百段"反事实"人-物交互视频,再经接触锚定的 real-to-sim 流程重建人与物体运动,把不完美视频数据重定向为物理合理的轨迹。该框架训练出单一策略,可泛化到同类未见物体,并在真实机器人上零微调部署,仅用机载深度观测完成箱子、桶、储物箱和球的抓取、搬运与放置。