SMART:面向长篇幅字幕翻译的自进化多智能体系统
研究者提出 SMART,一个面向长篇幅字幕翻译的自进化多智能体系统,通过测试时训练构建剧集级持久记忆,并用动态路由与 Mixture-of-Agents 层完成翻译。
研究者提出 SMART,一个面向长篇幅字幕翻译的自进化多智能体系统,通过测试时训练构建剧集级持久记忆,并用动态路由与 Mixture-of-Agents 层完成翻译。
Prompt2Skill 框架仅凭自然语言任务描述即可为 LLM 构建技能:从提示词推导任务规范、发现或合成数据集,并通过反思式编辑的闭环迭代优化技能。在问答、阅读理解、表格操作和数学推理四个领域,该方法在开源与前沿模型上平均提升 10.8,稳定优于直接提示基线。
HeteroFold 是一种免预填充的跨模型族 KV cache 传输方法,可在发送方与接收方均冻结的前提下,对齐模型结构、将发送方 cache 映射到接收方空间并校准以保持接收方行为。
AdviSD 让小型可训练顾问模型用自然语言指导冻结的 LLM 执行器,方法将结果导向的强化学习与选择性自蒸馏结合,用反馈条件下的顾问副本筛选反思修正。用 Qwen3-8B 顾问指导 Gemini 和 Claude 时,AdviSD 在 BFCL-v3 上比 advisor-GRPO 高 4.2-6.4 个百分点,在 EnvScaler 上高 3.9-5.1 分。
针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。
EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——连接问题级记忆演化与持久经验库,实现不同智能体之间的经验复用。在覆盖四个多模态任务域的 11 个基准上,第二个 harness 将原系统宏平均分提升 2.6 分;四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,记忆操作时间减少 67% 至 74%。
研究团队提出 LIFT,一个统一的图像到视频生成框架,用末帧布局作为显式控制信号,让用户指定未来视角中出现什么内容及其位置。由于稀疏布局引导比逐帧密集布局更难学习,LIFT 引入 on-policy self-distillation(OPSD),将密集布局教师模型的控制能力迁移给末帧布局学生模型。
研究发现,Latent WAM 虽在分布内任务上与 Explicit WAM 持平,却丢失了 WAM 原本的泛化优势,在环境扰动、数据效率和任务泛化三个维度上均出现一致退化,差距几乎全部来自第一步去噪。
研究对比六款预训练语言模型的中间残差状态与自身最终状态及其他上下文的最终状态,发现模型自身终点在早期就优于平均替代项,但许多单个终点距离更近。竞争终点集合随深度总体收缩,但其成员不断变化,存活终点之间未必更相似;方向对齐和终点排名可以改善,而到最终状态的欧氏距离变化很小。
论文提出 Context Language Models(CLMs),将上下文视为文件、由模型自由更新以原生管理自身上下文。
针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。
Real2Gym 是一个 Real2Sim2Real 智能体框架,能把人类和机器人演示视频转成可交互仿真训练场,并将仿真中学到的技能迁移到实体机器人。其仿真环境重建成功率比 GPT-6 Astra Direct Mode 高 16.7%,策略执行 token 减少约 74.9%;在真实 Franka 机器人四项任务上,实体执行成功率高出 33.3%。
PRISM 是一个 real-to-sim-to-real 框架,通过视频到视频(V2V)生成将少量真实视频扩增为数百段"反事实"人-物交互视频,再经接触锚定的 real-to-sim 流程重建人与物体运动,把不完美视频数据重定向为物理合理的轨迹。该框架训练出单一策略,可泛化到同类未见物体,并在真实机器人上零微调部署,仅用机载深度观测完成箱子、桶、储物箱和球的抓取、搬运与放置。
APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观与开放式问答。模型需借助持久记忆回答过往会话问题并主动响应,同时保持实时交互。评测显示现有方法在效用、延迟与存储之间存在明显权衡,难以同时实现可靠的长期召回、低开销和有效的跨会话主动协助。
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以答案覆盖率为优化目标,最大化所选模型中至少一个给出正确答案的概率。该方法将路由建模为覆盖导向的子集选择问题,用 Determinantal Point Processes(DPPs)刻画模型能力与冗余度,并通过基于失败集边缘化的训练目标直接优化覆盖率。
研究者提出 CorpusMap,一种围绕语料中反复出现的实体组织文档的导航层,将每个实体表示为 Entity Page,聚合并链接所有提及该实体的文档,形成可供智能体遍历的实体—文档图。
HybridCUA 提出让计算机使用智能体(CUA)同时编排 GUI 与 CLI 的训练方案,先构建含 5K 混合轨迹与 3K 可验证 RLVR 任务的 HybridCUA-8K 数据集,再经监督微调加 CLI 感知奖励的强化学习两阶段训练。
研究者提出 ActFirst-OPD,一种"先行动、后推理"的 on-policy 蒸馏训练框架,将环境交互与完整回复生成解耦:学生模型借助参考条件逆动力学推断并执行动作,当实际转移偏离参考轨迹时切换为自主预测下一动作,再异步生成完整 think-then-act 回复接受 token 级教师监督。
研究者提出 Parallel Power Tempering(PPT),用并行回火实现幂锐化采样,让多个不同锐化程度的副本并行交互,低幂副本负责探索多样推理路径、高幂链负责利用高概率回答,从而缓解探索与利用的权衡。PPT 缓解了此前幂采样器的截断偏差,并研究了有限内存与算力预算下的交换策略。实验显示其显著优于单链幂锐化采样,超过 RL 后训练模型,推理轨迹质量更高,性能甚至可比前沿模型。
研究首次系统探索像素扩散模型的对抗后训练:在预训练模型上保留原有扩散或流匹配目标,对非高噪声时间步的预测输出加入对抗损失,架构与采样流程不变。在两个像素骨干上,该方法同时提升了分布保真度、覆盖度、提示词对齐和感知质量;频谱分析显示原模型系统性缺失自然图像高频成分,对抗后训练可将其恢复。在测试的潜空间扩散配置下,同样流程未带来可比增益,几乎不增加解码后的高频功率。
AREX-2 通过从机器学习和算法编程任务合成长期改进轨迹,训练出基于 Qwen3.8-27B 的智能体,在 MLE-bench Lite 上得分 81.8、Frontier-CS 上 70.7。
研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的"有效注意力集合"大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小,而重归一化保留权重可大幅降低该规模。
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 组合,用共享模块迭代更新统一的视觉语言状态,并从零开始完成语言预训练、多模态训练与后训练。它在多模态理解与视觉推理基准上超过多款同规模及更大规模的非循环模型,还出现跨循环视觉注意力显著转移的 Visual Aha Moments。
SaveRouter 是一个稀疏监督的 LLM 路由框架,只选择性获取有信息量的模型反馈并在相关查询间共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈就保持或超过竞争方案的 routing 质量,并将盈亏平衡部署量较最快的传统路由器降低约 1.9–9.5 倍。该研究同时把监督开销与后续服务节省一起纳入评估,发现最小化服务成本的监督水平未必等于最早回本的监督水平。代码已公开。
改进的分布扩散模型(DDM)通过将粒子扩展推迟到 Transformer 后层,并引入基于动力学区间的时间相关评分规则调度,解决了多粒子训练开销随粒子数增长、评分规则超参数全局固定的问题。
TabFM-Auto 将表格基础模型 TabFM 与语言模型智能体结合,通过迭代优化数据清洗、特征工程、上下文选择和后处理来降低 TabFM 的误差。在 TabArena 全部 51 个数据集上,五种不同智能体与语言模型配置的 TabFM-Auto 包揽前五名,最佳配置将 TabFM 的 Elo 从 1785 提升至 2013。
Rules to Tools(R2T)为科学计算场景的 LLM 智能体提供公开科学需求的可执行检查。在匹配的 SciCode 修复任务中,文本组完整修复 26/30,工具组 29/30;8 个任务 ID 队列为 13/16 对 15/16,而更大的共享定义队列两组均为 13/24。
针对联合音视频扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励协调方式。
研究指出系统提示中被隐藏注入的当前日期会让 LLM 评测结果随日期波动,影响可复现性和排行榜公平性。在 9 个模型和 6 个数据集上,仅因日期变化,多项选择题 QA 最高波动 6%,数学推理 14%,代码生成 7%,机器翻译 2.84 BLEU,模型排名也会因此改变;该效应超过 batch size 和数值精度等非确定性来源,链式推理和 few-shot 提示均无法缓解,链式推理甚至放大波动。
SAKI(Supervision Allocation with KL-constrained Interpolation)将 KL 约束的教师引导 rollout 与最大耦合结合,按 token 级接受/纠正事件路由监督:接受位置保留采样 token 的反向 KL 监督,纠正位置直接监督教师最高概率 token。
一项受控实验系统考察了循环语言模型(LoopLMs)中循环机制的适用条件、作用位置与条件注入方式。结果显示,循环可提升超出训练范围的推理表现,但会损害知识类任务,且更难的推理样本未必获益更多;非循环输出层能提升欠展开时的鲁棒性。
EngiWorld 是首个围绕完整设计闭环构建的工程智能体基准,包含 6 大工程领域(CAD、CAE、CAM、BIM、EDA、3D 可视化)、26 个专业软件平台的 1,301 个专家精选任务,覆盖 GUI 与 CLI 界面及 6 类任务。
研究者提出 ALICE,一个仅用合成分布训练的基础模型,可在上下文内估计未见分布的 rectified-flow 速度场,并通过固定恒等式积分联合场与条件场之差的平方得到互信息。ALICE 无需按分布单独训练,原生支持不同数据维度和样本数量,在标准基准及生物学、遗传学、神经科学三个领域实现零样本互信息分析,首次让单一模型追平按分布分别训练的神经估计器。
Scaffolding Minds 针对潜在推理两阶段框架的两个缺陷提出改进:用专门学习的 scaffolding encoder 在潜在空间提供优化目标,并同时学习 RL 采样器的均值和方差以支持探索。该方法在 FrozenLake 空间规划上比最强潜在推理基线提升 +9.5 分,32x32 网格上提升扩大至 +19 分,在九个视觉中心推理基准上平均提升 +5.6 分。
研究提出智能体主动性的内容维度:横向主动性追问当前上下文已隐含的信息,纵向主动性追问只有早期证据才能揭示的需求。基于基准自身分解构建的 need graph 可在无模型评判的情况下对两种主动性打分。Q&D 训练提问者偏好能检索更多所需证据的问题,在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过 15 倍大的提示模型。
HiRAE 提出分层表示自编码器,按深度对编码器各层分组并学习对最深表示的残差修正,用分组范数上限约束修正幅度、浅层预算更紧。HiRAE-24 保持潜变量 token 数与通道维度不变,在 ImageNet-256 上将重建 FID 从 RAEv2 的 0.299 降至 0.209,并维持有竞争力的引导生成质量。
Every 评测 OpenAI DevDay 2026 发布的 20 多项产品和功能。作者实测后认为 Dots 持久智能体已改变其使用习惯但 bug 较多,Space 办公套件体验较好;Decisions API 在部分测试中以 76/78 对 73/78 的准确率和 230 毫秒对 500 毫秒的响应速度优于 Jev,但另一些测试落后,定价未公布。
推荐理由:作者上手实测了 DevDay 多款新品,给出 Dots、Space 和 Decisions API 的第一手使用体验与测试数据,可帮助读者判断哪些值得现在尝试。
PixelUMM 是一个无需视觉编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成。它将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干,并采用 Mixture-of-Transformers 架构结合共享注意力与任务专属参数,同时支持自回归文本预测和像素空间流匹配。
研究通过配对 I2I 生成与 I2T 理解任务发现,在合适训练配方下 I2I 训练能提升下游 I2T 表现,且 I2I 训练数据越多增益越大。
针对音视频大语言模型(AVLLM)的"来源混淆接地幻觉",研究者通过路径干预与表征分析发现"问题中继"机制:问题状态会携带干扰模态的线索,削弱对所需模态证据的接地。