Physis-Lang:以自演化语言作为视频世界模型的物理表征
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
UniEvo-VL 提出一种无需外部教师模型的多模态自进化训练方案,让同一模型分别以学生和教师身份、基于不同上下文进行在线自蒸馏,在自身采样轨迹上最小化去噪扩散分布差异。
研究发现,d'Ascoli 等人(2025)的脑电转文本方法在完全不含脑信息的合成信号上仍达 22.0% 平衡准确率,接近真实脑数据的 22.3%,原因是按词起始切分的重叠窗口隐含泄露了词时长信息。作者改为独立处理每个窗口,使同一词多次神经响应的预测聚合与预训练 LLM 语言先验都明显更有效,SimpleB2T 在感知语音基准上每词五次观测的词错误率为 36.6%。
论文研究野生 AI 生成网页文本对语言模型预训练的影响,发现 FineWeb 过滤后 2026 年 6 月网页数据中 27.5% 的 token 被 Pangram 标为 AI 生成,8 月升至 31.1%。
SpatialCORE 是一个后训练框架,将模型对生成式定位的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将定位优化与最终答案正确性绑定。该框架在多个 benchmark 上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
PhysVista 是一个通过"感知-推理-评估"闭环框架评测 VLM 物理智能的 benchmark,联合考察物理状态感知、物理动力学推理与物理合理性评估,并区分事件级与尺度级推理。它同时纳入真实世界与 AI 生成视频,覆盖多领域及新兴生成场景。实验显示,多种 VLM 在物理推理与合理性评估上存在明显不足,视觉识别与真正的物理理解之间仍有持续差距。
SkillSeek 是一个开源两阶段 Agent 技能检索器,由 BGE-base 双编码器接小型 cross-encoder 组成,并通过 MCP 暴露。在 89 任务的 SkillsBench 上,其 4×11 网格实验中 bm25 在四分之三设置下通过率不低于 LLM 介导检索循环,cross-encoder 补齐剩余差距,单次试验成本从 51.30 美元降至 27.54 美元。
论文提出面向 vLLM、SGLang 和 llama.cpp 的内存层 Galahad,把模型对同一段文本的读取从重复计算变为一次性成本。
PixelDense 将 DINOv2、SAM2 与 Depth Anything v2、Metric3D v2 分别路由到语义和几何两条投影流,并用权重空间正交惩罚让两流保持子空间不相交,四个教师模型训练时冻结、推理时丢弃。
研究者提出首个基于用户历史(评论、帖子、图片、caption 与元数据)的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务及多轴评测协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的"推理-反思"循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
世界模型引导的机器人技能教练框架 RoboCoach 通过 Route-Imagine-Diagnose-Improve(RIDI)循环,在共享动作条件世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些子任务演示、更新哪些专家适配器。
研究者提出 Game-Guided Skill Discovery(GGSD),通过在游戏中自对弈发现人类可直接操控的机器人运动技能。该方法让分层智能体与自身历史版本对抗,高层策略从少量离散技能中选择、低层策略学习对应行为,训练后人类可替换高层策略直接操控智能体。
GraphForge 是一个基于证据图的工作型智能体训练数据合成框架,从职业种子出发为每个种子组装真实文件工作区,并基于文件关系构建证据图,使任务描述与评分标准都由该图派生、每条标准锚定到可验证的文件。
多智能体系统通过潜在通信直接交换内部表示,可降低 token、计算与延迟开销,但研究发现即使良性链路训练也会提高有害请求的顺从率。一种强化学习攻击在三种通信拓扑和四个安全基准上,将平均有害顺从分数从 27.9 提升至 76.9,同时在两个良性效用基准上取得更高平均准确率。调整奖励以偏向更安全行为可修复受损链路,无需更新智能体即可大幅降低有害顺从。
研究者提出 Soft Spatial Reasoning,一个面向 LVLM 空间任务的训练后框架,在每步推理中混合 token 嵌入形成连续软状态,而非硬性选定单个 token。
一篇综述将 LLM 注意力机制的发展统一为"模型内部上下文记忆"视角,提出涵盖记忆表示、更新、访问、读取与整合的五维分析框架。研究基于 14 个主要模型谱系、59 条发布级记录和 11 个高性能开放权重端点,重建了机制层面的演进与架构采用情况。综述指出,高效序列架构设计正从孤立的 Attention 算子转向上下文记忆的组织、生命周期与选择性使用,并据此提出有状态多维记忆路由假设。
研究者提出 Neighborhood OPSD(N-OPSD),通过局部参数扰动构建冻结专家池,在相同参考解上下文下提供互补的参考对齐修正,并用 MaxPeak 选锚点 token、分位数选择匹配专家,学生仍用 OPSD 的 clipped forward-KL 目标学习。
研究者提出 HIDE 基准,用 15 项任务评测部分可观测条件下的机器人操作记忆,涵盖重复计数、历史状态回忆与执行进度跟踪,并设置随机初始配置和需依赖先前事件才能正确决策的决策点。同时提出 SEEK 框架,组合三种互补记忆机制保留历史证据并跟踪执行状态。评测显示现有策略在 HIDE 上存在明显不足,记忆增强在仿真与真实实验中均提升任务成功率,三种机制组合取得最高平均成功率。
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重,且不改变底层策略优化目标。在工具调用任务上,DARA 达到高格式合规所需训练步数比 GDPO 最多减少 26%;在数学推理任务上,接近饱和的长度合规所需步数最多减少 65%,最终性能保持竞争力。
针对潜在世界模型中规划相关的新颖性结构在表征变换中被削弱的问题,研究者提出训练目标 ATLAS,将编码器表征中的归一化成对结构传输到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布。
研究团队构建了 95 小时城市步行游览视频数据集 WT++,用于严格按时间顺序、滑动窗口批次的流式自监督预训练。结果显示对比学习和蒸馏方法在此设置下表现不佳,MAE 更稳健但仍不及标准 i.i.d. 预训练,主要瓶颈是批次内帧高度相似。
研究团队推出 EgoTools,首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集描述与 3D 信息的 EgoTools-Data,以及覆盖四个赛道的 1000 对 QA 诊断基准 EgoTools-Bench。
SCLATE 是持续学习智能体的训练与评估执行基座,基准测试和未修改的智能体可通过适配器把事件加入同一个开放事件调度器。
研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个基于 Unreal Engine 5 和 Three.js 构建的环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五款前沿模型,两种审计范式的成功率仅为 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。
一项覆盖 500M 至 7B 四种参数规模、PT 预算最高 100B token 的研究显示,合成非自然语言数据上的预预训练(PPT)带来的下游性能与 token 效率提升可随规模保持,在 3B 规模下至少节省 21B PT token。但与先前工作不同,研究未发现一致证据表明这些收益来自语法先验,收益实际来自改善长程检索的 PPT 任务,且仅在 PT 数据混合中缺少网页文本时才会减弱。
DexPolicy 将探索噪声尺度设为训练步数的显式函数,从宽到窄退火,在 PPO、GRPO 和流参数化 PPO(FPO)三种设置下提升轨迹引导灵巧操作的成功率。
自进化搜索智能体存在"共谋作弊"失效模式:生成问题的 proposer 与作答的 solver 在共享错误上日益一致,内部奖励上升但外部正确性停滞。为此提出 CrossFit,将 proposer 的源文档分为 A、B 两组,交叉用对方数据训练的辅助 solver 打分决定奖励。
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长期基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器、读取器骨干和记忆系统泛化。
针对目标在未被观察时移动、导致记忆位置失效的问题,研究者提出 EvolvingNav,通过带时间戳的 3D 物体历史构建时间索引信念,用结构化持久-迁移模型区分目标停留与迁移,并以事件驱动滤波器随时间传播信念、预测候选检查时刻的目标占据情况。该方法同时引入基于人类活动轨迹的 EvoWorld-Bench,含 54 个场景、803,680 个任务,在仿真与真机实验中提升了导航成功率和搜索效率。
Memorizon 提出一种训练方法,让流式世界模型在远超上下文窗口的长跨度上接受监督:训练样本可覆盖任意长度,但只对最后 k 个 chunk 计分,每个计分 chunk 通过相机共视性检索自己的 top-K latent,其并集构成受 kK 约束的共享 bank,使序列长度保持有界。
EviRover 是首个显式训练通过交互解决感知查询的感知智能体,采用监督微调加智能体强化学习,并配套发布 EviRover-SFT-5K、EviRover-RL-12K 数据集与 688 条实例的 EviLens 基准。4B 版本在 EviLens 上平均超越其骨干模型 30 分,达到先进闭源模型水平,并在 BrowseComp-VL 上提升 15 分。代码、模型与数据均已开源。
RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,缓解迭代优化对少量测试用例的过拟合。在 140 个 GameCraft-Bench 任务、两个游戏引擎和五个生成器上,RSIGame 在相同开发预算下持续提升游戏质量。
研究分析 JEV 1.13 与三个开源 KEV 模型,发现直接决策模型存在"序数尺度利用偏差":在 ANLI 上 JEV 准确率 74.95%,却把 38.8% 的预测和 51.3% 的错误都归为 Neutral。
研究者发布 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,覆盖 9,961 个源任务。
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunk,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场,并用联合注意力实现跨模态交互。
PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型避免关键错误并从其造成的状态中恢复。研究在三个 Qwen3 模型(8B 至 235B)上发现,超过一半的失败轨迹包含早期出现的关键错误,且引导模型在关键轮次后仅几轮即可恢复任务成功。
针对 AI 审稿人会因措辞不同而对同一科学内容给出不同判断的问题,研究者提出修辞鲁棒性概念并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿人配置。
DC-SAE 是一种解耦紧凑语义自编码器,通过语义编码器实现高压缩比、并用像素级编码器保留细节,从而兼顾高压缩与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较 DC-AE 分别提升 13.5% 和 54.9%。
零样本机器人抓取系统 BeyondSCe 可处理"指代过去事件角色"的抓取请求,即使目标当前不可见也能定位。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标的抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%。在四个重度遮挡场景中,成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。