Latent-Foresight:为潜在世界模型端到端学习可预测表征
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于 flow 的生成式动力学模型,直接塑造具备时间可预测性的表征,取代先压缩 VFM 特征再训练预测器的两阶段流程。该方法通过防止潜在坍缩、对齐重建与生成目标等设计实现稳定联合优化,在多项未来场景理解任务和预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已公开。
Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于 flow 的生成式动力学模型,直接塑造具备时间可预测性的表征,取代先压缩 VFM 特征再训练预测器的两阶段流程。该方法通过防止潜在坍缩、对齐重建与生成目标等设计实现稳定联合优化,在多项未来场景理解任务和预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已公开。
VTR-Bench 是用于评估视频生成模型视觉文本渲染能力的系统性基准,包含覆盖广告、科学视频等五类场景的 300 条提示词,并配套自动化评估流程。在 11 个 SOTA 模型上的实验显示,场景文本渲染普遍存在困难,表现最好的模型整体词错误率(WER)为 0.250。
研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合进单一去噪过程,训练目标由 token 似然的变分下界推导而来。与把连续上下文附加到离散链上的做法不同,HC-DLM 让隐变量成为唯一持续存在的生成状态,每步从中读出 token 并反馈为下一步隐状态更新的脚手架。
研究者构建了 ScholarCatalyst 基准,让 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推动或可能推动了其项目,并附详细理由。在该检索任务中,Agentic 搜索(0.42 Recall@20)不如嵌入向量检索(0.48),即便基于 Claude Fable 5.1 的智能体也只达到 0.51 R@20。
PyRUA-Lean 框架让 GPT-6 Astra 驱动的机器人智能体在同等 LLM 调用预算下,将 LIBERO-PRO、RoboTwin 2.0 和 RoboCasa365 共 700 个仿真任务的整体成功率从 63.1% 提升至 71.7%。
AutoGUIWorld 是一个数据生成框架,用图像生成器的视觉先验加规划器的任务知识合成 GUI 交互轨迹,无需部署或运行真实软件环境。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,经动作 grounding 与转移级质量过滤,在 Ubuntu、Windows、macOS 和 Chrome 上产出 79,266 条带空间标注的 step 级训练样本。
4Director 是一个以显式 4D 场景表示为条件的视频世界模型,每个物体从输入图像重建为规范网格,并由每帧一个预设刚性变换驱动。它把受控场景渲染为深度视频,再用 Motion Adapter 生成视角一致的外观、光照与非刚性动态。
RPTune 是一个将学习式目录筛选与 LLM 后训练耦合的端到端框架,通过编码器-重组器筛选器依据下游 LLM 反馈对商品排序和剪枝,并用上下文相对奖励提升后训练效果。在 7 个真实商家的 100 条复杂对话查询上,上下文筛选带来最高 31.4 个百分点的搜索准确率提升,后训练平均再提升 10.3 个百分点,在闭源与开源权重 LLM 上均有效。
研究发现,将嵌入模型从 T5 扩展到 T5Gemma-1、T5Gemma-2 可显著提升扩散语言模型生成性能,但原始 T5Gemma-2 嵌入区分度过高,导致连续扩散易落入无效嵌入。
Ego2Act 是一个面向目标导向的第一视角视频生成基准,包含来自 110 个真实世界任务的 2,640 段视频,覆盖不同物体杂乱程度与多步复杂度。该基准要求模型根据初始场景图像和高层目标,生成手部操作物体完成任务的逼真第一视角视频,并配套推出无参考评估流程 Ego2ActJudge。
World Observer 通过将"观察"与"行动"解耦,联合生成一个 actor 视角与一个或多个全景 observer,使离开 actor 视野的物体在 observer 中持续演化,重新进入视野时能反映更新后的状态。
Meta 等机构发布 Context Language Models(CLMs)论文,让语言模型把上下文当作文件、原生自主管理上下文,无需外部 harness。
LongLive-Plug 视频生成的通用蒸馏 论文:https://huggingface.co/papers/2609.38154
Omni-IO Skills 让你的智能体原生全能 paper: https://huggingface.co/papers/2609.31847
LEGO-Anything 用于 3D 场景重建的编码智能体 论文:https://huggingface.co/papers/2609.36380
安全研究员 Johann Rehberger 在 BlueHat Asia 2026 上报告 Microsoft SQL Server Management Studio 中 SQL Copilot 的 SQL Server 提权漏洞 CVE-2026-65669,微软评级为 critical,建议用户保持安装更新。
论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。
LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留过去观测的 key-value 缓存,其余块仅处理当前 chunk 并辅以读写受投影相机几何条件约束的循环线性注意力记忆,使视角同时进入记忆寻址与存储内容。
哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。
推荐理由:作者结合自身跨学科项目,说明如何让 Claude 承接适合其能力的问题,并总结了与专家协作及规避模型失败模式的经验。
Google DeepMind 团队在 Nature 发表论文,提出可为 AI 设计的蛋白质序列加上水印的 SynthIDBio 系统,在不影响蛋白质功能的前提下标记设计来源。
MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。
推荐理由:原文解释了 Ataraxos 如何用自博弈强化学习和决策时规划以远低于以往的训练成本战胜顶级 Stratego 选手,方法细节可直接对照其他隐藏信息博弈场景。
Artificial Analysis 发布 AA-Video-T2V v2.0 和无音频版 AA-Video-T2V-Silent v2.0 文生视频基准,统一以 1080p 高码率评估,按 10 种用例、10 种能力和多种视觉风格排名,分别基于超 68,000 票(1,000+ prompts)和超 47,000 票(500 prompts)的人工偏好投票。
腾讯混元联合复旦、清华发布 ExplorationBench,用可执行规则的 Alien Worlds 评测 AI 自主探索能力,含 AlienCode(31 条隐藏规则改动、70 任务)和 AlienLogic(24 条推理规则、70 定理)两个沙盒。
当前的 harness 在 LLM 如何管理自身上下文方面设置非常僵化。我们展示了你可以让 LLM 直接编辑上下文——从而实现更好的长时程记忆、FLOP 高效适配,以及更多。 不用再害怕 compaction 了!
面壁智能联合清华 THUNLP 提出 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种合理判断。
BlueQubit 团队使用 IBM 120 量子比特的 Nighthawk r2 处理器,在 36 个周期、918 个双量子比特门配置下仅用 19 秒完成 100 万次随机量子线路采样,研究人员估算 Frontier 超级计算机复现同等任务约需 110 年,约 1.2 × 10²⁷ 次计算操作。
SpatialClaw 重新思考智能体空间推理的动作接口 论文:https://huggingface.co/papers/2606.13673
NVIDIA、MIT 和牛津团队发布 Physis-Lang,一个自进化的物理语言框架,通过在视频描述中加入 physics_reasoning 字段和 physics_negative_prompt,把物理语言用于数据筛选、训练和推理。
Jack Hughes、Ben Collier 和 Daniel R. Thomas 的论文分析近10万条网络犯罪论坛相关帖子,提出 vibercrime 一词:AI 是便利帮手而非犯罪的即插即用工具。生成式AI 主要扩大垃圾网站、机器人账号和拟人化诈骗信息的规模,编码助手多为已有编程能力者省时,尚未显著降低技术门槛或催生创新性黑客手段。
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上,该方法持续提升超长视频时序定位准确率,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著提升。
一项受控实证研究对比了 TypeSafe AI 称为"System One Model"的 Jev 与推荐专用模型及 pointwise、listwise Qwen 重排序器在多个 Amazon Reviews 领域和候选集规模下的推荐重排序表现。结果显示 Jev 在保持较强推荐效果的同时,延迟增长比 pointwise Qwen 重排序器更为平缓,但服务延迟仍显著高于推荐专用模型。
SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并加入轻量 head,使每个保留的 token 前缀都能单独重建这些特征。201M 的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的各噪声水平上为解码器提供更高语义对齐。
AutoDataBench 是一个隔离数据因素、专门评估 LLM 数据智能的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,并在工具使用、检索和知识注入场景下评测前沿模型迭代改进训练数据的能力。该平台还通过对比训练前预测与实际结果,检验 LLM 是否真正理解数据干预的效果,而非仅靠试错。复用 AutoDataBench 轨迹进行中期训练可提升下游编码性能。
偏好蒸馏中,用更小的冻结模型生成拒绝样本,比学生模型自生成样本训练效果更强,且推理算力更低。研究在 7B 到 72B 学生模型上验证了这一点,覆盖代码生成与数学推理任务,序列级知识蒸馏前后均成立。作者还给出 DPO 的有限时域效用上界,并据此提出混合不同规模拒绝样本、打乱 token、优先选择参考策略下低概率候选三种改进手段。
研究者提出 Box^2-Bench,在固定模型与任务的前提下改变工作流可靠性,以衡量语言模型能否在受益于可靠指导的同时覆盖不可靠指导,即"跳出框框"的能力。测试显示前沿模型虽能从可靠指导中获益,但在指导具有误导性或变得不可靠时仍很脆弱。团队用坏工作流训练两个开放权重模型,发现反事实监督微调可提升鲁棒性,而基于结果的强化学习能提高对有用工作流的使用,该行为还可迁移到同行纠错和受损记忆的鲁棒性上。
小型自回归 Transformer 仅用受限参数区间采样的轨迹训练,就能在训练分布之外的参数上闭环复现倍周期分岔、混沌动力学与吸引子结构。在 logistic 映射上,模型重现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。因果干预显示,控制参数信息经注意力机制进入状态预测,并塑造闭环动力学。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
UniEvo-VL 提出一种无需外部教师模型的多模态自进化训练方案,让同一模型分别以学生和教师身份、基于不同上下文进行在线自蒸馏,在自身采样轨迹上最小化去噪扩散分布差异。
研究发现,d'Ascoli 等人(2025)的脑电转文本方法在完全不含脑信息的合成信号上仍达 22.0% 平衡准确率,接近真实脑数据的 22.3%,原因是按词起始切分的重叠窗口隐含泄露了词时长信息。作者改为独立处理每个窗口,使同一词多次神经响应的预测聚合与预训练 LLM 语言先验都明显更有效,SimpleB2T 在感知语音基准上每词五次观测的词错误率为 36.6%。