ProVer:为智能体 RL 精准分配信用
ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。
ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。
微软提出免训练方法 FOCUS,在测试时压缩 AI 智能体的交互历史:它判断智能体下一步决策真正依赖哪些历史片段,保留这些片段、丢弃其余部分,无需训练数据或微调,可作为独立层接在闭源 API 模型前。在工具调用、QA、网页与多轮对话基准上,FOCUS 将峰值上下文最多削减 48%,任务成功率最多提升 8.9 个百分点。
arXiv 自 10 月 1 日起实施新速率限制,所有投稿者每月提交上限为 2 篇,同时在审活跃稿件上限为 3 篇。官方博文称 2026 年 9 月单月收到 40,363 篇投稿,较 2024 年 9 月的 20,569 篇翻倍,同期支持工单激增至近 9,000 个。
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长周期任务,智能体无法看到彼此内部状态,只能通过消息和共享计划协调。
Meta Superintelligence Labs 提出用专门的控制器决定智能体下一步该做什么,在相同 worker 和相同预算下,GPT-5.5 的 ProgramBench 成绩从 63.7% 提升到 71.5%,Codex 为 58.0%。
Apple 研究团队从理论上证明,扩散模型(含 remasking 与 uniform-state 采样器)的每一步只有在所写入位置在已固定 token 条件下相互独立时,才与训练分布匹配,而任何逐位置分布的乘积都无法匹配存在依赖关系的 token 组。
Meta AI 与数学家合作,使用 Muse Spark 1.1 和 1.2(Thinking Mode、经 meta.ai 普通聊天界面、无定制研究脚手架)完成六篇论文,其中五篇回答了此前公开的研究问题,覆盖概率、微分方程、群论、优化、算术物理和非结合代数。
推荐理由:Meta 展示了 AI 与数学家协作解决六个公开数学问题的成果,并公开了人机分工与独立验证的协作规范。
Apple 研究团队发现,在预训练中强化语言判别能力可缩小多语言语音模型与单语言模型的差距。在英语/法语 HuBERT 对照实验中,双语基线 phone-ABX 错误率从 11.6% 降至 10.4%(单语言为 10.8%),sWUGGY 从 52.1% 升至 56.7%,ProsAudit 词汇子任务从 68.9% 升至 72.9%。
Base Labs 复现了 RL 优化轨迹近似"直线"的结论,发现将 Qwen2.5-1.5B 在 MATH 上的首个梯度步放大 1000 倍,效果超过 500 步 RL 训练的模型(66.7% vs 63.8%)。
LG AI Research 在 ICML2026 机制可解释性研讨会上报告了将机制可解释性(Mech. Interp.)应用于图 Transformer 的工作,研究对象为此前的 TokenGT(T5 encoder)。
MIT CSAIL 联合 Google 和东北大学推出 InstructMesh,将微软 TRELLIS 的 3D 生成能力与 GPT-4 的推理能力结合,用户可用自然语言标注并修改 AI 生成的 3D 设计后再打印。
这些趋势来自一个自我选择的用户样本。数据未经加权处理,不代表美国成年人或 ChatGPT 整体用户的人口结构。 阅读我们的完整报告:https://epoch.ai/latest/introducing-the-chatgpt-usage-explorer 自行探索数据:https://epoch.ai/data/chatgpt-usage
Epoch AI 收集了 5000 名 ChatGPT 用户的使用模式元数据,并在新的 ChatGPT usage explorer 中公开。数据历史覆盖 2022 年 12 月至 2025 年 12 月,显示该用户群体随时间推移对 ChatGPT 的使用强度不断提高。
Microsoft 论文提出 Coding-Agent Skill Distillation(CASD),把 agent 的已有日志交给普通编码 agent 写代码做语料级统计,识别重复失败模式并生成优化后的系统提示词,无需迭代回滚。
NVIDIA 新论文提出,与其给 AI 智能体更多选项,不如给它一个更好的裁判:让小型智能体每步生成 8 个候选命令,再由裁判模型挑选执行。用前沿强模型当裁判时,成功率从 50% 提升到 68%,且无需重新训练;若由小模型自评,提升则小得多。
Meta 等机构提出 Context Language Models(CLM),把上下文作为文件让模型用 Bash 自由编辑,自主决定保留、重写或删除内容,并区分于 RLM 不允许模型直接编辑实时交互上下文的做法。zero-shot 下在 BrowseComp-Plus 上比现有上下文管理策略高 11.4% 准确率、省 21.5% FLOPs;在线 RL 使 Qwen3.5-9B 提升 47.6% 且少用 12% FLOPs;配套 Suffix Cache Reuse 相比标准 SGLang 降低 35% 服务端计算。论文链接:https://academy.dair.ai/papers/context-language-models-2609.37725
Meta 等机构发布论文提出 Context Language Models(CLM),将上下文作为可读写的文件让模型用 Bash 自主编辑,决定保留、重写或删除内容。
Adobe 提出把标准答案写成每次运行都重新取数的代码,再由 AI 评分器对照检查智能体回答。在 53 个测试用例上,这种做法的 AI 评分与人类专家的一致率比文字描述答案高 29%,且少用 16% token;若没有可对照的答案,AI 评分器表现还不如随机。论文题为《Skill-based Agentic Evaluation for Real-time Data Science Tasks》。
Google DeepMind 联合牛津、芝加哥大学论文探讨 AI 大量取代工作后政府应如何保障民众,结论是没有任何单一政策在所有情景下都有效。再培训等最受欢迎的思路只在 AI 持续创造新岗位时有用,否则只是重新分配剩余岗位。作者建议现在扩大失业救济与低薪税收抵免,失业持续则把抵免转为收入下限,劳动者经济份额持续下降则让公民持有公共投资基金份额。
Meta 论文提出 Meta-Reasoning Agent,让 worker 执行任务、独立 controller 决定下一步,在最大预算下于全部 12 项对比测试中胜过无 manager 的同款智能体。用 GPT-5.5 跑代码基准时,预算增至 3 倍,得分从 64.1% 升至 71.5%,而对照智能体停滞在 64% 附近。
ActiveSaddler 将 Agent harness 优化中"训练场景如何选择"这一维度建模为非平稳 bandit 问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计各模式的潜在学习收益,在复现已知弱点与探索新场景之间自适应平衡。
研究者提出 InFlowOp,用统一的"无标签成本"为多智能体工作流中的每个决策定价,在执行前双向决定任务分解粒度与智能体分配,执行中以最低成本修正故障。团队同时发布需要多智能体协作的基准 Braid,在多个领域和骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料库中检索草稿 token,并按智能体离线画像设定草稿长度上限、再依据验证反馈在线调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器和 EAGLE-3,batch size 1 时生成吞吐较自回归解码最高提升 4.37 倍,batch size 16 时最高 4.76 倍。
针对多智能体工作流中仅训练生成器、其他智能体固定的局限,研究者提出 FloWright,通过分层、结构感知的奖励范式让一个角色自我进化、两个及以上角色协同进化,无需额外模型、标注或执行。
Omni-Embed-Mini 是一个 0.9B 参数的多模态嵌入模型,可将文本、语音、音频、图像、视频和富视觉文档映射到同一余弦空间,且不更新任何文本侧参数。
PROWBench 基准发布,包含 170 个程序化构建的 episode 和 600 段代理视频,用于检验视频模型对程序指定世界事件的视觉还原能力。该基准记录实体状态与带时间戳事件(含镜头视野外事件)作为可回放世界记录,并渲染同步视图,覆盖第一、第三人称视角。
研究者提出 Stability-Aware Generalization Objective(SAGO)框架,从生成一致性、内部激活、置信度和响应镜像等多个维度衡量 LLM 在输入变化下的行为波动。实验显示,常用模型普遍存在统计显著的泛化不稳定性,没有模型能均匀泛化,不同行为轴捕捉到独立的失败模式,跨数据集变化甚至会逆转模型排名。
InterEvolve 通过测试时进化奖励程序,让控制器无需重新训练即可完成未训练过的人形机器人移动操作任务。该方法结合物体感知的前向-后向行为基础模型与 LLM 智能体,后者依据执行反馈和已验证程序技能库修改奖励程序结构,数值优化器负责调参。实验显示,进化出的程序释放了 FB 模型未被人工奖励触及的能力,并可在 Unitree G1 实体机器人上基于第一视角感知自主运行。
研究提出 Temporal Activation Injection(TAI),一种无需训练的方法,通过在推理阶段将中间层的时间散度向量 τ_l 按衰减规律重新注入后续层,解决 VideoLLM 时间推理能力随层数加深而衰减的问题。该方法在三个 VideoLLM 和四个 benchmark 上一致提升时间推理表现,对非时间任务影响可忽略。
Zyphra 发文解释混合架构中全局 NoPE 注意力如何获得位置信息:滑动窗口注意力等局部混合层在残差流中留下随相对距离变化的近因偏置结构,训练中全局层的 query/key 投影学会读取该结构,形成隐式相对位置编码。
一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。
OmniSeek 是一个将 Omni-LLM 转变为原生工具调用多轮推理智能体的框架,让模型在推理中动态决定看或听、以及选取哪段时间窗口,把检索到的原始音视频片段回填上下文。
OneStreamer 通过共享的主动生成过程,联合学习与查询无关的证据记录和任务响应,其 Proactive Hierarchical Caption Memory(PHCM)生成带时间定位的局部细节描述与已完成事件摘要。
论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。
Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题学习复现该行为。
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,每个 token 概括局部深度窗口,支持单阶段 rectified-flow 生成。
Argo-Bench 是一个包含 210 个数据科学与分析任务的企业级数据智能体评测框架,模拟纽约市外卖平台 2024 年 8100 万订单,导出为 235 张表、75 亿行的 ERP 仓库。任务要求智能体在仓库中重建事实并执行封禁欺诈账号、分配骑手激励预算等操作,由模拟器按后果评分。14 个前沿与开源权重模型中最强者仅在 34.8% 的任务上得分 95 以上,平均 59.5 分。
KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条 query-command 对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型定制恢复策略。在覆盖执行与诊断的四项基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的必要性。
研究者提出免训练对比解码框架 LoopCD,通过对比最终预测与较早循环轮的中间表示来引导 token 选择,分为 logit 空间的 LoopCD-Logits 和零输出开销的 LoopCD-Hidden 两种形式。