跳到正文

全部动态

今日 7 条
10月2日周五
  1. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    ProVer:为智能体 RL 精准分配信用

    ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。

  2. X:DAIR.AI (@dair_ai)48

    微软 FOCUS:免训练压缩智能体上下文

    微软提出免训练方法 FOCUS,在测试时压缩 AI 智能体的交互历史:它判断智能体下一步决策真正依赖哪些历史片段,保留这些片段、丢弃其余部分,无需训练数据或微调,可作为独立层接在闭源 API 模型前。在工具调用、QA、网页与多轮对话基准上,FOCUS 将峰值上下文最多削减 48%,任务成功率最多提升 8.9 个百分点。

  3. Apple Machine Learning Research(RSS)47

    Apple 研究:扩散模型置信度排序的局限性

    Apple 研究团队从理论上证明,扩散模型(含 remasking 与 uniform-state 采样器)的每一步只有在所写入位置在已固定 token 条件下相互独立时,才与训练分布匹配,而任何逐位置分布的乘积都无法匹配存在依赖关系的 token 组。

  4. Meta AI:Research Blog(网页)73

    Meta 发布 Muse Spark 与数学家协作完成的六篇数学研究论文

    Meta AI 与数学家合作,使用 Muse Spark 1.1 和 1.2(Thinking Mode、经 meta.ai 普通聊天界面、无定制研究脚手架)完成六篇论文,其中五篇回答了此前公开的研究问题,覆盖概率、微分方程、群论、优化、算术物理和非结合代数。

    推荐理由:Meta 展示了 AI 与数学家协作解决六个公开数学问题的成果,并公开了人机分工与独立验证的协作规范。

  5. Apple Machine Learning Research(RSS)34

    语言判别能力提升多语言语音模型的语言学习效果

    Apple 研究团队发现,在预训练中强化语言判别能力可缩小多语言语音模型与单语言模型的差距。在英语/法语 HuBERT 对照实验中,双语基线 phone-ABX 错误率从 11.6% 降至 10.4%(单语言为 10.8%),sWUGGY 从 52.1% 升至 56.7%,ProsAudit 词汇子任务从 68.9% 升至 72.9%。

  6. X:Epoch AI (@EpochAIResearch)50

    Epoch AI 发布 ChatGPT 使用探索器

    这些趋势来自一个自我选择的用户样本。数据未经加权处理,不代表美国成年人或 ChatGPT 整体用户的人口结构。 阅读我们的完整报告:https://epoch.ai/latest/introducing-the-chatgpt-usage-explorer 自行探索数据:https://epoch.ai/data/chatgpt-usage

  7. X:Rohan Paul (@rohanpaul_ai)49

    NVIDIA 论文:给 AI 智能体配个好裁判,成功率 50%→68%

    NVIDIA 新论文提出,与其给 AI 智能体更多选项,不如给它一个更好的裁判:让小型智能体每步生成 8 个候选命令,再由裁判模型挑选执行。用前沿强模型当裁判时,成功率从 50% 提升到 68%,且无需重新训练;若由小模型自评,提升则小得多。

  8. X:DAIR.AI (@dair_ai)58

    Meta 提出Context Language Models,让模型以文件方式原生管理自身上下文

    Meta 等机构提出 Context Language Models(CLM),把上下文作为文件让模型用 Bash 自由编辑,自主决定保留、重写或删除内容,并区分于 RLM 不允许模型直接编辑实时交互上下文的做法。zero-shot 下在 BrowseComp-Plus 上比现有上下文管理策略高 11.4% 准确率、省 21.5% FLOPs;在线 RL 使 Qwen3.5-9B 提升 47.6% 且少用 12% FLOPs;配套 Suffix Cache Reuse 相比标准 SGLang 降低 35% 服务端计算。论文链接:https://academy.dair.ai/papers/context-language-models-2609.37725

10月1日周四
  1. X:Rohan Paul (@rohanpaul_ai)44

    Adobe 提出基于技能的智能体实时评测方法

    Adobe 提出把标准答案写成每次运行都重新取数的代码,再由 AI 评分器对照检查智能体回答。在 53 个测试用例上,这种做法的 AI 评分与人类专家的一致率比文字描述答案高 29%,且少用 16% token;若没有可对照的答案,AI 评分器表现还不如随机。论文题为《Skill-based Agentic Evaluation for Real-time Data Science Tasks》。

  2. X:Rohan Paul (@rohanpaul_ai)41

    Google DeepMind 等论文:AI 抢工作后政府该怎么保民生

    Google DeepMind 联合牛津、芝加哥大学论文探讨 AI 大量取代工作后政府应如何保障民众,结论是没有任何单一政策在所有情景下都有效。再培训等最受欢迎的思路只在 AI 持续创造新岗位时有用,否则只是重新分配剩余岗位。作者建议现在扩大失业救济与低薪税收抵免,失业持续则把抵免转为收入下限,劳动者经济份额持续下降则让公民持有公共投资基金份额。

  3. X:Rohan Paul (@rohanpaul_ai)49

    Meta 论文:给智能体配个"经理"管算力

    Meta 论文提出 Meta-Reasoning Agent,让 worker 执行任务、独立 controller 决定下一步,在最大预算下于全部 12 项对比测试中胜过无 manager 的同款智能体。用 GPT-5.5 跑代码基准时,预算增至 3 倍,得分从 64.1% 升至 71.5%,而对照智能体停滞在 64% 附近。

  4. HuggingFace Daily Papers(社区热门论文)42

    ActiveSaddler:面向 Agent Harness 优化的自动化课程学习

    ActiveSaddler 将 Agent harness 优化中"训练场景如何选择"这一维度建模为非平稳 bandit 问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计各模式的潜在学习收益,在复现已知弱点与探索新场景之间自适应平衡。

  5. HuggingFace Daily Papers(社区热门论文)41

    InFlowOp:无标签的流内多智能体工作流优化

    研究者提出 InFlowOp,用统一的"无标签成本"为多智能体工作流中的每个决策定价,在执行前双向决定任务分解粒度与智能体分配,执行中以最低成本修正故障。团队同时发布需要多智能体协作的基准 Braid,在多个领域和骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。

  6. HuggingFace Daily Papers(社区热门论文)40

    AgSpec:把基于检索的投机解码推向编码智能体流水线极限

    AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料库中检索草稿 token,并按智能体离线画像设定草稿长度上限、再依据验证反馈在线调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器和 EAGLE-3,batch size 1 时生成吞吐较自回归解码最高提升 4.37 倍,batch size 16 时最高 4.76 倍。

  7. HuggingFace Daily Papers(社区热门论文)31

    ROWBench:视频模型能否渲染出程序所指定的内容?

    PROWBench 基准发布,包含 170 个程序化构建的 episode 和 600 段代理视频,用于检验视频模型对程序指定世界事件的视觉还原能力。该基准记录实体状态与带时间戳事件(含镜头视野外事件)作为可回放世界记录,并渲染同步视图,覆盖第一、第三人称视角。

  8. HuggingFace Daily Papers(社区热门论文)38

    LLM 泛化能力多轴评估:SAGO 框架揭示模型稳定性问题

    研究者提出 Stability-Aware Generalization Objective(SAGO)框架,从生成一致性、内部激活、置信度和响应镜像等多个维度衡量 LLM 在输入变化下的行为波动。实验显示,常用模型普遍存在统计显著的泛化不稳定性,没有模型能均匀泛化,不同行为轴捕捉到独立的失败模式,跨数据集变化甚至会逆转模型排名。

  9. HuggingFace Daily Papers(社区热门论文)44

    InterEvolve:面向人形机器人移动操作奖励程序的测试时进化

    InterEvolve 通过测试时进化奖励程序,让控制器无需重新训练即可完成未训练过的人形机器人移动操作任务。该方法结合物体感知的前向-后向行为基础模型与 LLM 智能体,后者依据执行反馈和已验证程序技能库修改奖励程序结构,数值优化器负责调参。实验显示,进化出的程序释放了 FB 模型未被人工奖励触及的能力,并可在 Unitree G1 实体机器人上基于第一视角感知自主运行。

  10. HuggingFace Daily Papers(社区热门论文)44

    Before It Fades:在推理阶段强化 VideoLLM 的时间表征

    研究提出 Temporal Activation Injection(TAI),一种无需训练的方法,通过在推理阶段将中间层的时间散度向量 τ_l 按衰减规律重新注入后续层,解决 VideoLLM 时间推理能力随层数加深而衰减的问题。该方法在三个 VideoLLM 和四个 benchmark 上一致提升时间推理表现,对非时间任务影响可忽略。

  11. HuggingFace Daily Papers(社区热门论文)50

    关键词基准测试对小模型工具调用能力的误判:一套低成本诊断阶梯

    一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。

  12. HuggingFace Daily Papers(社区热门论文)41

    OmniSeek:面向多轮音视频推理的原生工具集成框架

    OmniSeek 是一个将 Omni-LLM 转变为原生工具调用多轮推理智能体的框架,让模型在推理中动态决定看或听、以及选取哪段时间窗口,把检索到的原始音视频片段回填上下文。

  13. HuggingFace Daily Papers(社区热门论文)57

    论文提出 Sharpening Tax 量化 RL 后训练的解覆盖损失

    论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。

  14. HuggingFace Daily Papers(社区热门论文)40

    Where-OPD:用合成场景对 MLLM 做空间引导的在线自蒸馏

    Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题学习复现该行为。

  15. HuggingFace Daily Papers(社区热门论文)47

    Argo-Bench:面向企业级工作流的数据智能体评测基准

    Argo-Bench 是一个包含 210 个数据科学与分析任务的企业级数据智能体评测框架,模拟纽约市外卖平台 2024 年 8100 万订单,导出为 235 张表、75 亿行的 ERP 仓库。任务要求智能体在仓库中重建事实并执行封禁欺诈账号、分配骑手激励预算等操作,由模拟器按后果评分。14 个前沿与开源权重模型中最强者仅在 34.8% 的任务上得分 95 以上,平均 59.5 分。

  16. HuggingFace Daily Papers(社区热门论文)43

    超越记忆:用显式信念状态驱动长时程 LLM 智能体

    研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型定制恢复策略。在覆盖执行与诊断的四项基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的必要性。