跳到正文

全部动态

今日 94 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)43

    Prompt2Skill:从自然语言指令进行无监督技能优化

    Prompt2Skill 框架仅凭自然语言任务描述即可为 LLM 构建技能:从提示词推导任务规范、发现或合成数据集,并通过反思式编辑的闭环迭代优化技能。在问答、阅读理解、表格操作和数学推理四个领域,该方法在开源与前沿模型上平均提升 10.8,稳定优于直接提示基线。

  2. HuggingFace Daily Papers(社区热门论文)34

    AdviSD:通过定向多轮自蒸馏让小型顾问模型指导前沿 LLM

    AdviSD 让小型可训练顾问模型用自然语言指导冻结的 LLM 执行器,方法将结果导向的强化学习与选择性自蒸馏结合,用反馈条件下的顾问副本筛选反思修正。用 Qwen3-8B 顾问指导 Gemini 和 Claude 时,AdviSD 在 BFCL-v3 上比 advisor-GRPO 高 4.2-6.4 个百分点,在 EnvScaler 上高 3.9-5.1 分。

  3. HuggingFace Daily Papers(社区热门论文)39

    OASIS:突破 LLM 推理在线自蒸馏的规模扩展瓶颈

    针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。

  4. HuggingFace Daily Papers(社区热门论文)41

    EpiCon:通过共同演化多模态记忆实现智能体集体学习

    EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——连接问题级记忆演化与持久经验库,实现不同智能体之间的经验复用。在覆盖四个多模态任务域的 11 个基准上,第二个 harness 将原系统宏平均分提升 2.6 分;四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,记忆操作时间减少 67% 至 74%。

  5. HuggingFace Daily Papers(社区热门论文)40

    LIFT:通过 On-Policy 自蒸馏实现大视角变化下的未来布局视频生成

    研究团队提出 LIFT,一个统一的图像到视频生成框架,用末帧布局作为显式控制信号,让用户指定未来视角中出现什么内容及其位置。由于稀疏布局引导比逐帧密集布局更难学习,LIFT 引入 on-policy self-distillation(OPSD),将密集布局教师模型的控制能力迁移给末帧布局学生模型。

  6. HuggingFace Daily Papers(社区热门论文)39

    Transformer 残差流中的推理几何:六款预训练语言模型研究

    研究对比六款预训练语言模型的中间残差状态与自身最终状态及其他上下文的最终状态,发现模型自身终点在早期就优于平均替代项,但许多单个终点距离更近。竞争终点集合随深度总体收缩,但其成员不断变化,存活终点之间未必更相似;方向对齐和终点排名可以改善,而到最终状态的欧氏距离变化很小。

  7. HuggingFace Daily Papers(社区热门论文)37

    GRAFT:用跨模型轨迹交换提升 RLVR 训练效率

    针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。

  8. HuggingFace Daily Papers(社区热门论文)43

    Real2Gym:从视频构建仿真训练场,把技能带给机器人

    Real2Gym 是一个 Real2Sim2Real 智能体框架,能把人类和机器人演示视频转成可交互仿真训练场,并将仿真中学到的技能迁移到实体机器人。其仿真环境重建成功率比 GPT-6 Astra Direct Mode 高 16.7%,策略执行 token 减少约 74.9%;在真实 Franka 机器人四项任务上,实体执行成功率高出 33.3%。

  9. HuggingFace Daily Papers(社区热门论文)40

    PRISM:反事实视频生成实现可扩展的人形机器人移动操作

    PRISM 是一个 real-to-sim-to-real 框架,通过视频到视频(V2V)生成将少量真实视频扩增为数百段"反事实"人-物交互视频,再经接触锚定的 real-to-sim 流程重建人与物体运动,把不完美视频数据重定向为物理合理的轨迹。该框架训练出单一策略,可泛化到同类未见物体,并在真实机器人上零微调部署,仅用机载深度观测完成箱子、桶、储物箱和球的抓取、搬运与放置。

  10. HuggingFace Daily Papers(社区热门论文)33

    APM-Bench:面向第一视角流式视频助手的跨会话持久记忆基准

    APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观与开放式问答。模型需借助持久记忆回答过往会话问题并主动响应,同时保持实时交互。评测显示现有方法在效用、延迟与存储之间存在明显权衡,难以同时实现可靠的长期召回、低开销和有效的跨会话主动协助。

  11. HuggingFace Daily Papers(社区热门论文)34

    FlexRouter:为灵活 LLM 路由学习互补模型集合

    FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以答案覆盖率为优化目标,最大化所选模型中至少一个给出正确答案的概率。该方法将路由建模为覆盖导向的子集选择问题,用 Determinantal Point Processes(DPPs)刻画模型能力与冗余度,并通过基于失败集边缘化的训练目标直接优化覆盖率。

  12. HuggingFace Daily Papers(社区热门论文)41

    CorpusMap:面向智能体检索的实体语料地图

    研究者提出 CorpusMap,一种围绕语料中反复出现的实体组织文档的导航层,将每个实体表示为 Entity Page,聚合并链接所有提及该实体的文档,形成可供智能体遍历的实体—文档图。

  13. HuggingFace Daily Papers(社区热门论文)41

    HybridCUA:让计算机使用智能体学会编排 GUI 与 CLI

    HybridCUA 提出让计算机使用智能体(CUA)同时编排 GUI 与 CLI 的训练方案,先构建含 5K 混合轨迹与 3K 可验证 RLVR 任务的 HybridCUA-8K 数据集,再经监督微调加 CLI 感知奖励的强化学习两阶段训练。

  14. HuggingFace Daily Papers(社区热门论文)38

    ActFirst-OPD:让多轮智能体先行动后推理,on-policy 蒸馏最高提速 4.9 倍

    研究者提出 ActFirst-OPD,一种"先行动、后推理"的 on-policy 蒸馏训练框架,将环境交互与完整回复生成解耦:学生模型借助参考条件逆动力学推断并执行动作,当实际转移偏离参考轨迹时切换为自主预测下一动作,再异步生成完整 think-then-act 回复接受 token 级教师监督。

  15. HuggingFace Daily Papers(社区热门论文)43

    小模型如何通过采样逼近前沿模型:Parallel Power Tempering(PPT)

    研究者提出 Parallel Power Tempering(PPT),用并行回火实现幂锐化采样,让多个不同锐化程度的副本并行交互,低幂副本负责探索多样推理路径、高幂链负责利用高概率回答,从而缓解探索与利用的权衡。PPT 缓解了此前幂采样器的截断偏差,并研究了有限内存与算力预算下的交换策略。实验显示其显著优于单链幂锐化采样,超过 RL 后训练模型,推理轨迹质量更高,性能甚至可比前沿模型。

  16. HuggingFace Daily Papers(社区热门论文)41

    像素扩散模型的对抗训练后训练研究:恢复高频细节并提升分布保真度

    研究首次系统探索像素扩散模型的对抗后训练:在预训练模型上保留原有扩散或流匹配目标,对非高噪声时间步的预测输出加入对抗损失,架构与采样流程不变。在两个像素骨干上,该方法同时提升了分布保真度、覆盖度、提示词对齐和感知质量;频谱分析显示原模型系统性缺失自然图像高频成分,对抗后训练可将其恢复。在测试的潜空间扩散配置下,同样流程未带来可比增益,几乎不增加解码后的高频功率。

  17. HuggingFace Daily Papers(社区热门论文)34

    自注意力在竞争下的检索容量

    研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的"有效注意力集合"大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小,而重归一化保留权重可大幅降低该规模。

  18. HuggingFace Daily Papers(社区热门论文)37

    LoopVL:循环式视觉智能

    LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 组合,用共享模块迭代更新统一的视觉语言状态,并从零开始完成语言预训练、多模态训练与后训练。它在多模态理解与视觉推理基准上超过多款同规模及更大规模的非循环模型,还出现跨循环视觉注意力显著转移的 Visual Aha Moments。

  19. HuggingFace Daily Papers(社区热门论文)42

    SaveRouter:让 LLM 路由的监督成本自己回本

    SaveRouter 是一个稀疏监督的 LLM 路由框架,只选择性获取有信息量的模型反馈并在相关查询间共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈就保持或超过竞争方案的 routing 质量,并将盈亏平衡部署量较最快的传统路由器降低约 1.9–9.5 倍。该研究同时把监督开销与后续服务节省一起纳入评估,发现最小化服务成本的监督水平未必等于最早回本的监督水平。代码已公开。

  20. HuggingFace Daily Papers(社区热门论文)42

    TabFM-Auto:为表格基础模型自进化数据流水线

    TabFM-Auto 将表格基础模型 TabFM 与语言模型智能体结合,通过迭代优化数据清洗、特征工程、上下文选择和后处理来降低 TabFM 的误差。在 TabArena 全部 51 个数据集上,五种不同智能体与语言模型配置的 TabFM-Auto 包揽前五名,最佳配置将 TabFM 的 Elo 从 1785 提升至 2013。

  21. HuggingFace Daily Papers(社区热门论文)33

    Rules to Tools:为科学计算中的 LLM 智能体提供可执行检查

    Rules to Tools(R2T)为科学计算场景的 LLM 智能体提供公开科学需求的可执行检查。在匹配的 SciCode 修复任务中,文本组完整修复 26/30,工具组 29/30;8 个任务 ID 队列为 13/16 对 15/16,而更大的共享定义队列两组均为 13/24。

  22. HuggingFace Daily Papers(社区热门论文)62

    研究揭示系统提示中的隐藏日期影响 LLM 评测结果

    研究指出系统提示中被隐藏注入的当前日期会让 LLM 评测结果随日期波动,影响可复现性和排行榜公平性。在 9 个模型和 6 个数据集上,仅因日期变化,多项选择题 QA 最高波动 6%,数学推理 14%,代码生成 7%,机器翻译 2.84 BLEU,模型排名也会因此改变;该效应超过 batch size 和数值精度等非确定性来源,链式推理和 few-shot 提示均无法缓解,链式推理甚至放大波动。

  23. HuggingFace Daily Papers(社区热门论文)36

    SAKI:面向同策略蒸馏的最大耦合路由教师监督方法

    SAKI(Supervision Allocation with KL-constrained Interpolation)将 KL 约束的教师引导 rollout 与最大耦合结合,按 token 级接受/纠正事件路由监督:接受位置保留采样 token 的反向 KL 监督,纠正位置直接监督教师最高概率 token。

  24. HuggingFace Daily Papers(社区热门论文)38

    循环语言模型中的循环机制何时有效?HuggingFace 论文给出设计指南

    一项受控实验系统考察了循环语言模型(LoopLMs)中循环机制的适用条件、作用位置与条件注入方式。结果显示,循环可提升超出训练范围的推理表现,但会损害知识类任务,且更难的推理样本未必获益更多;非循环输出层能提升欠展开时的鲁棒性。

  25. HuggingFace Daily Papers(社区热门论文)46

    EngiWorld:前沿智能体在专业工程环境中能交付什么?

    EngiWorld 是首个围绕完整设计闭环构建的工程智能体基准,包含 6 大工程领域(CAD、CAE、CAM、BIM、EDA、3D 可视化)、26 个专业软件平台的 1,301 个专家精选任务,覆盖 GUI 与 CLI 界面及 6 类任务。

  26. HuggingFace Daily Papers(社区热门论文)46

    ALICE:上下文内零样本互信息估计的基础模型

    研究者提出 ALICE,一个仅用合成分布训练的基础模型,可在上下文内估计未见分布的 rectified-flow 速度场,并通过固定恒等式积分联合场与条件场之差的平方得到互信息。ALICE 无需按分布单独训练,原生支持不同数据维度和样本数量,在标准基准及生物学、遗传学、神经科学三个领域实现零样本互信息分析,首次让单一模型追平按分布分别训练的神经估计器。

  27. HuggingFace Daily Papers(社区热门论文)39

    Scaffolding Minds:为多模态推理优化潜在视觉目标表示

    Scaffolding Minds 针对潜在推理两阶段框架的两个缺陷提出改进:用专门学习的 scaffolding encoder 在潜在空间提供优化目标,并同时学习 RL 采样器的均值和方差以支持探索。该方法在 FrozenLake 空间规划上比最强潜在推理基线提升 +9.5 分,32x32 网格上提升扩大至 +19 分,在九个视觉中心推理基准上平均提升 +5.6 分。

  28. HuggingFace Daily Papers(社区热门论文)43

    智能体的主动性问题:Q&D 方法如何让模型追问未被请求的信息

    研究提出智能体主动性的内容维度:横向主动性追问当前上下文已隐含的信息,纵向主动性追问只有早期证据才能揭示的需求。基于基准自身分解构建的 need graph 可在无模型评判的情况下对两种主动性打分。Q&D 训练提问者偏好能检索更多所需证据的问题,在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过 15 倍大的提示模型。

  29. HuggingFace Daily Papers(社区热门论文)35

    HiRAE:带残差预算的分层表示自编码器

    HiRAE 提出分层表示自编码器,按深度对编码器各层分组并学习对最深表示的残差修正,用分组范数上限约束修正幅度、浅层预算更紧。HiRAE-24 保持潜变量 token 数与通道维度不变,在 ImageNet-256 上将重建 FID 从 RAEv2 的 0.299 降至 0.209,并维持有竞争力的引导生成质量。

  30. Every:最新文章(网页)80

    Every 实测 OpenAI DevDay 2026:20 多项发布与上手体验

    Every 评测 OpenAI DevDay 2026 发布的 20 多项产品和功能。作者实测后认为 Dots 持久智能体已改变其使用习惯但 bug 较多,Space 办公套件体验较好;Decisions API 在部分测试中以 76/78 对 73/78 的准确率和 230 毫秒对 500 毫秒的响应速度优于 Jev,但另一些测试落后,定价未公布。

    推荐理由:作者上手实测了 DevDay 多款新品,给出 Dots、Space 和 Decisions API 的第一手使用体验与测试数据,可帮助读者判断哪些值得现在尝试。

  31. HuggingFace Daily Papers(社区热门论文)37

    PixelUMM:无需编码器的统一图像与视频理解生成模型

    PixelUMM 是一个无需视觉编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成。它将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干,并采用 Mixture-of-Transformers 架构结合共享注意力与任务专属参数,同时支持自回归文本预测和像素空间流匹配。