跳到正文

全部动态

今日 7 条
9月27日周日
  1. HuggingFace Daily Papers(社区热门论文)44

    选择多样化的 SFT 轨迹可提升后 RL 泛化能力

    一项研究提出用轻量级规则指纹筛选 SFT 数据中的"推理路径多样性",即推理步骤序列的差异。在合成实验中,路径多样化的 SFT 让 OLMo3-7B 在 SFT 未见过环境上的 pass@8 提升 16.9 分;单模型条件下,跨 10 个数学基准的平均 pass@8 最高提升 6.2 分。该仅用 CPU、无需模型调用的选择器在 3 个开源语料上均优于更昂贵的替代方案。

  2. HuggingFace Daily Papers(社区热门论文)41

    VisionHOPE:将视觉骨干网络构建为自修改学习系统

    VisionHOPE 提出首个将视觉骨干网络形式化为自修改学习系统的方案,让模型在单张图像内"记住什么"与"如何学习"协同演化。它基于 Nested Learning 的自指构造,用五个耦合记忆分别存储内容、生成 key/value 表示并控制学习率与保留率,并推导出稳定性匹配的步长控制方案以保证记忆动态非扩张。

  3. The Decoder:AI News(RSS)66

    研究:AI建议可用让人几乎不再愿意说“我不知道”

    一项覆盖3132名参与者、共五个实验的研究发现,仅当AI建议可用时,人们放弃回答的比例从36-44%骤降至3-6%。由于所用模型Step 3.5 Flash对所测试的电影视觉细节问题几乎全错,参与者正确率反而从27.5%降至9.2%;财务激励能减少求助AI并略提升弃答比例,但未能扭转效应,即使AI答案自动展示时弃答率也降至1-7%。

  4. 小米 MiMo:官网发布与博客63

    小米 MiMo-V2.6 诊断并修复工具调用重复问题,用 MOPD 将修复成本降至 MixRL 方案的 4%

    小米官方复盘 MiMo-V2.6 发布后的工具调用重复问题,响应级重复率超 0.05%,并区分了正常并行调用、调用泛滥与调用重复。回放 RL 各 checkpoint 显示泛滥率随训练从 11.1% 升至 24.6%,32 次调用阈值惩罚过于宽松;直接调低阈值需重启 20 步 MixRL,估计成本 231 万美元,且内部测试重复率仅从 13.45% 降至 3.83%。

    推荐理由:原文给出完整的归因实验和修复路径,还公开了成本对比,读者可借鉴其诊断 RL 训练中涌现行为的方法。

9月26日周六
  1. HuggingFace Daily Papers(社区热门论文)40

    Allspark:用交替思维链实现弱到强迁移

    Allspark 是一个通过交替思维链实现弱到强迁移的训练与推理框架:弱教师模型与同模型冻结副本交替推理、由冻结模型给出最终答案,推理时用更强的学生模型替换冻结伙伴,两者均保持固定。

  2. HuggingFace Daily Papers(社区热门论文)39

    RoboFoundry:面向自学习具身智能体的“系统即策略”演化框架

    RoboFoundry 提出“自演化系统即策略”的具身智能体框架,将执行轨迹转化为经验证的任务级系统更新,并沉淀为通用系统能力。在 EmbodiedBench 上,它把 GPT-5.5 提升 27.8%,并让 Qwen3.7-Plus 达到 70.3%、接近 GPT-5.5 的 72.7%。

  3. HuggingFace Daily Papers(社区热门论文)37

    ExpVoyager:面向动态智能体技能合成的直接经验导航框架

    ExpVoyager 将 LLM 智能体的技能合成重构为对历史经验的动态导航问题,由 skill curator 按当前任务需求在不同视图与分辨率下探索原始轨迹,边识别可复用过程知识边追踪剩余知识需求以决定下一步导航方向。实验显示其在下游任务性能上持续提升,经验空间扩大时收益持续增长,并能在高效经验访问下与现有技能兼容。

  4. HuggingFace Daily Papers(社区热门论文)35

    PrismQuant:面向分组量化器的最优零空间旋转方法

    PrismQuant 是一种量化器感知的旋转框架,通过将激活值主特征空间与非对称分组 INT4 的常量组子空间对齐,把旋转设计建模为 Ky Fan 迹最大化并给出可证明最优的闭式解。

  5. HuggingFace Daily Papers(社区热门论文)38

    神经图像水印中的残差可迁移性研究:CoverLock 防御策略

    研究提出残差可迁移性(RT)指标,量化神经图像水印证据在跨图像迁移后的可解码程度,发现架构设计而非训练侧变化是 RT 差异的主因,并识别出两种强化水印证据对载体图像依赖的机制。针对难以重新设计架构的现有水印系统,作者提出即插即用策略 CoverLock,在高 RT 水印系统上实现了优于传统手工防御和基于学习分类器防御的安全—鲁棒性权衡。

  6. HuggingFace Daily Papers(社区热门论文)48

    Relic:把多智能体协作经验沉淀为组织级可执行协议

    Relic 将多智能体协作中反复出现的失败转化为组织所有、可执行的协议,把触发条件、责任、所需证据与执行后果绑定到运行时,并支持修订与退役。在十个软件工作负载、三个模型共 360 次受控运行中,完整契约交付率从 14.06% 提升至 19.76%(+5.71 个百分点)。

  7. HuggingFace Daily Papers(社区热门论文)57

    AgentTell 基准揭示浏览器智能体通过行为侧信道泄露隐私

    论文提出 AgentTell 基准,研究 browser-use 智能体的行为侧信道泄露,即智能体的操作无意间暴露从先前网站获取的秘密。基准含 20 个场景、100 个任务,在六个骨干模型上共 9,760 次会话的评估显示 61.1% 的会话中智能体通过行为泄露秘密;即使记忆中明确要求不透露,泄露率仍达 56.7%,且 34.5% 的泄露会话最终回复还向用户保证未泄露。

  8. HuggingFace Daily Papers(社区热门论文)37

    GAGAR:面向代码智能体 RL 的分组智能体评分与优势重分配

    GAGAR 是一个面向代码智能体强化学习的质量感知信用重分配框架,通过 SFT 训练的智能体评分器在同一工作区内联合检查并排序通过测试的轨迹,对低排名轨迹降权并按比例重缩放优势值以保持总和不变。

  9. HuggingFace Daily Papers(社区热门论文)45

    SkillDRE:通过执行前与运行时反馈对 Agent 技能进行双阶段红队演化

    SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。

  10. HuggingFace Daily Papers(社区热门论文)36

    重新审视 LLM 强化学习中的训练-推理不匹配:来源与校正方法

    研究揭示 LLM 强化学习(RLVR)中训练引擎与推理引擎对同一 token 赋予不同概率的问题,并提出校准重要性采样(CIS)进行校正。CIS 基于 logit 位移刻画,采用置信度感知截断:大正位移在单一常数阈值处截断,映射为随 token 置信度升高而收紧的重要性比率上限。在三个 MoE 模型和五个数学推理基准上,CIS 均取得最高五基准平均分。

  11. HuggingFace Daily Papers(社区热门论文)44

    用强化学习实现可证明最优的四边形块分解

    研究者训练强化学习智能体直接在半边数据结构上做局部编辑,构建达到离散 Gauss-Bonnet 下界(称为 par)的四边形网格分解,并通过在最优网格上的行为克隆加 PPO 突破稀疏奖励的探索瓶颈。

  12. HuggingFace Daily Papers(社区热门论文)39

    VoxMem:面向大型音频语言模型的多模态记忆基准

    VoxMem 是面向大型音频语言模型(LALM)的多模态记忆基准,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  13. HuggingFace Daily Papers(社区热门论文)33

    Adaptive Consistency Graph:面向长程智能体的自适应一致性图

    针对 LLM 智能体在长序列依赖任务中决策漂移的问题,研究者提出 Adaptive Consistency Graph(ACG),将执行证据及其来源增量组织进持久图,并在有限上下文预算下为每次决策构建以需求为中心的临时视图。

  14. HuggingFace Daily Papers(社区热门论文)44

    LT-OPD:用在线策略自蒸馏实现极端视觉 token 压缩

    针对多模态大模型在极低视觉 token 预算下性能骤降的问题,研究者提出训练框架 LT-OPD,让仅保留少量视觉 token 的学生模型在自己生成的轨迹上接受冻结全 token 教师模型的分布监督,并引入逐步降低 token 预算的课程。

  15. HuggingFace Daily Papers(社区热门论文)37

    S²D-OPD:按 JSD 筛选状态的选择性蒸馏监督

    针对 Direct-OPD 的 token 级 log-ratio 只衡量相对变化、在概率质量消失时仍可能不变的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复只保留前 10% 状态。

  16. HuggingFace Daily Papers(社区热门论文)39

    VGBench:诊断语音智能体的声学上下文门控能力

    研究者推出 VGBench,一个含 1,018 条样本的诊断基准,用于评测语音智能体在闲聊、自言自语和说话人切换场景下的动作级"被称呼"判断。六个原始 Audio LLM 和三种免训练适配方案常能识别目标工具,却很少在说话人切换时抑制动作,最高静默率仅 14%。

  17. HuggingFace Daily Papers(社区热门论文)38

    CUA-SWE:当 Computer-Use Agent 遇上可视化软件工程

    研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证改动后的软件是否满足需求并保持既定行为。该工作评估前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件变更。

  18. HuggingFace Daily Papers(社区热门论文)34

    不改参数改乘积:面向 Transformer 的结合代数层

    研究者提出用结合代数中的稀疏交互表替代 Transformer 投影层的普通矩阵乘法,在物理块大小固定时实现矩阵维度上的二次算术复杂度,并给出适配 GPU 执行的形状约束。

  19. HuggingFace Daily Papers(社区热门论文)41

    BiasReducer:面向奖励模型的自适应偏见缓解框架

    BiasReducer 提出一种轻量框架,仅编辑奖励模型的线性奖励头,并为每个新数据集自动选择相关编辑,无需重训练。它先用 SAE 风格编码器识别奖励模型敏感的属性(如长度、置信度),再学习调整奖励头的方向和幅度,最后按属性影响力排序筛选编辑。

  20. HuggingFace Daily Papers(社区热门论文)44

    LANTERN:从语言模型内部表征中挖掘隐藏的数学关联

    LANTERN 通过预训练模型激活上的分类器对候选关系排序,结合分阶段过滤、假设生成、可执行验证与分析检查,在 OEIS 的 1 万条高频序列的 5000 万对关系中产出 62 条已验证关联,其中 13 条值得展示、9 条具信息量或洞察力,4 条在 OEIS 与定向文献检索中均未出现。整个流程含分类器训练、候选排序、过滤与验证耗时不到 8 小时。