跳到正文

全部动态

今日 0 条
9月29日周二
  1. HuggingFace Daily Papers(社区热门论文)46

    EasyPPO:稳定 critic 是 PPO 训练 LLM 的关键

    EasyPPO 通过仅对 actor 做超长过滤、按采样回报标准差倒数加权 critic 回归、并适度缩小 critic mini-batch,解决了 PPO 中 critic 的两类失稳问题。

  2. HuggingFace Daily Papers(社区热门论文)42

    Tacit-TTS:从自回归解码到掩码预测的高效无转写语音克隆

    Tacit-TTS 是蒸馏自 IndexTTS2 的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度的估计与 ReFlow 蒸馏加速流匹配渲染器。在 2 个英语和 2 个普通话数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,且无需参考语音转写,可支持跨语言及婴儿咿呀、合成乱语等非词汇参考。

  3. HuggingFace Daily Papers(社区热门论文)35

    WUSH-KV:用数据自适应变换实现 KV Cache 量化

    WUSH-KV 是一种面向低比特 KV cache 的量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,为 key 和 value 分别构造变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。

  4. HuggingFace Daily Papers(社区热门论文)44

    NEEDLE:通过权重正交化移除 LLM 后门

    研究者提出免训练的后门移除方法 NEEDLE,通过激活向量估计后门方向与拒绝子空间,再施加顺序权重正交化,在压制后门的同时避免改变拒绝相关表征。该方法无需干净参考模型或原始投毒训练数据,在多种模型家族与攻击类型上取得最低平均攻击成功率,其中代码注入攻击为 0%,同时 KL 散度最低,能力与安全性变化极小。

  5. HuggingFace Daily Papers(社区热门论文)41

    Think Before You Score:面向视觉生成的思想奖励模型 TRM

    研究者提出 Thinking Reward Model(TRM),先为每个样本生成自适应评分标准再做评估,输出细粒度 pointwise 奖励,并引入 PD-GRPO 缓解成对偏好优化导致的分数极化。在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到 SOTA,并可与闭源方案竞争;作为强化学习奖励信号还能稳定提升多种视觉生成模型。

  6. HuggingFace Daily Papers(社区热门论文)35

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,通过 MLLM-to-DiT 架构让 MLLM 在视觉生成前先对源视频和指令进行显式思考,生成精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,大幅超越 10B 规模基线。

  7. HuggingFace Daily Papers(社区热门论文)41

    针对黑盒 LLM 的受控解码攻击框架

    研究者提出一种针对黑盒 LLM 的越狱框架,仅通过纯文本续写接口即可实施受控解码攻击,无需访问模型权重或 token 概率。

  8. HuggingFace Daily Papers(社区热门论文)39

    SplitMoE:用分角色稀疏架构打破视频扩散模型的均匀性陷阱

    针对传统 token-wise MoE 因均匀专家使用正则化导致的"均匀性陷阱",SplitMoE 提出分角色稀疏架构,将专家池拆分为语义专家与通用专家,配合原型引导路由和拉推正则化,让 token 按语义属性自然聚类。在等效激活参数预算下,SplitMoE 在收敛速度、路由一致性和视频生成质量上均优于传统负载均衡 MoE。

  9. HuggingFace Daily Papers(社区热门论文)42

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染准确率

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并把裁剪区域的视觉 IDS 预测与目标序列对齐,配合整字语义奖励提供细粒度反馈。

  10. HuggingFace Daily Papers(社区热门论文)36

    WISE-ATTA:预算受限的主动测试时适应中何时请求标签

    针对现有主动测试时适应(ATTA)方法默认每个测试批次都可请求监督、导致长测试流标注成本过高的问题,研究者提出预算受限 ATTA 设定,即仅少部分测试批次可获得标签,并将核心挑战从"批内标注什么"转为"何时施加监督"。

  11. HuggingFace Daily Papers(社区热门论文)41

    AIM:面向自动化研究的智能体化想法管理框架

    研究者提出全自主框架 Agentic Idea Manager(AIM),用于管理并探索"想法驱动"的自动化研究,通过 Agentic Surrogate 与 Agentic Acquisition 机制组织并筛选研究想法,并以 Solution Auditor 维护想法与实现的一致性。

  12. HuggingFace Daily Papers(社区热门论文)33

    SCOUT:面向在线策略蒸馏的教师模型学生条件化更新框架

    针对在线策略蒸馏(OPD)中教师模型需监督学生生成前缀、但自身仅按自有策略前缀优化导致续写性能随前缀变长而下降的问题,研究者提出协同训练框架 SCOUT,通过带可验证奖励的强化学习定期优化教师对学生前缀的条件续写能力。在多种教师—学生配置、模型规模和推理领域上,SCOUT 均持续提升在线策略蒸馏效果。

  13. HuggingFace Daily Papers(社区热门论文)42

    WorldLine:面向机器人操作的动作驱动视觉模拟器

    WorldLine 是一个动作驱动的视觉模拟器,将可迁移的动力学学习与异构动作对齐解耦,基于超过 10,000 小时无动作机器人视频学习操作动力学,并用超过 2,000 小时、覆盖十余种本体的动作轨迹完成对齐。

  14. HuggingFace Daily Papers(社区热门论文)39

    EVOKE:在智能体中激发世界知识以实现可迁移决策

    针对 LLM 智能体在多步决策中难以迁移到未见环境的问题,研究者提出后训练方法 EVOKE,通过在固定状态下引入目标多样性,迫使同一候选动作在不同目标下重新排序,从而激发预训练中已内化的世界知识。在三种骨干模型的多类任务上,EVOKE 提升了任务表现、未见环境泛化能力与数据效率。

  15. HuggingFace Daily Papers(社区热门论文)40

    OTRetarget:用最优传输联合重定向机器人与物体运动

    OTRetarget 提出一种统一方法,可从人类演示中联合重定向机器人与多物体运动,通过带符号距离、最近表面点和相对方向表示表面交互,并用熵最优传输在人体、机器人与物体几何间迁移这些量。

  16. HuggingFace Daily Papers(社区热门论文)43

    FocusVTC:自适应分辨率的高效视觉文本压缩

    FocusVTC 通过自适应分辨率打破视觉文本压缩的固定分辨率权衡,在保留通用多模态能力的同时压缩输入长度。在 RULER v1 上以 72 DPI 取得 87.4 分、2.9 倍输入压缩,超过 Glyph 的 57.5 分;LongBench 得分 56.40 高于文本输入基线的 55.86,MRCR 宏平均提升 13.91 分,在线端到端延迟较纯文本提速 2.79 倍。

  17. HuggingFace Daily Papers(社区热门论文)32

    TERRA:面向肌肉骨骼运动的 terrain-aware 重建、重定向与控制

    TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据,恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。

  18. HuggingFace Daily Papers(社区热门论文)44

    SoL-Refiner:一步精修实现 4K 高分辨率视频生成

    SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,其训练流程包含高分辨率持续训练、强化学习后训练与最终的单步蒸馏。

  19. HuggingFace Daily Papers(社区热门论文)41

    LibraryDesignBench:智能体能否为智能体设计代码库?

    研究者推出 LibraryDesignBench,一个两阶段基准,让智能体根据只定义能力与用例、不规定设计的规格实现完整代码库,再由来自不同模型族的三个用户智能体以程序正确性和简洁性评估。

  20. HuggingFace Daily Papers(社区热门论文)36

    RouteFM:面向 LLM 路由的基础模型,预训练一次即可跨环境路由

    研究者提出 RouteFM,通过跨异构路由环境的片段式预训练学习可复用的 LLM 路由能力,让冻结的路由器仅靠上下文即可适配新环境,而非绑定固定模型身份。在未参与预训练的 MMR-Bench 上,每个候选模型仅用 8 条观测,RouteFM 就比最强基线高出 2.23 个质量分。代码已公开。

  21. HuggingFace Daily Papers(社区热门论文)39

    自然语言自编码器如何挑选最具信息量的 token 位置

    研究在 470 万条关于提示注入与隐瞒行为的解释上,比较了模型计算信号与仅用聊天结构训练的排序器,发现聊天结构通常能选出更相关的解释,且无需为位置选择做一次模型前向传播。在四个数据集中的三个上,只解释 5% 的位置就能保留解释全部位置时几乎全部的成功率。预训练 verbalizer 还能在无需额外训练的情况下还原模型经微调学会隐瞒的词语。

  22. HuggingFace Daily Papers(社区热门论文)53

    TabFM:400M 参数的零样本表格数据基础模型

    论文提出 TabFM,一个 400M 参数的表格基础模型,将监督式表格预测建模为 in-context learning,单次前向传播即可产生校准的零样本预测,无需任务特定调参。

  23. HuggingFace Daily Papers(社区热门论文)40

    学习元技能:面向测试时 AI4AI 的 Agent Harness 设计

    研究提出 Meta-Skill 方法,让 Builder 在模型权重冻结的测试时 AI4AI 场景中,从 Target 在开发集上的执行反馈里学习"何时需要支持、提供什么资源"的原则,再用冻结的技能库为未见任务构建执行环境。

  24. HuggingFace Daily Papers(社区热门论文)43

    Prompt2Skill:从自然语言指令进行无监督技能优化

    Prompt2Skill 框架仅凭自然语言任务描述即可为 LLM 构建技能:从提示词推导任务规范、发现或合成数据集,并通过反思式编辑的闭环迭代优化技能。在问答、阅读理解、表格操作和数学推理四个领域,该方法在开源与前沿模型上平均提升 10.8,稳定优于直接提示基线。

  25. HuggingFace Daily Papers(社区热门论文)34

    AdviSD:通过定向多轮自蒸馏让小型顾问模型指导前沿 LLM

    AdviSD 让小型可训练顾问模型用自然语言指导冻结的 LLM 执行器,方法将结果导向的强化学习与选择性自蒸馏结合,用反馈条件下的顾问副本筛选反思修正。用 Qwen3-8B 顾问指导 Gemini 和 Claude 时,AdviSD 在 BFCL-v3 上比 advisor-GRPO 高 4.2-6.4 个百分点,在 EnvScaler 上高 3.9-5.1 分。

  26. HuggingFace Daily Papers(社区热门论文)39

    OASIS:突破 LLM 推理在线自蒸馏的规模扩展瓶颈

    针对在线自蒸馏(OPSD)随模型规模增大而失效的问题,研究者提出 OASIS,仅用最终答案标签、以经核验的在线轨迹为主要监督信号,并用模型自生成尝试替代参考解答作为教师上下文。

  27. HuggingFace Daily Papers(社区热门论文)41

    EpiCon:通过共同演化多模态记忆实现智能体集体学习

    EpiCon 是一个无需更新宿主模型参数的多模态共享记忆框架,通过两个独立训练的 2B 模型——记忆控制器与树状自组织器——连接问题级记忆演化与持久经验库,实现不同智能体之间的经验复用。在覆盖四个多模态任务域的 11 个基准上,第二个 harness 将原系统宏平均分提升 2.6 分;四种宿主配置下较无记忆基线提升 1.7 至 4.9 分,记忆操作时间减少 67% 至 74%。

  28. HuggingFace Daily Papers(社区热门论文)40

    LIFT:通过 On-Policy 自蒸馏实现大视角变化下的未来布局视频生成

    研究团队提出 LIFT,一个统一的图像到视频生成框架,用末帧布局作为显式控制信号,让用户指定未来视角中出现什么内容及其位置。由于稀疏布局引导比逐帧密集布局更难学习,LIFT 引入 on-policy self-distillation(OPSD),将密集布局教师模型的控制能力迁移给末帧布局学生模型。

  29. HuggingFace Daily Papers(社区热门论文)39

    Transformer 残差流中的推理几何:六款预训练语言模型研究

    研究对比六款预训练语言模型的中间残差状态与自身最终状态及其他上下文的最终状态,发现模型自身终点在早期就优于平均替代项,但许多单个终点距离更近。竞争终点集合随深度总体收缩,但其成员不断变化,存活终点之间未必更相似;方向对齐和终点排名可以改善,而到最终状态的欧氏距离变化很小。

  30. HuggingFace Daily Papers(社区热门论文)37

    GRAFT:用跨模型轨迹交换提升 RLVR 训练效率

    针对 GRPO 等 RLVR 方法在有限 rollout 预算下产生全失败组、缺失策略梯度信号的问题,研究者提出 GRAFT 框架,用同伴模型轨迹替换全失败组,并通过序列级兼容性加权与 token 级重要性比率裁剪控制跨模型不匹配。

  31. HuggingFace Daily Papers(社区热门论文)43

    Real2Gym:从视频构建仿真训练场,把技能带给机器人

    Real2Gym 是一个 Real2Sim2Real 智能体框架,能把人类和机器人演示视频转成可交互仿真训练场,并将仿真中学到的技能迁移到实体机器人。其仿真环境重建成功率比 GPT-6 Astra Direct Mode 高 16.7%,策略执行 token 减少约 74.9%;在真实 Franka 机器人四项任务上,实体执行成功率高出 33.3%。

  32. HuggingFace Daily Papers(社区热门论文)40

    PRISM:反事实视频生成实现可扩展的人形机器人移动操作

    PRISM 是一个 real-to-sim-to-real 框架,通过视频到视频(V2V)生成将少量真实视频扩增为数百段"反事实"人-物交互视频,再经接触锚定的 real-to-sim 流程重建人与物体运动,把不完美视频数据重定向为物理合理的轨迹。该框架训练出单一策略,可泛化到同类未见物体,并在真实机器人上零微调部署,仅用机载深度观测完成箱子、桶、储物箱和球的抓取、搬运与放置。