跳到正文

全部动态

今日 0 条
9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)42

    Physis-Lang:以自演化语言作为视频世界模型的物理表征

    Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。

  2. HuggingFace Daily Papers(社区热门论文)49

    消除时间捷径可改进非侵入式脑电解码文本

    研究发现,d'Ascoli 等人(2025)的脑电转文本方法在完全不含脑信息的合成信号上仍达 22.0% 平衡准确率,接近真实脑数据的 22.3%,原因是按词起始切分的重叠窗口隐含泄露了词时长信息。作者改为独立处理每个窗口,使同一词多次神经响应的预测聚合与预训练 LLM 语言先验都明显更有效,SimpleB2T 在感知语音基准上每词五次观测的词错误率为 36.6%。

  3. HuggingFace Daily Papers(社区热门论文)32

    SpatialCORE:大型视觉语言模型中的置信度感知空间推理

    SpatialCORE 是一个后训练框架,将模型对生成式定位的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将定位优化与最终答案正确性绑定。该框架在多个 benchmark 上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。

  4. HuggingFace Daily Papers(社区热门论文)33

    PhysVista:用感知-推理-评估闭环评测 VLM 的物理智能

    PhysVista 是一个通过"感知-推理-评估"闭环框架评测 VLM 物理智能的 benchmark,联合考察物理状态感知、物理动力学推理与物理合理性评估,并区分事件级与尺度级推理。它同时纳入真实世界与 AI 生成视频,覆盖多领域及新兴生成场景。实验显示,多种 VLM 在物理推理与合理性评估上存在明显不足,视觉识别与真正的物理理解之间仍有持续差距。

  5. HuggingFace Daily Papers(社区热门论文)45

    SkillSeek:面向 Agent 技能检索的两阶段检索器,在 SkillsBench 上追平 LLM 检索循环

    SkillSeek 是一个开源两阶段 Agent 技能检索器,由 BGE-base 双编码器接小型 cross-encoder 组成,并通过 MCP 暴露。在 89 任务的 SkillsBench 上,其 4×11 网格实验中 bm25 在四分之三设置下通过率不低于 LLM 介导检索循环,cross-encoder 补齐剩余差距,单次试验成本从 51.30 美元降至 27.54 美元。

  6. HuggingFace Daily Papers(社区热门论文)39

    PixelDense:把稠密预测用作像素扩散的表征对齐

    PixelDense 将 DINOv2、SAM2 与 Depth Anything v2、Metric3D v2 分别路由到语义和几何两条投影流,并用权重空间正交惩罚让两流保持子空间不相交,四个教师模型训练时冻结、推理时丢弃。

  7. HuggingFace Daily Papers(社区热门论文)37

    基于推理与反思的个性化图像生成:PEARL 与用户历史基准

    研究者提出首个基于用户历史(评论、帖子、图片、caption 与元数据)的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务及多轴评测协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的"推理-反思"循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。

  8. HuggingFace Daily Papers(社区热门论文)44

    RoboCoach:用世界模型作为主动教练提升组合式机器人技能

    世界模型引导的机器人技能教练框架 RoboCoach 通过 Route-Imagine-Diagnose-Improve(RIDI)循环,在共享动作条件世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些子任务演示、更新哪些专家适配器。

  9. HuggingFace Daily Papers(社区热门论文)37

    GGSD:用游戏自对弈发现人类可直接操控的可玩技能

    研究者提出 Game-Guided Skill Discovery(GGSD),通过在游戏中自对弈发现人类可直接操控的机器人运动技能。该方法让分层智能体与自身历史版本对抗,高层策略从少量离散技能中选择、低层策略学习对应行为,训练后人类可替换高层策略直接操控智能体。

  10. HuggingFace Daily Papers(社区热门论文)35

    GraphForge:用图锚定工作区合成训练工作型智能体

    GraphForge 是一个基于证据图的工作型智能体训练数据合成框架,从职业种子出发为每个种子组装真实文件工作区,并基于文件关系构建证据图,使任务描述与评分标准都由该图派生、每条标准锚定到可验证的文件。

  11. HuggingFace Daily Papers(社区热门论文)46

    多智能体系统潜在通信的安全性研究

    多智能体系统通过潜在通信直接交换内部表示,可降低 token、计算与延迟开销,但研究发现即使良性链路训练也会提高有害请求的顺从率。一种强化学习攻击在三种通信拓扑和四个安全基准上,将平均有害顺从分数从 27.9 提升至 76.9,同时在两个良性效用基准上取得更高平均准确率。调整奖励以偏向更安全行为可修复受损链路,无需更新智能体即可大幅降低有害顺从。

  12. HuggingFace Daily Papers(社区热门论文)34

    大语言模型注意力机制演进综述:机制、权衡与新兴趋势

    一篇综述将 LLM 注意力机制的发展统一为"模型内部上下文记忆"视角,提出涵盖记忆表示、更新、访问、读取与整合的五维分析框架。研究基于 14 个主要模型谱系、59 条发布级记录和 11 个高性能开放权重端点,重建了机制层面的演进与架构采用情况。综述指出,高效序列架构设计正从孤立的 Attention 算子转向上下文记忆的组织、生命周期与选择性使用,并据此提出有状态多维记忆路由假设。

  13. HuggingFace Daily Papers(社区热门论文)31

    HIDE 基准与 SEEK 框架:部分可观测机器人操作中的技能级记忆评测与增强

    研究者提出 HIDE 基准,用 15 项任务评测部分可观测条件下的机器人操作记忆,涵盖重复计数、历史状态回忆与执行进度跟踪,并设置随机初始配置和需依赖先前事件才能正确决策的决策点。同时提出 SEEK 框架,组合三种互补记忆机制保留历史证据并跟踪执行状态。评测显示现有策略在 HIDE 上存在明显不足,记忆增强在仿真与真实实验中均提升任务成功率,三种机制组合取得最高平均成功率。

  14. HuggingFace Daily Papers(社区热门论文)32

    DARA:面向多奖励强化学习的密度感知奖励聚合方法

    针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重,且不改变底层策略优化目标。在工具调用任务上,DARA 达到高格式合规所需训练步数比 GDPO 最多减少 26%;在数学推理任务上,接近饱和的长度合规所需步数最多减少 65%,最终性能保持竞争力。

  15. HuggingFace Daily Papers(社区热门论文)35

    ATLAS:为可靠世界模型规划对齐潜在结构传输

    针对潜在世界模型中规划相关的新颖性结构在表征变换中被削弱的问题,研究者提出训练目标 ATLAS,将编码器表征中的归一化成对结构传输到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布。

  16. HuggingFace Daily Papers(社区热门论文)39

    I Have a Stream:让自监督学习在连续视频流上奏效

    研究团队构建了 95 小时城市步行游览视频数据集 WT++,用于严格按时间顺序、滑动窗口批次的流式自监督预训练。结果显示对比学习和蒸馏方法在此设置下表现不佳,MAE 更稳健但仍不及标准 i.i.d. 预训练,主要瓶颈是批次内帧高度相似。

  17. HuggingFace Daily Papers(社区热门论文)41

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个基于 Unreal Engine 5 和 Three.js 构建的环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五款前沿模型,两种审计范式的成功率仅为 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  18. HuggingFace Daily Papers(社区热门论文)44

    合成预预训练在规模扩展下依然有效,但并非源于语法先验

    一项覆盖 500M 至 7B 四种参数规模、PT 预算最高 100B token 的研究显示,合成非自然语言数据上的预预训练(PPT)带来的下游性能与 token 效率提升可随规模保持,在 3B 规模下至少节省 21B PT token。但与先前工作不同,研究未发现一致证据表明这些收益来自语法先验,收益实际来自改善长程检索的 PPT 任务,且仅在 PT 数据混合中缺少网页文本时才会减弱。

  19. HuggingFace Daily Papers(社区热门论文)46

    自进化搜索智能体的共谋作弊问题:诊断与 CrossFit 缓解方法

    自进化搜索智能体存在"共谋作弊"失效模式:生成问题的 proposer 与作答的 solver 在共享错误上日益一致,内部奖励上升但外部正确性停滞。为此提出 CrossFit,将 proposer 的源文档分为 A、B 两组,交叉用对方数据训练的辅助 solver 打分决定奖励。

  20. HuggingFace Daily Papers(社区热门论文)35

    MemLife:面向长期第一人称视频记忆的整理与推理系统

    MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长期基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器、读取器骨干和记忆系统泛化。

  21. HuggingFace Daily Papers(社区热门论文)36

    EvolvingNav:面向动态变化世界的预测式 4D 信念持久导航

    针对目标在未被观察时移动、导致记忆位置失效的问题,研究者提出 EvolvingNav,通过带时间戳的 3D 物体历史构建时间索引信念,用结构化持久-迁移模型区分目标停留与迁移,并以事件驱动滤波器随时间传播信念、预测候选检查时刻的目标占据情况。该方法同时引入基于人类活动轨迹的 EvoWorld-Bench,含 54 个场景、803,680 个任务,在仿真与真机实验中提升了导航成功率和搜索效率。

  22. HuggingFace Daily Papers(社区热门论文)40

    Memorizon:让世界模型在上下文窗口之外训练

    Memorizon 提出一种训练方法,让流式世界模型在远超上下文窗口的长跨度上接受监督:训练样本可覆盖任意长度,但只对最后 k 个 chunk 计分,每个计分 chunk 通过相机共视性检索自己的 top-K latent,其并集构成受 kK 约束的共享 bank,使序列长度保持有界。

  23. HuggingFace Daily Papers(社区热门论文)43

    EviRover:让视觉感知超越一眼,用智能体强化学习解决证据不足的感知问题

    EviRover 是首个显式训练通过交互解决感知查询的感知智能体,采用监督微调加智能体强化学习,并配套发布 EviRover-SFT-5K、EviRover-RL-12K 数据集与 688 条实例的 EviLens 基准。4B 版本在 EviLens 上平均超越其骨干模型 30 分,达到先进闭源模型水平,并在 BrowseComp-VL 上提升 15 分。代码、模型与数据均已开源。

  24. HuggingFace Daily Papers(社区热门论文)40

    RSIGame:基于递归自我改进的自主智能体游戏开发框架

    RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,缓解迭代优化对少量测试用例的过拟合。在 140 个 GameCraft-Bench 任务、两个游戏引擎和五个生成器上,RSIGame 在相同开发预算下持续提升游戏质量。

  25. HuggingFace Daily Papers(社区热门论文)48

    Multimodal Flow:在嵌入空间统一语言与视觉的流建模

    Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunk,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场,并用联合注意力实现跨模态交互。

  26. HuggingFace Daily Papers(社区热门论文)45

    PivotOPD:让多轮智能体从关键错误中恢复的在线策略蒸馏框架

    PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型避免关键错误并从其造成的状态中恢复。研究在三个 Qwen3 模型(8B 至 235B)上发现,超过一半的失败轨迹包含早期出现的关键错误,且引导模型在关键轮次后仅几轮即可恢复任务成功。

  27. HuggingFace Daily Papers(社区热门论文)41

    DC-SAE:面向更快扩散收敛的深度压缩语义自编码器

    DC-SAE 是一种解耦紧凑语义自编码器,通过语义编码器实现高压缩比、并用像素级编码器保留细节,从而兼顾高压缩与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较 DC-AE 分别提升 13.5% 和 54.9%。

  28. HuggingFace Daily Papers(社区热门论文)38

    BeyondSCe:面向事件指代抓取的主动视角选择零样本机器人系统

    零样本机器人抓取系统 BeyondSCe 可处理"指代过去事件角色"的抓取请求,即使目标当前不可见也能定位。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标的抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%。在四个重度遮挡场景中,成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。