跳到正文

全部动态

今日 7 条
10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)36

    Latent-Foresight:为潜在世界模型端到端学习可预测表征

    Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于 flow 的生成式动力学模型,直接塑造具备时间可预测性的表征,取代先压缩 VFM 特征再训练预测器的两阶段流程。该方法通过防止潜在坍缩、对齐重建与生成目标等设计实现稳定联合优化,在多项未来场景理解任务和预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已公开。

  2. HuggingFace Daily Papers(社区热门论文)42

    VTR-Bench:评估视频生成中视觉文本渲染的系统性基准

    VTR-Bench 是用于评估视频生成模型视觉文本渲染能力的系统性基准,包含覆盖广告、科学视频等五类场景的 300 条提示词,并配套自动化评估流程。在 11 个 SOTA 模型上的实验显示,场景文本渲染普遍存在困难,表现最好的模型整体词错误率(WER)为 0.250。

  3. HuggingFace Daily Papers(社区热门论文)37

    HC-DLM:分层连续扩散语言模型

    研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合进单一去噪过程,训练目标由 token 似然的变分下界推导而来。与把连续上下文附加到离散链上的做法不同,HC-DLM 让隐变量成为唯一持续存在的生成状态,每步从中读出 token 并反馈为下一步隐状态更新的脚手架。

  4. HuggingFace Daily Papers(社区热门论文)45

    ScholarCatalyst:一个检索启发新研究论文的基准

    研究者构建了 ScholarCatalyst 基准,让 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推动或可能推动了其项目,并附详细理由。在该检索任务中,Agentic 搜索(0.42 Recall@20)不如嵌入向量检索(0.48),即便基于 Claude Fable 5.1 的智能体也只达到 0.51 R@20。

  5. HuggingFace Daily Papers(社区热门论文)47

    AutoGUIWorld:用图像生成器作为 GUI 智能体的视觉世界模型

    AutoGUIWorld 是一个数据生成框架,用图像生成器的视觉先验加规划器的任务知识合成 GUI 交互轨迹,无需部署或运行真实软件环境。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,经动作 grounding 与转移级质量过滤,在 Ubuntu、Windows、macOS 和 Chrome 上产出 79,266 条带空间标注的 step 级训练样本。

  6. HuggingFace Daily Papers(社区热门论文)42

    4Director:用刚性 3D 几何控制视频世界模型

    4Director 是一个以显式 4D 场景表示为条件的视频世界模型,每个物体从输入图像重建为规范网格,并由每帧一个预设刚性变换驱动。它把受控场景渲染为深度视频,再用 Motion Adapter 生成视角一致的外观、光照与非刚性动态。

  7. HuggingFace Daily Papers(社区热门论文)35

    RPTune:面向 LLM 商品目录搜索的学习式上下文筛选

    RPTune 是一个将学习式目录筛选与 LLM 后训练耦合的端到端框架,通过编码器-重组器筛选器依据下游 LLM 反馈对商品排序和剪枝,并用上下文相对奖励提升后训练效果。在 7 个真实商家的 100 条复杂对话查询上,上下文筛选带来最高 31.4 个百分点的搜索准确率提升,后训练平均再提升 10.3 个百分点,在闭源与开源权重 LLM 上均有效。

  8. HuggingFace Daily Papers(社区热门论文)40

    Ego2Act:评估第一视角视频生成中的目标导向操作

    Ego2Act 是一个面向目标导向的第一视角视频生成基准,包含来自 110 个真实世界任务的 2,640 段视频,覆盖不同物体杂乱程度与多步复杂度。该基准要求模型根据初始场景图像和高层目标,生成手部操作物体完成任务的逼真第一视角视频,并配套推出无参考评估流程 Ego2ActJudge。

  9. HuggingFace Daily Papers34

    InFlowOp:为故障而非流程付费的无标签流内多智能体工作流优化

    论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。

  10. HuggingFace Daily Papers(社区热门论文)45

    LOCI:面向流式世界模型的空间线性记忆架构

    LOCI 是一种混合空间记忆架构,在部分 Transformer 块中保留过去观测的 key-value 缓存,其余块仅处理当前 chunk 并辅以读写受投影相机几何条件约束的循环线性注意力记忆,使视角同时进入记忆寻址与存储内容。

  11. Anthropic:Research(发表成果 · 网页)69

    物理学者 Matthew Schwartz 分享用 Claude 与 BootLoops 做跨学科计算的经验

    哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。

    推荐理由:作者结合自身跨学科项目,说明如何让 Claude 承接适合其能力的问题,并总结了与专家协作及规避模型失败模式的经验。

9月30日周三
  1. MIT News(RSS)61

    MIT 等机构发布 Ataraxos,以极低成本战胜顶级人类 Stratego 选手

    MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。

    推荐理由:原文解释了 Ataraxos 如何用自博弈强化学习和决策时规划以远低于以往的训练成本战胜顶级 Stratego 选手,方法细节可直接对照其他隐藏信息博弈场景。

  2. X:腾讯混元 (@TencentHunyuan)46

    腾讯混元等发布 ExplorationBench 评测 AI 探索能力

    腾讯混元联合复旦、清华发布 ExplorationBench,用可执行规则的 Alien Worlds 评测 AI 自主探索能力,含 AlienCode(31 条隐藏规则改动、70 任务)和 AlienLogic(24 条推理规则、70 定理)两个沙盒。

  3. X:Nathan Lambert (@natolambert)41

    让 LLM 直接编辑上下文

    当前的 harness 在 LLM 如何管理自身上下文方面设置非常僵化。我们展示了你可以让 LLM 直接编辑上下文——从而实现更好的长时程记忆、FLOP 高效适配,以及更多。 不用再害怕 compaction 了!

  4. X:Rohan Paul (@rohanpaul_ai)56

    剑桥等机构研究提出 vibercrime 概念:AI 加速廉价诈骗但未造出新黑客

    Jack Hughes、Ben Collier 和 Daniel R. Thomas 的论文分析近10万条网络犯罪论坛相关帖子,提出 vibercrime 一词:AI 是便利帮手而非犯罪的即插即用工具。生成式AI 主要扩大垃圾网站、机器人账号和拟人化诈骗信息的规模,编码助手多为已有编程能力者省时,尚未显著降低技术门槛或催生创新性黑客手段。

  5. HuggingFace Daily Papers(社区热门论文)36

    CoEvoWhen:面向超长视频时序定位的策略-工具协同演化

    研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上,该方法持续提升超长视频时序定位准确率,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著提升。

  6. HuggingFace Daily Papers(社区热门论文)31

    Jev 决策导向模型推荐重排序实证研究:与 Qwen 重排序器的质量-延迟权衡对比

    一项受控实证研究对比了 TypeSafe AI 称为"System One Model"的 Jev 与推荐专用模型及 pointwise、listwise Qwen 重排序器在多个 Amazon Reviews 领域和候选集规模下的推荐重排序表现。结果显示 Jev 在保持较强推荐效果的同时,延迟增长比 pointwise Qwen 重排序器更为平缓,但服务延迟仍显著高于推荐专用模型。

  7. HuggingFace Daily Papers(社区热门论文)36

    SemanTok:为高效自回归视频生成提供可预测的语义 token

    SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并加入轻量 head,使每个保留的 token 前缀都能单独重建这些特征。201M 的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的各噪声水平上为解码器提供更高语义对齐。

  8. HuggingFace Daily Papers(社区热门论文)39

    AutoDataBench:面向数据智能的自动研究测试平台

    AutoDataBench 是一个隔离数据因素、专门评估 LLM 数据智能的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,并在工具使用、检索和知识注入场景下评测前沿模型迭代改进训练数据的能力。该平台还通过对比训练前预测与实际结果,检验 LLM 是否真正理解数据干预的效果,而非仅靠试错。复用 AutoDataBench 轨迹进行中期训练可提升下游编码性能。

  9. HuggingFace Daily Papers(社区热门论文)40

    更小的模型,更好的拒绝样本:偏好蒸馏的规模规律

    偏好蒸馏中,用更小的冻结模型生成拒绝样本,比学生模型自生成样本训练效果更强,且推理算力更低。研究在 7B 到 72B 学生模型上验证了这一点,覆盖代码生成与数学推理任务,序列级知识蒸馏前后均成立。作者还给出 DPO 的有限时域效用上界,并据此提出混合不同规模拒绝样本、打乱 token、优先选择参考策略下低概率候选三种改进手段。

  10. HuggingFace Daily Papers(社区热门论文)40

    Box^2-Bench:语言模型能否选择性依赖外部指导?

    研究者提出 Box^2-Bench,在固定模型与任务的前提下改变工作流可靠性,以衡量语言模型能否在受益于可靠指导的同时覆盖不可靠指导,即"跳出框框"的能力。测试显示前沿模型虽能从可靠指导中获益,但在指导具有误导性或变得不可靠时仍很脆弱。团队用坏工作流训练两个开放权重模型,发现反事实监督微调可提升鲁棒性,而基于结果的强化学习能提高对有用工作流的使用,该行为还可迁移到同行纠错和受损记忆的鲁棒性上。

  11. HuggingFace Daily Papers(社区热门论文)40

    自回归 Transformer 如何从局部观测外推混沌系统的全局动力学

    小型自回归 Transformer 仅用受限参数区间采样的轨迹训练,就能在训练分布之外的参数上闭环复现倍周期分岔、混沌动力学与吸引子结构。在 logistic 映射上,模型重现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。因果干预显示,控制参数信息经注意力机制进入状态预测,并塑造闭环动力学。

  12. HuggingFace Daily Papers(社区热门论文)42

    Physis-Lang:以自演化语言作为视频世界模型的物理表征

    Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 将物理过程拆解为原子断言、以召回率和精确率评估描述质量。在 Wan 与 Cosmos 骨干上,该方法在四个物理视频基准上持续提升物理合理性;基于开源 Cosmos3-Nano 的增强模型超过领先的闭源 Veo 3.1。

  13. HuggingFace Daily Papers(社区热门论文)49

    消除时间捷径可改进非侵入式脑电解码文本

    研究发现,d'Ascoli 等人(2025)的脑电转文本方法在完全不含脑信息的合成信号上仍达 22.0% 平衡准确率,接近真实脑数据的 22.3%,原因是按词起始切分的重叠窗口隐含泄露了词时长信息。作者改为独立处理每个窗口,使同一词多次神经响应的预测聚合与预训练 LLM 语言先验都明显更有效,SimpleB2T 在感知语音基准上每词五次观测的词错误率为 36.6%。