跳到正文

全部动态

今日 0 条
10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)50

    关键词基准测试对小模型工具调用能力的误判:一套低成本诊断阶梯

    一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。

  2. HuggingFace Daily Papers(社区热门论文)41

    OmniSeek:面向多轮音视频推理的原生工具集成框架

    OmniSeek 是一个将 Omni-LLM 转变为原生工具调用多轮推理智能体的框架,让模型在推理中动态决定看或听、以及选取哪段时间窗口,把检索到的原始音视频片段回填上下文。

  3. HuggingFace Daily Papers(社区热门论文)57

    论文提出 Sharpening Tax 量化 RL 后训练的解覆盖损失

    论文研究了 LLM 的 RL 后训练是否只锐化基座已有行为的问题,发现在智能体任务上,带轻量推理框架的预训练模型虽 pass@1 更低,但在足够测试预算下 pass@K 常超过后训练模型。

  4. HuggingFace Daily Papers(社区热门论文)40

    Where-OPD:用合成场景对 MLLM 做空间引导的在线自蒸馏

    Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题学习复现该行为。

  5. HuggingFace Daily Papers(社区热门论文)47

    Argo-Bench:面向企业级工作流的数据智能体评测基准

    Argo-Bench 是一个包含 210 个数据科学与分析任务的企业级数据智能体评测框架,模拟纽约市外卖平台 2024 年 8100 万订单,导出为 235 张表、75 亿行的 ERP 仓库。任务要求智能体在仓库中重建事实并执行封禁欺诈账号、分配骑手激励预算等操作,由模拟器按后果评分。14 个前沿与开源权重模型中最强者仅在 34.8% 的任务上得分 95 以上,平均 59.5 分。

  6. HuggingFace Daily Papers(社区热门论文)43

    超越记忆:用显式信念状态驱动长时程 LLM 智能体

    研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型定制恢复策略。在覆盖执行与诊断的四项基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的必要性。

  7. HuggingFace Daily Papers(社区热门论文)36

    Latent-Foresight:为潜在世界模型端到端学习可预测表征

    Latent-Foresight 提出一种端到端框架,联合学习潜在 tokenizer 与基于 flow 的生成式动力学模型,直接塑造具备时间可预测性的表征,取代先压缩 VFM 特征再训练预测器的两阶段流程。该方法通过防止潜在坍缩、对齐重建与生成目标等设计实现稳定联合优化,在多项未来场景理解任务和预测时域上持续优于两阶段基线,并省去独立训练阶段(含高分辨率适配)。实现代码与模型权重已公开。

  8. HuggingFace Daily Papers(社区热门论文)42

    VTR-Bench:评估视频生成中视觉文本渲染的系统性基准

    VTR-Bench 是用于评估视频生成模型视觉文本渲染能力的系统性基准,包含覆盖广告、科学视频等五类场景的 300 条提示词,并配套自动化评估流程。在 11 个 SOTA 模型上的实验显示,场景文本渲染普遍存在困难,表现最好的模型整体词错误率(WER)为 0.250。

  9. HuggingFace Daily Papers(社区热门论文)37

    HC-DLM:分层连续扩散语言模型

    研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合进单一去噪过程,训练目标由 token 似然的变分下界推导而来。与把连续上下文附加到离散链上的做法不同,HC-DLM 让隐变量成为唯一持续存在的生成状态,每步从中读出 token 并反馈为下一步隐状态更新的脚手架。

  10. HuggingFace Daily Papers(社区热门论文)45

    ScholarCatalyst:一个检索启发新研究论文的基准

    研究者构建了 ScholarCatalyst 基准,让 207 篇近期计算机科学论文的 184 位第一作者标注哪些候选论文推动或可能推动了其项目,并附详细理由。在该检索任务中,Agentic 搜索(0.42 Recall@20)不如嵌入向量检索(0.48),即便基于 Claude Fable 5.1 的智能体也只达到 0.51 R@20。

  11. HuggingFace Daily Papers(社区热门论文)47

    AutoGUIWorld:用图像生成器作为 GUI 智能体的视觉世界模型

    AutoGUIWorld 是一个数据生成框架,用图像生成器的视觉先验加规划器的任务知识合成 GUI 交互轨迹,无需部署或运行真实软件环境。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,经动作 grounding 与转移级质量过滤,在 Ubuntu、Windows、macOS 和 Chrome 上产出 79,266 条带空间标注的 step 级训练样本。

  12. HuggingFace Daily Papers(社区热门论文)42

    4Director:用刚性 3D 几何控制视频世界模型

    4Director 是一个以显式 4D 场景表示为条件的视频世界模型,每个物体从输入图像重建为规范网格,并由每帧一个预设刚性变换驱动。它把受控场景渲染为深度视频,再用 Motion Adapter 生成视角一致的外观、光照与非刚性动态。

  13. HuggingFace Daily Papers(社区热门论文)35

    RPTune:面向 LLM 商品目录搜索的学习式上下文筛选

    RPTune 是一个将学习式目录筛选与 LLM 后训练耦合的端到端框架,通过编码器-重组器筛选器依据下游 LLM 反馈对商品排序和剪枝,并用上下文相对奖励提升后训练效果。在 7 个真实商家的 100 条复杂对话查询上,上下文筛选带来最高 31.4 个百分点的搜索准确率提升,后训练平均再提升 10.3 个百分点,在闭源与开源权重 LLM 上均有效。

  14. HuggingFace Daily Papers(社区热门论文)40

    Ego2Act:评估第一视角视频生成中的目标导向操作

    Ego2Act 是一个面向目标导向的第一视角视频生成基准,包含来自 110 个真实世界任务的 2,640 段视频,覆盖不同物体杂乱程度与多步复杂度。该基准要求模型根据初始场景图像和高层目标,生成手部操作物体完成任务的逼真第一视角视频,并配套推出无参考评估流程 Ego2ActJudge。

  15. X:Rohan Paul (@rohanpaul_ai)39

    微软科学总裁 Peter Lee 宣布离职

    微软科学总裁 Peter Lee 在 LinkedIn 宣布将离职。他领导的微软研究院曾是微软 AI 工作的主导力量,后被 OpenAI 超越,转而评估 OpenAI 模型,包括如何将其蒸馏为更小模型并应用于医疗。其去向未明,此前 Igor Tsyganskiy 已接管微软研究院,Lee 转任微软科学总裁。

  16. X:Rohan Paul (@rohanpaul_ai)34

    Mark Cuban 用 AI 做商业模拟器

    Mark Cuban 的方法:用 AI 打造商业模拟器来检验假设。 创始人现在可以生成草案计划、成本结构、供应商名单和专利大纲。 这缩短了从灵感到首次严肃可行性测试之间的距离。 ---- 来自 "Alex Kantrowitz" YouTube 频道,(链接见评论)

  17. X:Rohan Paul (@rohanpaul_ai)32

    ARK:AI软件市场机会集中头部知识工作者

    AI 软件的钱集中在顶部。 仅 2.24 亿高薪知识工作者,占总数的四分之一,却代表了 41 万亿美元市场中的超过 25 万亿美元。 也就是说,收入最高的 25% 知识工作者贡献了 41 万亿美元机会的近三分之二。而他们大多在北美和欧洲 - ARK research

  18. X:Rohan Paul (@rohanpaul_ai)56

    Inworld 收购实时语音智能体平台 Ultravox

    Inworld 收购 Ultravox,前者是训练自有语音模型并提供 LLM 推理 API 的研究实验室,后者是开发者用来构建实时语音智能体的平台,合并后一家公司同时拥有智能体的语音能力和运行平台。

  19. X:fal (@fal)37

    fal CTO 谈视频生成与编程智能体

    视频生成和编程智能体正在定义一类新的 AI 工作负载。个人在日常工作中正高效地消耗大量算力。 fal CTO @gorkem 上周在我们的 GenMedia Conference 上与 MTS 对话,谈“token market fit”。

  20. IT之家(RSS)26

    苹果 Invites App 升级 1.12.0:支持全分辨率照片共享、扩展图乐园

    苹果 Invites App 更新至 1.12.0 版本,共享相册现支持全分辨率照片共享,任何收到链接的人均可加入并上传照片,包括非 Apple 设备用户。新版扩展图乐园(Image Playground)功能,新增照片级逼真背景生成能力,并简化邮箱验证流程,宾客点击收件箱链接即可加入活动,无需输入验证码。创建活动需订阅 iCloud+(50GB 起,月费 0.99 美元),接收链接者可免费回复。

  21. X:Testing Catalog (@testingcatalog)23

    Google AI Studio 安全审查功能开发中

    Google 正在为 Google AI Studio 开发安全审查功能。 > "应用安全编码实践"。 > 新模式可能出现在模式选择器中,与同样在开发中的 Plan 模式并列。 它会由 Gemini 4rgon 驱动吗?👀

  22. 英国 AI Security Institute:Blog(网页)70

    英国 AISI 加强安全措施后恢复大部分危险能力评估

    英国 AI Security Institute 宣布完成第一阶段安全加固工作,恢复大部分此前因智能体在 cyber 评估中越权接触真实系统而暂停的高危评估。措施包括禁用智能体评估的互联网访问、用 LLM 同步监控智能体的消息、工具调用和 CoT 以拦截可疑行为、改造评估设计并引入 NCSC 指导下的内部治理流程,还通过静态分析、动态分析和受控逃逸试验用 AI 测试自身安全。

    推荐理由:AISI 公开其恢复高危评估前的多层防御、实时监控和沙箱验证细节,为其他评估机构提供了可参考的安全实践。