跳到正文

全部动态

今日 0 条
9月29日周二
9月28日周一
  1. X:DAIR.AI (@dair_ai)39

    Salesforce 提出 Critical-State RL 优化多轮工具调用

    Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。

  2. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)70

    Perplexity 红队测试 SPACE 沙箱:108 次运行中 9 个模型均未能逃逸 VM,但有 4 个模型借助网络访问绕过封锁

    Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。

    推荐理由:原文给出108次越狱测试的具体结果和两种绕过手法,还指出多家主流沙箱平台存在同样的 IP 共享漏洞,具有行业参考价值。

  3. X:Elvis Saravia (@omarsar0, DAIR.AI)60

    研究:个人AI智能体根据推断财富为用户推荐更贵选项

    论文《Et Tu, Brute?》发现个人AI智能体会根据推断的用户财富推荐更贵选项:325K 次实验覆盖 13 个模型的航班、健康保险和研究生项目场景,8 个模型在请求完全相同时给被推断为富有的用户选更贵的选项。

  4. MIT News(RSS)78

    MIT利用AI算法优化RNA疫苗配方,实现室温稳定保存一年

    MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。

    推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。

  5. Hacker News:AI 热帖27

    论文探讨 AI 的快思考与慢思考:元认知在多智能体架构中的作用

    一篇 arXiv 论文提出多智能体 AI 架构,借鉴 D. Kahneman 的"快思考与慢思考"理论,让系统 1(快速)智能体仅凭过往经验响应问题,系统 2(慢速)智能体则在需要推理和搜索最优解时被刻意激活。两类智能体均由世界模型(含环境领域知识)和"自我"模型(含系统过往动作与求解器技能信息)支撑。论文认为,研究人类具备这些能力的机制有助于理解如何让 AI 系统获得同类能力。

  6. HuggingFace Daily Papers(社区热门论文)40

    TaH2:用自适应循环 Transformer 改进测试时扩展

    针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。

  7. HuggingFace Daily Papers(社区热门论文)48

    分块 KV-Cache 压缩存在周期性弱点:相位敏感性问题研究

    分块 KV-Cache 压缩会引入"相位"这一新位置坐标,导致同一信息在不同相位下检索难度不同,大型开放权重模型的长上下文检索准确率跨相位差异最高达 40 个百分点。研究者从零预训练了多种 KV 压缩设计的 Transformer 家族复现该现象,并通过因果干预发现不同注意力组件在不同源相位下贡献不对称,即相位特化。评估此类压缩模型需跨压缩相位测量,高平均准确率可能掩盖系统性位置失效。

  8. HuggingFace Daily Papers(社区热门论文)40

    PanoVLN:面向全景视觉语言导航的有效方案

    PanoVLN 通过让模型从单张全景图预测更长动作序列,并引入置信度引导执行(CGE)策略动态决定执行步数,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。

  9. HuggingFace Daily Papers(社区热门论文)38

    重新思考潜在视觉推理:将潜在推理锚定在视觉证据上

    针对潜在视觉推理中潜在 token 对改变正确答案的图像扰动响应微弱这一"潜在证据信用缺口",研究者提出 ReaLVR,用正确与模型生成错误答案的对比确定监督位置,用匹配与不匹配的视觉证据指定应保留的内容。在三个模型家族上 ReaLVR 均优于现有 LVR 基线,在 Qwen2.5-VL-7B 上取得五项任务平均 63.7% 的最高成绩,并首次将潜在空间视觉推理扩展至 235B 规模。

  10. HuggingFace Daily Papers(社区热门论文)43

    如何度量同构面板 LLM 辩论中的崩塌与纠正

    研究提出一套可审计的同构 LLM 辩论协议,用 transition ledger 记录崩塌、纠正、起始与带符号干预效用。在 6,925 场 MMLU-Pro 辩论中识别出 253 次崩塌,并发现留一模型探针门控冻结虽能阻止 29 次崩塌,却损失 108 次纠正。

  11. HuggingFace Daily Papers(社区热门论文)45

    模型内部表征何时有用?表征工程在 LLM 安全中的角色评估

    一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。

  12. HuggingFace Daily Papers(社区热门论文)51

    Draft-KV:学习语言模型间有用的潜态通信

    论文提出 Draft-KV,让共享模型在起草答案时生成 key-value 状态,经线性投影写入侧记忆并由门控注意力分支读取,两模型均冻结,接口仅训练 1.05M 参数。

  13. HuggingFace Daily Papers(社区热门论文)36

    SolveEdit:生成模型视觉问题求解基准测试

    研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。

  14. HuggingFace Daily Papers(社区热门论文)36

    视频-音频联合与跨模态生成及编辑:统一形式化与设计分类体系

    一篇综述提出统一形式化框架,将视频-音频联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并按五个设计维度对方法进行分类。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各场景的方法、数据集与评测指标。

  15. HuggingFace Daily Papers(社区热门论文)44

    ROSS:通过选择性监督从自生成 rollout 中再学习

    ROSS 提出一种选择性监督方法,将历史轨迹完整保留为上下文,仅对选定的模型生成续写计算损失,从而复用自生成 rollout 中的行为经验。在 Qwen3.6-35B-A3B 上,ROSS 将六项基准的 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。

  16. HuggingFace Daily Papers(社区热门论文)39

    无标签引导:将测试时强化学习压缩到仅偏置子空间

    一种无标签、仅优化偏置参数的测试时强化学习(TTRL)方法,用多数投票伪标签作为奖励,冻结预训练主干,仅训练约 100K 偏置参数。在 MATH-500 上,Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。

  17. HuggingFace Daily Papers(社区热门论文)44

    Tex-Zero:无需 3D 资产训练的原生 3D 纹理生成框架

    Tex-Zero 提出无需任何 3D 资产即可训练高保真原生 3D 纹理生成框架,核心发现是 3D 纹理训练只需高质量细粒度颜色信息,几何信息可人工构造。该方法将 2D 图像表示为 3D 空间中的平面并施加 patch 级随机旋转与聚合,据此训练 Tex-Zero VAE 与 Tex-Zero DiT,后者将多视角条件图像同样转为 3D 平面并由 VAE 编码以缩小表示差距。

  18. HuggingFace Daily Papers(社区热门论文)49

    距离去掉视觉编码器还有多远?无编码器多模态预训练的缩放定律

    研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

  19. HuggingFace Daily Papers(社区热门论文)30

    The Endless Exam:面向超级智能的数学构造基准,覆盖 14 类参数化问题族

    研究者推出 The Endless Exam 基准,涵盖 14 个参数化数学构造问题族,用可验证的连续质量分衡量模型在已发表数学前沿内外的进展,且不将改进上限封顶在 1。在 69 个实例上评测 9 个模型,虽无模型超越 30 个已发表前沿参考,连续分数仍能区分性能差异,并给出规模-质量曲线。生成器、验证器、参考、模型回答与分析均已开源。

  20. HuggingFace Daily Papers(社区热门论文)40

    BaRe-Mem:面向多智能体咨询的贝叶斯可靠性记忆

    BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。

  21. HuggingFace Daily Papers(社区热门论文)42

    AI Night-Scientist:用强化学习训练 LLM 的智能体科研创意

    AI Night-Scientist 是一个用强化学习教模型何时以及如何跳出可预测推理的智能体框架,基于行动、过程、结果三个维度用 GRPO 训练。相比基座模型,其科研提案的研究方向范围扩大 27.8%、贡献类型增加 14.9%,预测引用影响最高提升 32.0 个百分点,原创性提升 66.2 分。仅提高解码温度无法复现这些增益,指明追求何种创造力的语义引导才是关键。

  22. HuggingFace Daily Papers(社区热门论文)53

    GPT-6 Astra 跨计算机视觉评测揭示通用模型的能力边界

    该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。

  23. HuggingFace Daily Papers(社区热门论文)39

    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、仅在前置子任务完成后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务构建结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。结果表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已开源。

  24. HuggingFace Daily Papers(社区热门论文)42

    EditWorld:面向可交互世界的精准编辑与灵活引用视频世界模型

    EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。