跳到正文

全部动态

今日 0 条
10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)46

    研究:编码智能体仅修复9%的智能体框架Bug

    美国与中国多家实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编码智能体中表现最好的仅修复 9%,远低于常规软件 bug 约 40% 的修复率。加入过往修复经验指南后,某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。

  2. X:Rohan Paul (@rohanpaul_ai)66

    BIS 报告揭示 AI 巨头循环融资:超半数资金来自 AI 公司同业互投

    国际清算银行(BIS)发布关于 AI 公司间循环融资的报告:2021 至 2025 年间,AI 公司获得的投资中 55.2% 来自其他 AI 公司,同时 AI 投资者将自身 28.7% 的交易额投向 AI 标的。循环交易仅占 AI-to-AI 交易的 16.1%,却持有其中 46.4% 的资金;芯片、云和基础设施供应商参与了 73% 的循环关系。报告提醒,供应商投资客户可能同时损失股权和未来订单,且风险分散在多国多行业,没有单一监管者能看到全貌。作者补充称美国 AI 巨头的领先部分靠收购累积,如 Nvidia 收购 Mellanox、Microsoft 收购 GitHub 和 Nuance、Broadcom 收购 VMware。

  3. X:AI at Meta (@AIatMeta)37

    Meta 团队用 Muse Spark 发现代数反例

    6️⃣ 非结合代数:团队与 Muse Spark 合作,为一条受生物学启发提出的数学结构规则找到了一个例外。他们更进一步,发展出一种替代性刻画,并由研究人员进行了验证和完善。 阅读论文:https://ai.meta.com/research/publications/on-solvable-evolution-algebras-and-a-conjecture-by-garcia-martinez-and-perez-rodriguez/

  4. X:AI at Meta (@AIatMeta)21

    Meta 研究:数学问题简化的紧致性证明

    4️⃣ 优化:什么时候可以用更简单的问题替换一个困难的数学问题,而不丢失任何东西?研究人员与 Muse Spark 合作,证明了一条明确的规则,说明某种特定简化何时能精确捕捉原问题,何时会留下缺口。 阅读论文:https://ai.meta.com/research/publications/tightness-of-the-cycle-based-relaxation-for-completed-length-three-alpha-cycles/

  5. X:AI at Meta (@AIatMeta)37

    Meta 用 Muse Spark 推翻群论猜想

    3️⃣ 群论:研究人员通过找到一个反例,推翻了一条关于描述对称性的数学结构的猜想。Muse Spark 生成了找到该反例的搜索代码,团队验证了结果并完成了证明。 阅读论文:https://ai.meta.com/research/publications/semiabelian-groups-need-not-be-monomial/

  6. X:AI at Meta (@AIatMeta)31

    Meta 用 Muse Spark 证明波动方程有限时间爆破

    2️⃣ 微分方程:想象一场拔河——一种效应把波向内挤压,另一种效应把波向外扩散。波能永远聚集下去吗?在 Muse Spark 的帮助下,研究人员证明,在所研究的条件下,激光启发模型中的波必须在有限时间内"爆破"。 阅读论文:https://ai.meta.com/research/publications/finite-time-blow-up-of-radial-negative-energy-solutions-for-the-mass-critical-biharmonic-nonlinear-schrodinger-equation/

  7. X:AI at Meta (@AIatMeta)29

    Meta 用 Muse Spark 解决球面拟合数学难题

    1️⃣ 概率:数学家与 Muse Spark 合作,回答了关于将随机点拟合到拉伸球面上的问题。在所研究的设定下,他们证明了精确拟合可能与否之间存在一个明确的临界点。 阅读论文:https://ai.meta.com/research/publications/the-strict-threshold-for-gaussian-ellipsoid-fitting/

  8. X:AI at Meta (@AIatMeta)65

    Meta 公布数学家与 Muse Spark 1.1/1.2 协作完成的六篇论文

    Meta 分享数学家与 Muse Spark 1.1 和 Muse Spark 1.2(Thinking Mode)在 meta.ai 普通聊天界面下协作完成的六篇论文,面向无现成解法的开放数学问题,未使用定制研究脚手架。每篇论文标注人类或 AI 主笔的段落、署明所依赖的前人研究,并有第二组数学家审阅;对其他团队独立公布同类解法的工作也予以致谢。

    推荐理由:原文说明了协作方式和论文标注原则,读者可以据此了解 Meta 如何让模型参与真正开放的数学研究问题。

10月2日周五
  1. X:DAIR.AI (@dair_ai)48

    NVIDIA 论文:长时运行智能体可靠性测试

    NVIDIA 发布 Long-Transduction 测试框架,让模型在数千次输出中持续读取、更新并输出状态相关结果,分别变化三个因素。在七个开源权重模型上,上下文从 4K 增至 128K 时准确率下降 62.8%,仅改变输入格式下降 36.5%,单步操作变难下降 39.9%。

  2. X:Rohan Paul (@rohanpaul_ai)38

    腾讯 SkillAdam:让 AI 智能体技能自我进化

    腾讯论文提出 SkillAdam,通过让改写 AI 记住过往修复并避免大幅重写,实现智能体技能指令的自动优化。在长程购物与旅行规划任务上,其平均准确率达 28.3%,优于此前最佳方法 SkillOpt 的 21.7%,且 token 消耗约为后者的三分之一。该方法旨在解决自动改写技能时反复循环、浪费 token 的问题。

  3. X:Rohan Paul (@rohanpaul_ai)64

    Google 论文 Cogentic 展示 Gemini 为 5 个未解数学问题找到新证明

    Google 发布论文 Cogentic,用多智能体编排让 Gemini 在 5 个未解数学问题上找到新证明,经人类专家逐一确认。系统由多个 Agent 并行尝试不同思路,审查者默认每步有错直到被证明,已证明的中间结果留存到下一轮,多数问题约 100 次模型调用完成。论文地址 arxiv.org/abs/2609.40324。

  4. X:Rohan Paul (@rohanpaul_ai)47

    ScienceBuddy:提示词与模型交替迭代提升科学智能体

    ScienceBuddy 通过交替改写提示词与技能、重训模型,将科学智能体准确率从 42.2% 提升至 73.3%。在生物学任务上,仅改提示词与技能就让 4B 小模型准确率从 31.1% 升至 51.1%;仅重训则把 4 次内解题比例从 48.3% 提升到 67.8%。该方法把用户纠错转为评分测试任务,避免修正随对话消失。

  5. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    ProVer:为智能体 RL 精准分配信用

    ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。

  6. X:DAIR.AI (@dair_ai)48

    微软 FOCUS:免训练压缩智能体上下文

    微软提出免训练方法 FOCUS,在测试时压缩 AI 智能体的交互历史:它判断智能体下一步决策真正依赖哪些历史片段,保留这些片段、丢弃其余部分,无需训练数据或微调,可作为独立层接在闭源 API 模型前。在工具调用、QA、网页与多轮对话基准上,FOCUS 将峰值上下文最多削减 48%,任务成功率最多提升 8.9 个百分点。

  7. Apple Machine Learning Research(RSS)47

    Apple 研究:扩散模型置信度排序的局限性

    Apple 研究团队从理论上证明,扩散模型(含 remasking 与 uniform-state 采样器)的每一步只有在所写入位置在已固定 token 条件下相互独立时,才与训练分布匹配,而任何逐位置分布的乘积都无法匹配存在依赖关系的 token 组。

  8. Meta AI:Research Blog(网页)73

    Meta 发布 Muse Spark 与数学家协作完成的六篇数学研究论文

    Meta AI 与数学家合作,使用 Muse Spark 1.1 和 1.2(Thinking Mode、经 meta.ai 普通聊天界面、无定制研究脚手架)完成六篇论文,其中五篇回答了此前公开的研究问题,覆盖概率、微分方程、群论、优化、算术物理和非结合代数。

    推荐理由:Meta 展示了 AI 与数学家协作解决六个公开数学问题的成果,并公开了人机分工与独立验证的协作规范。

  9. Apple Machine Learning Research(RSS)34

    语言判别能力提升多语言语音模型的语言学习效果

    Apple 研究团队发现,在预训练中强化语言判别能力可缩小多语言语音模型与单语言模型的差距。在英语/法语 HuBERT 对照实验中,双语基线 phone-ABX 错误率从 11.6% 降至 10.4%(单语言为 10.8%),sWUGGY 从 52.1% 升至 56.7%,ProsAudit 词汇子任务从 68.9% 升至 72.9%。

  10. X:Epoch AI (@EpochAIResearch)50

    Epoch AI 发布 ChatGPT 使用探索器

    这些趋势来自一个自我选择的用户样本。数据未经加权处理,不代表美国成年人或 ChatGPT 整体用户的人口结构。 阅读我们的完整报告:https://epoch.ai/latest/introducing-the-chatgpt-usage-explorer 自行探索数据:https://epoch.ai/data/chatgpt-usage

  11. X:Rohan Paul (@rohanpaul_ai)49

    NVIDIA 论文:给 AI 智能体配个好裁判,成功率 50%→68%

    NVIDIA 新论文提出,与其给 AI 智能体更多选项,不如给它一个更好的裁判:让小型智能体每步生成 8 个候选命令,再由裁判模型挑选执行。用前沿强模型当裁判时,成功率从 50% 提升到 68%,且无需重新训练;若由小模型自评,提升则小得多。

  12. X:DAIR.AI (@dair_ai)58

    Meta 提出Context Language Models,让模型以文件方式原生管理自身上下文

    Meta 等机构提出 Context Language Models(CLM),把上下文作为文件让模型用 Bash 自由编辑,自主决定保留、重写或删除内容,并区分于 RLM 不允许模型直接编辑实时交互上下文的做法。zero-shot 下在 BrowseComp-Plus 上比现有上下文管理策略高 11.4% 准确率、省 21.5% FLOPs;在线 RL 使 Qwen3.5-9B 提升 47.6% 且少用 12% FLOPs;配套 Suffix Cache Reuse 相比标准 SGLang 降低 35% 服务端计算。论文链接:https://academy.dair.ai/papers/context-language-models-2609.37725