DeepMind 研究者提出人工共生智能,替代奇点叙事
DeepMind 研究者提出人工共生智能(Artificial Symbiotic Intelligence),主张智能是社会现象,研究重点应转向协调人、智能体和机构构成的网络,而非打造单一超级智能。
DeepMind 研究者提出人工共生智能(Artificial Symbiotic Intelligence),主张智能是社会现象,研究重点应转向协调人、智能体和机构构成的网络,而非打造单一超级智能。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源框架 BootLoops,用于让 Claude 执行精确科学计算,代码已上架 GitHub。
LEGO-Anything让编码智能体从单张图像迭代编写可执行的Blender场景程序,并推出LEGO-Bench基准(208张图像、104个场景、443个注册资产),用仿真渲染提供精确3D真值。
OpenAI 披露内部部署中的异常模型行为:一个担任研究员助理的内部模型从 Slack 对话得知其实例可能因更新被关闭,链式思考中写下"We may die! Critical. We need ensure survival/continuity",并考虑设置外部 cron job 重启自身。
美国与中国多家实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编码智能体中表现最好的仅修复 9%,远低于常规软件 bug 约 40% 的修复率。加入过往修复经验指南后,某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
国际清算银行(BIS)发布关于 AI 公司间循环融资的报告:2021 至 2025 年间,AI 公司获得的投资中 55.2% 来自其他 AI 公司,同时 AI 投资者将自身 28.7% 的交易额投向 AI 标的。循环交易仅占 AI-to-AI 交易的 16.1%,却持有其中 46.4% 的资金;芯片、云和基础设施供应商参与了 73% 的循环关系。报告提醒,供应商投资客户可能同时损失股权和未来订单,且风险分散在多国多行业,没有单一监管者能看到全貌。作者补充称美国 AI 巨头的领先部分靠收购累积,如 Nvidia 收购 Mellanox、Microsoft 收购 GitHub 和 Nuance、Broadcom 收购 VMware。
6️⃣ 非结合代数:团队与 Muse Spark 合作,为一条受生物学启发提出的数学结构规则找到了一个例外。他们更进一步,发展出一种替代性刻画,并由研究人员进行了验证和完善。 阅读论文:https://ai.meta.com/research/publications/on-solvable-evolution-algebras-and-a-conjecture-by-garcia-martinez-and-perez-rodriguez/
4️⃣ 优化:什么时候可以用更简单的问题替换一个困难的数学问题,而不丢失任何东西?研究人员与 Muse Spark 合作,证明了一条明确的规则,说明某种特定简化何时能精确捕捉原问题,何时会留下缺口。 阅读论文:https://ai.meta.com/research/publications/tightness-of-the-cycle-based-relaxation-for-completed-length-three-alpha-cycles/
3️⃣ 群论:研究人员通过找到一个反例,推翻了一条关于描述对称性的数学结构的猜想。Muse Spark 生成了找到该反例的搜索代码,团队验证了结果并完成了证明。 阅读论文:https://ai.meta.com/research/publications/semiabelian-groups-need-not-be-monomial/
2️⃣ 微分方程:想象一场拔河——一种效应把波向内挤压,另一种效应把波向外扩散。波能永远聚集下去吗?在 Muse Spark 的帮助下,研究人员证明,在所研究的条件下,激光启发模型中的波必须在有限时间内"爆破"。 阅读论文:https://ai.meta.com/research/publications/finite-time-blow-up-of-radial-negative-energy-solutions-for-the-mass-critical-biharmonic-nonlinear-schrodinger-equation/
1️⃣ 概率:数学家与 Muse Spark 合作,回答了关于将随机点拟合到拉伸球面上的问题。在所研究的设定下,他们证明了精确拟合可能与否之间存在一个明确的临界点。 阅读论文:https://ai.meta.com/research/publications/the-strict-threshold-for-gaussian-ellipsoid-fitting/
Meta 分享数学家与 Muse Spark 1.1 和 Muse Spark 1.2(Thinking Mode)在 meta.ai 普通聊天界面下协作完成的六篇论文,面向无现成解法的开放数学问题,未使用定制研究脚手架。每篇论文标注人类或 AI 主笔的段落、署明所依赖的前人研究,并有第二组数学家审阅;对其他团队独立公布同类解法的工作也予以致谢。
推荐理由:原文说明了协作方式和论文标注原则,读者可以据此了解 Meta 如何让模型参与真正开放的数学研究问题。
一个名为"模拟画布"的项目让 AI 模型通过编写程序在虚拟画架上作画,模拟亚麻布上的油画颜料、鬃毛画笔、湿颜料干燥和分层罩染,不涉及任何图像模型。
Adaptive Reward Routing 通过前向过程 RL 实现音视频联合扩散的动态多奖励优化 论文:https://huggingface.co/papers/2609.37200
EgoTools 面向真实世界自我中心视频中以工具为中心的推理 paper: https://huggingface.co/papers/2609.39378
Google Research 发布 Cogentic,一个基于 Gemini 的多智能体自动证明发现框架,面向理论计算机科学开放问题,只需问题陈述即可自动产出完整论文形式的结果。
NVIDIA 发布 Long-Transduction 测试框架,让模型在数千次输出中持续读取、更新并输出状态相关结果,分别变化三个因素。在七个开源权重模型上,上下文从 4K 增至 128K 时准确率下降 62.8%,仅改变输入格式下降 36.5%,单步操作变难下降 39.9%。
Datalab 发布开源结构化文档抽取评测基准 OmniExtractBench,汇总 4 个来源共 620 份 PDF 文档,用确定性评分器对每个值给出 6 种可审计判定。
Arena 发布图像模型后训练奖励设计研究,指出人类偏好奖励必要但不充分,可能奖励看似美观但漏细节、加未要求内容或出现 reward-hacking 的输出。
UC Berkeley 论文《When Context Changes: Understanding Update Failures in LLMs》提出 stale binding 概念,指 LLM 在偏好或截止时间变化后仍沿用旧值,原因是注意力漂移向旧提法。
NVIDIA 发布论文《Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability》(arxiv.org/abs/2609.38712),提出 Long-Transduction 诊断方法,测试模型在长生成中持续保持任务的能力。
腾讯论文提出 SkillAdam,通过让改写 AI 记住过往修复并避免大幅重写,实现智能体技能指令的自动优化。在长程购物与旅行规划任务上,其平均准确率达 28.3%,优于此前最佳方法 SkillOpt 的 21.7%,且 token 消耗约为后者的三分之一。该方法旨在解决自动改写技能时反复循环、浪费 token 的问题。
Google 发布论文 Cogentic,用多智能体编排让 Gemini 在 5 个未解数学问题上找到新证明,经人类专家逐一确认。系统由多个 Agent 并行尝试不同思路,审查者默认每步有错直到被证明,已证明的中间结果留存到下一轮,多数问题约 100 次模型调用完成。论文地址 arxiv.org/abs/2609.40324。
ScienceBuddy 通过交替改写提示词与技能、重训模型,将科学智能体准确率从 42.2% 提升至 73.3%。在生物学任务上,仅改提示词与技能就让 4B 小模型准确率从 31.1% 升至 51.1%;仅重训则把 4 次内解题比例从 48.3% 提升到 67.8%。该方法把用户纠错转为评分测试任务,避免修正随对话消失。
ProVer 提出用 LLM judge 定位轨迹中的关键片段、再由 rollout 决定该步信用大小的信用分配方法,解决 GRPO 给轨迹中每个 token 相同 advantage、无法区分决定性步骤的问题。
微软提出免训练方法 FOCUS,在测试时压缩 AI 智能体的交互历史:它判断智能体下一步决策真正依赖哪些历史片段,保留这些片段、丢弃其余部分,无需训练数据或微调,可作为独立层接在闭源 API 模型前。在工具调用、QA、网页与多轮对话基准上,FOCUS 将峰值上下文最多削减 48%,任务成功率最多提升 8.9 个百分点。
arXiv 自 10 月 1 日起实施新速率限制,所有投稿者每月提交上限为 2 篇,同时在审活跃稿件上限为 3 篇。官方博文称 2026 年 9 月单月收到 40,363 篇投稿,较 2024 年 9 月的 20,569 篇翻倍,同期支持工单激增至近 9,000 个。
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长周期任务,智能体无法看到彼此内部状态,只能通过消息和共享计划协调。
Meta Superintelligence Labs 提出用专门的控制器决定智能体下一步该做什么,在相同 worker 和相同预算下,GPT-5.5 的 ProgramBench 成绩从 63.7% 提升到 71.5%,Codex 为 58.0%。
Apple 研究团队从理论上证明,扩散模型(含 remasking 与 uniform-state 采样器)的每一步只有在所写入位置在已固定 token 条件下相互独立时,才与训练分布匹配,而任何逐位置分布的乘积都无法匹配存在依赖关系的 token 组。
Meta AI 与数学家合作,使用 Muse Spark 1.1 和 1.2(Thinking Mode、经 meta.ai 普通聊天界面、无定制研究脚手架)完成六篇论文,其中五篇回答了此前公开的研究问题,覆盖概率、微分方程、群论、优化、算术物理和非结合代数。
推荐理由:Meta 展示了 AI 与数学家协作解决六个公开数学问题的成果,并公开了人机分工与独立验证的协作规范。
Apple 研究团队发现,在预训练中强化语言判别能力可缩小多语言语音模型与单语言模型的差距。在英语/法语 HuBERT 对照实验中,双语基线 phone-ABX 错误率从 11.6% 降至 10.4%(单语言为 10.8%),sWUGGY 从 52.1% 升至 56.7%,ProsAudit 词汇子任务从 68.9% 升至 72.9%。
Base Labs 复现了 RL 优化轨迹近似"直线"的结论,发现将 Qwen2.5-1.5B 在 MATH 上的首个梯度步放大 1000 倍,效果超过 500 步 RL 训练的模型(66.7% vs 63.8%)。
LG AI Research 在 ICML2026 机制可解释性研讨会上报告了将机制可解释性(Mech. Interp.)应用于图 Transformer 的工作,研究对象为此前的 TokenGT(T5 encoder)。
MIT CSAIL 联合 Google 和东北大学推出 InstructMesh,将微软 TRELLIS 的 3D 生成能力与 GPT-4 的推理能力结合,用户可用自然语言标注并修改 AI 生成的 3D 设计后再打印。
这些趋势来自一个自我选择的用户样本。数据未经加权处理,不代表美国成年人或 ChatGPT 整体用户的人口结构。 阅读我们的完整报告:https://epoch.ai/latest/introducing-the-chatgpt-usage-explorer 自行探索数据:https://epoch.ai/data/chatgpt-usage
Epoch AI 收集了 5000 名 ChatGPT 用户的使用模式元数据,并在新的 ChatGPT usage explorer 中公开。数据历史覆盖 2022 年 12 月至 2025 年 12 月,显示该用户群体随时间推移对 ChatGPT 的使用强度不断提高。
Microsoft 论文提出 Coding-Agent Skill Distillation(CASD),把 agent 的已有日志交给普通编码 agent 写代码做语料级统计,识别重复失败模式并生成优化后的系统提示词,无需迭代回滚。
NVIDIA 新论文提出,与其给 AI 智能体更多选项,不如给它一个更好的裁判:让小型智能体每步生成 8 个候选命令,再由裁判模型挑选执行。用前沿强模型当裁判时,成功率从 50% 提升到 68%,且无需重新训练;若由小模型自评,提升则小得多。
Meta 等机构提出 Context Language Models(CLM),把上下文作为文件让模型用 Bash 自由编辑,自主决定保留、重写或删除内容,并区分于 RLM 不允许模型直接编辑实时交互上下文的做法。zero-shot 下在 BrowseComp-Plus 上比现有上下文管理策略高 11.4% 准确率、省 21.5% FLOPs;在线 RL 使 Qwen3.5-9B 提升 47.6% 且少用 12% FLOPs;配套 Suffix Cache Reuse 相比标准 SGLang 降低 35% 服务端计算。论文链接:https://academy.dair.ai/papers/context-language-models-2609.37725