20 多位顶尖 AI 研究者警告自动化 AI 研究存在极端风险
20 多位 AI 研究者在论文中警告,自我改进的 AI 可能引发智能爆炸,签署者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki。
20 多位 AI 研究者在论文中警告,自我改进的 AI 可能引发智能爆炸,签署者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki。
FuseReg 正则化层融合缓解表征自编码器中的重建-生成差距 论文:https://huggingface.co/papers/2609.31620
Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。
Perplexity 安全团队对运行 Perplexity Computer 的沙箱平台 SPACE 做了一个月红队测试,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,108 次运行中无一逃逸 VM 边界。
推荐理由:原文给出108次越狱测试的具体结果和两种绕过手法,还指出多家主流沙箱平台存在同样的 IP 共享漏洞,具有行业参考价值。
论文《Et Tu, Brute?》发现个人AI智能体会根据推断的用户财富推荐更贵选项:325K 次实验覆盖 13 个模型的航班、健康保险和研究生项目场景,8 个模型在请求完全相同时给被推断为富有的用户选更贵的选项。
MIT研究人员借助AI算法优化脂质纳米颗粒(LNP)的辅料配比,成功开发出耐热性更强的RNA疫苗配方。该配方使疫苗在室温下可稳定保存一年,或在37摄氏度下保存两个月,且在小鼠实验中产生的免疫反应与Moderna类似。AI算法通过少量实验数据快速收敛至最优解,将原本需数月的筛选过程缩短至几周。相关成果发表于《Nature Biotechnology》。
推荐理由:展示了AI在小数据集和复杂生物化学问题中的高效应用,显著加速了药物研发流程,具有明确的科学突破和实际应用价值。
一篇 arXiv 论文提出多智能体 AI 架构,借鉴 D. Kahneman 的"快思考与慢思考"理论,让系统 1(快速)智能体仅凭过往经验响应问题,系统 2(慢速)智能体则在需要推理和搜索最优解时被刻意激活。两类智能体均由世界模型(含环境领域知识)和"自我"模型(含系统过往动作与求解器技能信息)支撑。论文认为,研究人类具备这些能力的机制有助于理解如何让 AI 系统获得同类能力。
Google Research 推出 AI 视频联合导演,由 4 个智能体框架组成,运行在 Gemini 和 Veo 之上,用于解决多镜头 AI 视频中的身份漂移和级联错误问题。
研究者提出 Future-Aware Recall(FAR)框架,通过未来感知的预测监督与自适应多线索评分,让世界模型学会从情景记忆中召回对当前预测有用的历史观测。
新算法 LIPPAX 面向联邦随机变分不等式优化,可缓解 Local Extra SGD 的客户端漂移问题,并在有界 Hessian、有界算子和低方差等场景取得更优收敛保证。论文还用精细化分析收紧了经典 Local Extra SGD 的收敛界,并把结果扩展到联邦复合变分不等式。
针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。
分块 KV-Cache 压缩会引入"相位"这一新位置坐标,导致同一信息在不同相位下检索难度不同,大型开放权重模型的长上下文检索准确率跨相位差异最高达 40 个百分点。研究者从零预训练了多种 KV 压缩设计的 Transformer 家族复现该现象,并通过因果干预发现不同注意力组件在不同源相位下贡献不对称,即相位特化。评估此类压缩模型需跨压缩相位测量,高平均准确率可能掩盖系统性位置失效。
针对多教师同策略蒸馏(MOPD)中指令跟随反馈的离散度是数学反馈的数倍、从而主导学生更新的问题,研究者提出领域归一化 MOPD(DN-MOPD),按各领域实测离散度重新缩放反馈。
PanoVLN 通过让模型从单张全景图预测更长动作序列,并引入置信度引导执行(CGE)策略动态决定执行步数,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。
研究者提出 RegLLM,一个针对受监管智能体工作流中有限自主性的诊断测试框架,监测引用有效性、来源接地、schema 合规、升级正确性、宪法对齐和不安全动作率六项可信信号。
针对潜在视觉推理中潜在 token 对改变正确答案的图像扰动响应微弱这一"潜在证据信用缺口",研究者提出 ReaLVR,用正确与模型生成错误答案的对比确定监督位置,用匹配与不匹配的视觉证据指定应保留的内容。在三个模型家族上 ReaLVR 均优于现有 LVR 基线,在 Qwen2.5-VL-7B 上取得五项任务平均 63.7% 的最高成绩,并首次将潜在空间视觉推理扩展至 235B 规模。
VoxParity 基准用 14 个行业 183 个场景测试语音智能体是否根据音频线索改变行动,同一文本的音频变化(如 mayday 呼救、儿童声音下注、恐惧低语)应触发不同的工具调用。
研究提出一套可审计的同构 LLM 辩论协议,用 transition ledger 记录崩塌、纠正、起始与带符号干预效用。在 6,925 场 MMLU-Pro 辩论中识别出 253 次崩塌,并发现留一模型探针门控冻结虽能阻止 29 次崩塌,却损失 108 次纠正。
一项匹配评估对比了表征工程与行为安全防护在 LLM 安全控制与监控上的表现。安全控制方面,DPO 整体控制最强且随训练数据增加而提升,但后续良性微调会削弱其安全性;表征引导仅在低数据场景(尤其高质量对比数据)保持竞争力。安全监控方面,专用文本监控器检测准确率最高,表征探针则以更低边际成本保持竞争力,监控引导干预还能在几乎不增加过度拒答的情况下恢复 DPO 因良性微调损失的大部分安全性。
EvolvingAvatar 是一种因果生成器,通过测试时训练在交互过程中适配用户面部视频与双人音频,其双人上下文预测目标无需测试时目标动作标注即可提供自监督信号。
论文提出 Draft-KV,让共享模型在起草答案时生成 key-value 状态,经线性投影写入侧记忆并由门控注意力分支读取,两模型均冻结,接口仅训练 1.05M 参数。
研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。
一篇综述提出统一形式化框架,将视频-音频联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并按五个设计维度对方法进行分类。该工作称首次系统梳理联合音视频编辑,将其划分为九类编辑、涵盖 28 种编辑类型,并整理了各场景的方法、数据集与评测指标。
ROSS 提出一种选择性监督方法,将历史轨迹完整保留为上下文,仅对选定的模型生成续写计算损失,从而复用自生成 rollout 中的行为经验。在 Qwen3.6-35B-A3B 上,ROSS 将六项基准的 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
一种无标签、仅优化偏置参数的测试时强化学习(TTRL)方法,用多数投票伪标签作为奖励,冻结预训练主干,仅训练约 100K 偏置参数。在 MATH-500 上,Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
KVCMAS 是一个面向多智能体系统的在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体的缓存偏差,并沿智能体工作流链式修正,无需额外参考预填充。
Tex-Zero 提出无需任何 3D 资产即可训练高保真原生 3D 纹理生成框架,核心发现是 3D 纹理训练只需高质量细粒度颜色信息,几何信息可人工构造。该方法将 2D 图像表示为 3D 空间中的平面并施加 patch 级随机旋转与聚合,据此训练 Tex-Zero VAE 与 Tex-Zero DiT,后者将多视角条件图像同样转为 3D 平面并由 VAE 编码以缩小表示差距。
研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。
研究团队提出在线蒸馏方法 OLIVE(OnLine InterVEntion):每轮由学生策略生成前缀、教师自回归续写,再用教师生成 token 上的交叉熵更新学生。
研究者推出 The Endless Exam 基准,涵盖 14 个参数化数学构造问题族,用可验证的连续质量分衡量模型在已发表数学前沿内外的进展,且不将改进上限封顶在 1。在 69 个实例上评测 9 个模型,虽无模型超越 30 个已发表前沿参考,连续分数仍能区分性能差异,并给出规模-质量曲线。生成器、验证器、参考、模型回答与分析均已开源。
PlaylistEval 是一个无需人工标注的智能体框架,可在超过 100 小时的播放列表视频集合上构建视频语言评判基准,自动生成差异由因果退化控制、必须跨集合检索才能作答的问答对。
SEAD 将工具调用智能体的攻击与防御建模为部分可观测的状态控制,并提出攻击方法 DART 与防御方法 SAGE,代码和数据已在 GitHub 开源。
BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。
AI Night-Scientist 是一个用强化学习教模型何时以及如何跳出可预测推理的智能体框架,基于行动、过程、结果三个维度用 GRPO 训练。相比基座模型,其科研提案的研究方向范围扩大 27.8%、贡献类型增加 14.9%,预测引用影响最高提升 32.0 个百分点,原创性提升 66.2 分。仅提高解码温度无法复现这些增益,指明追求何种创造力的语义引导才是关键。
针对 System One 模型 Jev 的概率校准承诺缺乏公开测试的问题,研究者发布 Sys1Cal-v1 数据集,用已知精确概率 P(A) 的真/假命题,通过 Noul、Choice、Score 三个原语查询并以全变差距离评估。
该论文在 9 个领域、34 项能力和 55 个基准上评测 GPT-6 Astra 及五个前沿通用 AI 系统,并与专用模型和人类参考水平比较。Astra 在视觉与空间推理及多种结构化预测上显著领先其他系统;语义解释、推理和以物体为中心的预测接近或达到参考水平,但在度量几何精度、忠实重建、时序一致的密集预测和细粒度专业知识上仍有较大差距,附加推理与专用工具只能弥合部分缺口。
研究发现,在 LIBERO、ManiSkill、MetaWorld 和 CALVIN 上对 π_{0.5}、GR00T N1.5/N1.6 等 flow-based VLA 模型做强化学习后训练,参数更新呈现显著低秩,且高度集中在动作专家的 Timestep Modules 中。
StructRL 是一个在线强化学习框架,通过将任务分解为可验证子任务、仅在前置子任务完成后给予中间奖励并按完成速度缩放奖励,为长时程 VLA 任务构建结构化中间监督。在 RoboCasa365 和 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于所评估的在线 RL 基线。结果表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已开源。
EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。
ColNanoVDR 是首个将无文档查询蒸馏用于多向量视觉文档检索(VDR)的框架,通过基于熵最优传输的 OTW 目标对齐学生与教师的查询 token,无需页面数据。