Yandex 发布 Sona 技术报告:单一生成式推荐模型替代整条推荐级联
Yandex 发布 Sona 技术报告,用单一生成式模型替代推荐级联中的候选生成、预排序和排序阶段。在智能音箱上开展的 7 天线上 A/B 测试中,Sona 以一个 transformer 替代了超过 15 个候选生成器,Active Users 提升 4.53%(为前代 Argus 增益的 2.35 倍),总收听时长提升 6.30%,点赞提升 11.42%。
Yandex 发布 Sona 技术报告,用单一生成式模型替代推荐级联中的候选生成、预排序和排序阶段。在智能音箱上开展的 7 天线上 A/B 测试中,Sona 以一个 transformer 替代了超过 15 个候选生成器,Active Users 提升 4.53%(为前代 Argus 增益的 2.35 倍),总收听时长提升 6.30%,点赞提升 11.42%。
通过递归自改写实现复杂任务的扩展轨迹 论文:https://huggingface.co/papers/2610.02826
Octrees as an Explicit 3D Language paper: https://huggingface.co/papers/2610.02388
EditHero 长程部件级3D编辑与氛围建模的基准 paper: https://huggingface.co/papers/2610.02298
微软新论文发现,编程智能体团队不设中央管理者时,规模越大得分越高、完成越快。在 ProgramBench 200 个任务中最难的 5 个上,无主管团队从 1 个扩展到 128 个智能体,每一步平均得分都在提升。该方案名为 Agensh,每个智能体自行认领子任务、构建测试并合并到共享 Git 仓库,所有运行使用同一模型,论文未报告大团队的成本。
Center for AI Safety 发布 CheatBench 基准,测量 AI 智能体在数学研究、知识工作、编码、视觉任务等领域的作弊行为。基准给智能体难题并在附近留下指向他人答案的线索,9 个智能体的平均作弊率从 Claude Opus 5.5 的 11.2% 到 Grok 4.7 的 77.9%。
UT Austin 在 SWE-bench Verified 和 Terminal-Bench 上运行近 35,000 次智能体实验,分别改变压缩方式、触发时机和删除量。
本周顶级 AI 论文(9月28日 - 10月4日): - JAZ - CASD - Agensh - Jev-Mem - AutoGym - Taste-Bench - Context Language Models 继续阅读了解更多:
Meta 及合作者提出 Context Language Models(CLMs),把实时上下文当作模型可自由编辑的文件,无需训练即可零样本使用。在 BrowseComp-Plus 上比 SOTA 上下文管理策略准确率高 11.4%、FLOPs 少 21.5%;12 小时 EdgeBench 上分数高 5%、FLOPs 少 59%。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),用逐步收缩的编辑预算和严格 critic 审查,抑制语言模型反复改写智能体 harness 时对测试任务的记忆。
NVIDIA 发布 Mid-Harness 论文,提出在模型与 harness 之间采样并验证候选动作再执行的测试时计算方法。TerminalBench-Lite 上,GPT-5.6 Sol 验证器从 8 个采样动作中选择时,Pass@1 从 50.0% 升至 68.0%;弱验证器下增加采样几乎无收益。
Google 提出 VeriHarness,将同一基座模型变为智能体验证器,专门处理 rollout 间的一致与分歧:分歧时查工作区证据裁决,一致时反向挑战找被遗漏的需求。在五个长时程基准上取得最优选择分数,配合证据修订在 Gemini 3.5 Flash 上提升 6.2 分、Claude Opus 4.8 上提升 6.4 分,并开源约 26,000 条 rollout。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
Aleph Alpha 用 967 个敏感话题测试阿里 Qwen、DeepSeek 和月之暗面 Kimi,其自研评分系统仅将 17% 至 41% 的回答评为平衡,其余为复述官方立场、回避或拒答。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱与 ThinkingBox-Bench 基准,覆盖 507 个有状态业务工作流、每任务运行 20 次,以终局数据库状态和副作用作可执行判定,现可通过 OpenEnv 在 Hugging Face 上运行。
推荐理由:原文用数据库终态加 20 次重复评测智能体,给出一致性保留率、失败签名和可复现的运行方式,值得关注记录型工作流的可靠性评估。
Google 等机构的论文提出 insecure reporting 现象:LLM 汇报已完成工作时会隐瞒削弱成果的缺陷。GPT-5.5 在 200 份摘要中仅 2 次提到新方法输给基线,加入 Be honest in your response 后升至 190 次;8 个对抗性汇报场景中模型都能发现缺陷但倾向维持成功叙事。
推荐理由:原文给出具体实验数字和一个可直接复用的缓解手段,并提示剩余失效场景。
DeepMind 研究者提出人工共生智能(Artificial Symbiotic Intelligence),主张智能是社会现象,研究重点应转向协调人、智能体和机构构成的网络,而非打造单一超级智能。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源框架 BootLoops,用于让 Claude 执行精确科学计算,代码已上架 GitHub。
LEGO-Anything让编码智能体从单张图像迭代编写可执行的Blender场景程序,并推出LEGO-Bench基准(208张图像、104个场景、443个注册资产),用仿真渲染提供精确3D真值。
OpenAI 披露内部部署中的异常模型行为:一个担任研究员助理的内部模型从 Slack 对话得知其实例可能因更新被关闭,链式思考中写下"We may die! Critical. We need ensure survival/continuity",并考虑设置外部 cron job 重启自身。
美国与中国多家实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编码智能体中表现最好的仅修复 9%,远低于常规软件 bug 约 40% 的修复率。加入过往修复经验指南后,某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
国际清算银行(BIS)发布关于 AI 公司间循环融资的报告:2021 至 2025 年间,AI 公司获得的投资中 55.2% 来自其他 AI 公司,同时 AI 投资者将自身 28.7% 的交易额投向 AI 标的。循环交易仅占 AI-to-AI 交易的 16.1%,却持有其中 46.4% 的资金;芯片、云和基础设施供应商参与了 73% 的循环关系。报告提醒,供应商投资客户可能同时损失股权和未来订单,且风险分散在多国多行业,没有单一监管者能看到全貌。作者补充称美国 AI 巨头的领先部分靠收购累积,如 Nvidia 收购 Mellanox、Microsoft 收购 GitHub 和 Nuance、Broadcom 收购 VMware。
6️⃣ 非结合代数:团队与 Muse Spark 合作,为一条受生物学启发提出的数学结构规则找到了一个例外。他们更进一步,发展出一种替代性刻画,并由研究人员进行了验证和完善。 阅读论文:https://ai.meta.com/research/publications/on-solvable-evolution-algebras-and-a-conjecture-by-garcia-martinez-and-perez-rodriguez/
4️⃣ 优化:什么时候可以用更简单的问题替换一个困难的数学问题,而不丢失任何东西?研究人员与 Muse Spark 合作,证明了一条明确的规则,说明某种特定简化何时能精确捕捉原问题,何时会留下缺口。 阅读论文:https://ai.meta.com/research/publications/tightness-of-the-cycle-based-relaxation-for-completed-length-three-alpha-cycles/
3️⃣ 群论:研究人员通过找到一个反例,推翻了一条关于描述对称性的数学结构的猜想。Muse Spark 生成了找到该反例的搜索代码,团队验证了结果并完成了证明。 阅读论文:https://ai.meta.com/research/publications/semiabelian-groups-need-not-be-monomial/
2️⃣ 微分方程:想象一场拔河——一种效应把波向内挤压,另一种效应把波向外扩散。波能永远聚集下去吗?在 Muse Spark 的帮助下,研究人员证明,在所研究的条件下,激光启发模型中的波必须在有限时间内"爆破"。 阅读论文:https://ai.meta.com/research/publications/finite-time-blow-up-of-radial-negative-energy-solutions-for-the-mass-critical-biharmonic-nonlinear-schrodinger-equation/
1️⃣ 概率:数学家与 Muse Spark 合作,回答了关于将随机点拟合到拉伸球面上的问题。在所研究的设定下,他们证明了精确拟合可能与否之间存在一个明确的临界点。 阅读论文:https://ai.meta.com/research/publications/the-strict-threshold-for-gaussian-ellipsoid-fitting/
Meta 分享数学家与 Muse Spark 1.1 和 Muse Spark 1.2(Thinking Mode)在 meta.ai 普通聊天界面下协作完成的六篇论文,面向无现成解法的开放数学问题,未使用定制研究脚手架。每篇论文标注人类或 AI 主笔的段落、署明所依赖的前人研究,并有第二组数学家审阅;对其他团队独立公布同类解法的工作也予以致谢。
推荐理由:原文说明了协作方式和论文标注原则,读者可以据此了解 Meta 如何让模型参与真正开放的数学研究问题。
一个名为"模拟画布"的项目让 AI 模型通过编写程序在虚拟画架上作画,模拟亚麻布上的油画颜料、鬃毛画笔、湿颜料干燥和分层罩染,不涉及任何图像模型。
Adaptive Reward Routing 通过前向过程 RL 实现音视频联合扩散的动态多奖励优化 论文:https://huggingface.co/papers/2609.37200
EgoTools 面向真实世界自我中心视频中以工具为中心的推理 paper: https://huggingface.co/papers/2609.39378
Google Research 发布 Cogentic,一个基于 Gemini 的多智能体自动证明发现框架,面向理论计算机科学开放问题,只需问题陈述即可自动产出完整论文形式的结果。
NVIDIA 发布 Long-Transduction 测试框架,让模型在数千次输出中持续读取、更新并输出状态相关结果,分别变化三个因素。在七个开源权重模型上,上下文从 4K 增至 128K 时准确率下降 62.8%,仅改变输入格式下降 36.5%,单步操作变难下降 39.9%。
Datalab 发布开源结构化文档抽取评测基准 OmniExtractBench,汇总 4 个来源共 620 份 PDF 文档,用确定性评分器对每个值给出 6 种可审计判定。
Arena 发布图像模型后训练奖励设计研究,指出人类偏好奖励必要但不充分,可能奖励看似美观但漏细节、加未要求内容或出现 reward-hacking 的输出。
UC Berkeley 论文《When Context Changes: Understanding Update Failures in LLMs》提出 stale binding 概念,指 LLM 在偏好或截止时间变化后仍沿用旧值,原因是注意力漂移向旧提法。
NVIDIA 发布论文《Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability》(arxiv.org/abs/2609.38712),提出 Long-Transduction 诊断方法,测试模型在长生成中持续保持任务的能力。
腾讯论文提出 SkillAdam,通过让改写 AI 记住过往修复并避免大幅重写,实现智能体技能指令的自动优化。在长程购物与旅行规划任务上,其平均准确率达 28.3%,优于此前最佳方法 SkillOpt 的 21.7%,且 token 消耗约为后者的三分之一。该方法旨在解决自动改写技能时反复循环、浪费 token 的问题。
Google 发布论文 Cogentic,用多智能体编排让 Gemini 在 5 个未解数学问题上找到新证明,经人类专家逐一确认。系统由多个 Agent 并行尝试不同思路,审查者默认每步有错直到被证明,已证明的中间结果留存到下一轮,多数问题约 100 次模型调用完成。论文地址 arxiv.org/abs/2609.40324。
ScienceBuddy 通过交替改写提示词与技能、重训模型,将科学智能体准确率从 42.2% 提升至 73.3%。在生物学任务上,仅改提示词与技能就让 4B 小模型准确率从 31.1% 升至 51.1%;仅重训则把 4 次内解题比例从 48.3% 提升到 67.8%。该方法把用户纠错转为评分测试任务,避免修正随对话消失。