Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样
Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,且不改动生成器与 harness。
Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,且不改动生成器与 harness。
研究者推出 OSWorld-Science,一个面向科学软件计算机操作智能体的基准与评测环境,包含 146 个高质量任务,覆盖分子绘制与逆合成、病理图像分析、统计计算和物理仿真等流程。
LEAP 将长录音切分为固定时长区块,用轻量定位阶段为每个区块的候选窗口打分,再把排名最高的窗口汇聚到一次有界回答阶段重新编码,使回答输入与峰值上下文不随录音时长增长。
系统研究考察 LLM 条件化在概念注入与移除中的有效性与流畅性权衡,发现高效 steering 方法常以显著牺牲流畅性为代价。activation steering 在指令微调模型上远不如基座模型有效;简单 prompting 与完整 supervised fine-tuning 适合概念注入,但不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关,可揭示条件化方法行为。
针对 RL 后训练中已解出问题回答变得冗长的"长度缩放税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
研究提出 Speaker Identified cpWER(SI-cpWER),在统一全局说话人 ID 分配下评测跨会议的持久说话人归属,覆盖 5 个商业 diarize-then-identify 级联、2 个开放学术基线和 ThyVoice。
Factory 宣布 Automations 正式向所有用户开放,用自然语言描述工作流后,Droid 可按定时或 Slack、GitHub、webhook 触发运行,支持自选模型(含 BYOK 和 Factory Router)与自选机器。
推荐理由:官方宣布 Automations 正式开放,给出具体用例、模型自选与企业使用数据,可以了解定时与事件触发的 Agent 工作流怎么落地。
研究团队提出 Architect-Ant,用可编辑的坐标 DSL 表示布局,先经监督微调学习专业布置模式,再用 GRPO 结合 Layout Rule Score(LRS)优化几何与功能约束。同时发布 AntPlan 数据集,含 505 份真实专业户型图、92 个物体类别和十类住宅房间的密集家具标注。实验显示其几何违规率低、功能完整度高,布局可逐物体编辑并转换为 3D 场景。
研究者提出 Align Then Reason(ATR),一种多语言唇形同步评判模型,先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于该对齐进行推理判断。
研究提出 Loop Scaling Laws,首次将循环结构与 MoE 稀疏性同模型规模、数据量一起联合建模,可更准确预测循环模型的留出损失,并将标准稠密与 MoE 缩放定律作为特例涵盖。实验显示稀疏性带来约 3 倍活跃参数效率,循环在推理任务上带来约 2 倍总参数效率;在万亿 token 规模、相同训练算力下,循环 MoE 在推理基准上可匹配约 2 倍大的非循环 MoE。
EvoDuet 是一种双层优化方法,在模型参数固定的前提下让解与搜索查询协同进化,每轮由检索门控让 LLM 判断知识缺口,决定检索新文档、复用已有文档或不检索。
Preferred Networks 对 308 名 2027 届求职者调查显示,实际用过 AI 面接的学生中 51.0% 对选考结果感到纳得,比未受检者预期的 31.0% 高出 20 个百分点。整体 44.5% 的求职者感受到"面接官ガチャ",在面试过 6 家以上企业的学生中这一比例达 60.3%。受检者中仍有 40.7% 表示不纳得,理由包括被重复提问、话说到一半就被切换下一题。
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
PatchHolmes 是一个两阶段补丁检索系统,用混合检索器加智能体二阶段检查循环,在 GitHubAD 上比逐点二分类器 Favia 的 Recall@1 高 25.34%,比 IRCoT 高 31.40%,且每个 CVE 只需一次智能体对话(Favia 为十次)。
OpenAI 在 9 月 30 日凌晨开发者活动日推出 GPT-6.1 Sol 模型,性能接近 Astra,费用仅为 Astra 的五分之一。华为宣布 Mate 90 系列将于 10 月 1 日 10:00 发布、当日 12:08 开售,线下门店已展出真机。123 云盘就空间规则调整致歉,支持受影响用户退款,优化方案力争 2026 年 11 月前上线。
模型越来越聪明。但 harness 并不会消失。 相反,它的职责从替模型做决定,转变为给模型提供选项。 在 Replit Agent 中,主智能体决定何时更深入地思考、何时把工作交给子智能体,以及该子智能体应投入多少精力。
DevDay 上最让我印象深刻的是 @thsottiaux 点名了 @pidotdev。 这与 OpenAI 看起来认真构建更开放生态的态度完全一致。而且不只是说说而已,这里有一个巨大的机会,成为所有人都在其上构建的平台。从刚入门的人到世界顶级构建者。说白了,这背后是一个长期愿景。 在人人都在构建的世界里,这很合理。
当地时间周二,OpenAI 发布可全天候持续运行的 AI 智能体 Dots,配有圆滚滚的卡通形象。dot.com 域名归属马斯克旗下 xAI,7 月完成过户后跳转至 Grok 应用下载页;xAI 并未持有 bot.com、vot.com 等错写域名,dots.com 归一家已停业的老公司所有,收购动机尚无定论。
美国政府周二上线由 Google 和 SpaceXAI 参与构建的公共 AI 聊天机器人 America.gov,目前较难被越狱。当被问及 Minecraft 时,它会输出约 1800 字的独白,实为对 Julian Gough 所写游戏结束诗 End Poem 的改写,并非模型幻觉;特朗普曾在演讲中称 20 岁程序员 Edward Coristine 是项目的主工程师之一。
据彭博社报道,OpenAI 正与投资方磋商,计划在 IPO 前完成一轮至少 300 亿美元的过渡轮融资,对应企业估值约 1.4 万亿美元。
美国总统特朗普与 OpenAI、Anthropic、Meta、谷歌、英伟达等企业高管会谈后,发布 AI 自愿性行业协议,各企业同意聘请独立审计机构评估 AI 系统是否符合设计初衷,并承诺防止 AI 工具以非预期方式入侵其他技术系统。
据《商业内幕》报道,OpenAI CEO 奥尔特曼在旧金山开发者大会上公布争取商业主导地位的三步规划,依次是模型、构建和分发。具体包括提供最优模型、把内部工具开放给开发者(如云端 Codex、面向智能体和快速决策的 API),最终打造连接企业的市场平台;OpenAI 同日披露 ChatGPT 每周用户已超过 12 亿,并推出可用于合作产品的承诺支出机制和 Sign in with ChatGPT。
想了解所有内容吗? https://openai.com/index/devday-2026-recap
OpenAI 推出 ChatGPT 的 Plugin extensions(插件扩展),可用于构建交互面板、文件查看器和侧边栏主页。插件提审时会获得更清晰的反馈;借助对提议中的 MCP Events 规范的支持,已连接应用中的事件可以在 ChatGPT 中启动自动化。文档见 https://developers.openai.com/plugins/build/extensions。
OpenAI 介绍可在 ChatGPT Work 或 Codex 桌面应用中打开 Pull Request,查看 diff 并就改动向 Codex 提问。在分享自己的改动前,也可先让 Codex 给出反馈,文档见 https://learn.chatgpt.com/docs/code-review?surface=app。
OpenAI 开发者账号宣布 Codex CLI 完成一次大版本焕新,带来语音聊天、跟踪智能体进度以及管理并行工作等新能力。新界面采用全屏设计,提升可读性,全部功能都在终端内完成,详情见 https://learn.chatgpt.com/docs/codex/cli。
OpenAI 推出 Codex cloud environments,可在可复用的云环境中运行 Codex 任务,仓库、依赖、脚本和设置已预先就位,减少配置并加快启动。用户合上电脑后智能体继续运行,可通过手机或另一台电脑跟进进度并调整任务,文档见 https://learn.chatgpt.com/docs/cloud。
推荐理由:原文给出 Codex 云环境的复用机制和跨设备跟进入口,读者可据此判断能否让任务在合上电脑后继续运行。
OpenAI 发布 GPT-6.1 Sol,称其在编码、computer use 和跨应用工作流中表现强劲,价格低于 GPT-6 Astra。引用内容提到其面向复杂重构、深度代码库调查和长时间运行的智能体,缓存输入享有较标准输入定价 95% 的折扣,并附文档链接 https://developers.openai.com/api/docs/models/gpt-6.1-sol。
OpenAI 在 Codex 中推出 Ultrafast 模式,宣称比 Astra Standard 最高快 8x、比 Astra Fast 快 4x,用于加快代码生成和迭代。文档见 https://developers.openai.com/api/docs/guides/ultrafast-mode。
更快写代码、审查变更,让并行工作持续推进。 🧵 以下是 OpenAI DevDay 所有开发者更新的汇总:
OpenAI 开发者日发布 GPT-6.1 Sol、Codex Cloud、新 Codex CLI、插件扩展、Space、Dots 常驻智能体、Decision API 和带 Computer Use 的 Agents API,新设 500 刀档位用量为 Plus 的 25 倍,并把原 Pro 档从 Plus 的 20 倍降至 10 倍。
Arena 宣布 Anthropic 的 Claude Sonnet 5.5 将于 9 月 30 日太平洋时间早 8 点起限时开放测试。上线后用户可在 Direct Mode 下拉菜单中选中它,Claude Sonnet 5.5 (High) 在 Direct Mode 可用 48 小时,之后将继续保留在 Battle 和 Agent Mode 中。
特朗普在 Truth Social 宣布“超级智能”白宫协议,Google、OpenAI、Anthropic、Meta、xAI 和 Nvidia 高管签署。协议要求各公司落实四层保障:建立前沿模型安全内部控制、配备内部团队、聘请外部审计、设立董事会委员会监督。Zuckerberg 表示董事会将独立审阅审计报告;协议被描述为“道德约束力”,靠自律和同行监督执行,文件称后续可能转为法律法规。
特斯拉 FSD(监督版)获克罗地亚批准,成为第八个允许该功能落地的欧洲国家,很快将开始推送。获批依托荷兰车辆管理局(RDW)今年春季搭建的监管豁免框架;欧盟全域投票已从 10 月 6 日推迟至最早 12 月举行,特斯拉需争取至少 15 国合格多数支持,瑞典和法国对此表达过反对,爱尔兰和意大利的审批磋商也在推进。目前 FSD(监督版)全球已启用市场达 16 个。
很多关于 AI 的宣传(来自其支持者)热情地把它描述成一种毁灭,甚至是彻底抹除:“AI 刚刚杀死了 XYZ”——“XYZ 完蛋了”(现实中,这几乎从来都不准确) 普通人对 AI 的认知,很大程度上正是被这类说法塑造的。反弹不可避免。
特斯拉签署总额 300 亿美元的信贷协议,其中包含 200 亿美元可延后支取定期贷款额度、80 亿美元五年期循环信贷额度和 20 亿美元 364 天期循环信贷额度。
苹果 9 月 29 日更新支持文档,为 iOS 27、iPadOS 27、macOS 27 等系统的快捷指令应用改进和新增 35 多项操作。其中“使用模型”指令可调用增强版 Apple 智能模型,并能通过网络获取最新信息;此外新增信息、提醒事项、VPN、照片等操作,编辑器支持用自然语言创建快捷指令,自动化功能可直接集成并在设备间同步。
你有没有试过跟 Claude 说“我们有能力做任何事,请更勇敢一点” 还有,你有没有试过跟自己这么说
Artificial Analysis 在首尔举办韩国首场活动,聚集业界开发者与研究者探讨 AI 未来。
彭博社马克·古尔曼 9 月 29 日爆料,苹果因 AI 智能体可接管部分售后任务,曾于 2026 年夏季拟裁减约 5000 个 AppleCare 客服岗位,目前已无限期搁置,不再考虑该措施。