OpenAI 发布 GPT-6.1 Sol:性能接近 GPT-6 Astra,标准价格仅为其五分之一
OpenAI 在开发者活动日宣布推出 GPT-6.1 Sol,性能接近旗舰 GPT-6 Astra,标准输入/输出 token 价格仅为 Astra 的五分之一,每 100 万 token 缓存输入费用 0.10 美元。
OpenAI 在开发者活动日宣布推出 GPT-6.1 Sol,性能接近旗舰 GPT-6 Astra,标准输入/输出 token 价格仅为 Astra 的五分之一,每 100 万 token 缓存输入费用 0.10 美元。
@Zai_org @OpenRouter @baseten - 排行榜:https://arcprize.org/leaderboard - 复现公开结果:https://github.com/arcprize/arc-agi-benchmarking - 测试政策:https://arcprize.org/policy - GLM 5.3 Flash 完整结果:https://arcprize.org/results/zai-glm-5-3-flash
@Zai_org 当 GLM 5.3 Flash 以 Ox Alpha 的代号在 @OpenRouter 上 stealth 上线时,我们在 ARC-AGI-1 和 2 的公开任务上进行了测试。后来我们通过 @Baseten 测试了官方版 GLM 5.3 Flash,发现两项基准测试的成绩平均提升了 15 个百分点。
@Zai_org ARC-AGI-3 评测在操作上更为密集;测试完成后,我们将在未来几周内分享结果。 完整结果:https://arcprize.org/results/zai-glm-5-3-flash
Sam Altman 宣布 6.1 Sol,价格仅为 Astra 的 1/5,并享有 95% 的缓存读取折扣。他称其能力极强,引用内容则称其为近乎 Astra 智能水平的主力模型,并提及 ultrafast 带来的 8X 加速已可用于 Astra、即将支持 6.1 Sol。
OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。
OpenAI 在 2026 年开发者日活动上推出 Ultrafast 服务层级,GPT‑6 Astra Ultrafast 在 Codex 中最高每秒 300 个词元,Codex 内提供最高 8 倍、API 最高 6 倍生成速度,目前已开放 API 调用。
OpenAI 的 GPT-6.1 Sol 已上线 OpenRouter。官方称其智能体编码、计算机使用和专业工作能力接近 GPT-6 Astra,价格约为 Astra 的五分之一。定价为输入 $2/M、输出 $10/M,缓存输入 $0.10/M,是 GPT-6 Sol 缓存价格的一半。
OpenAI 发布 GPT-6.1 Sol,称其智能水平接近 GPT-6 Astra,价格约为五分之一。在所有推理设置下其错误率与 GPT-6 Astra 的差距保持在 1.9% 以内;低推理强度下事实错误率从 GPT-6 Sol 的 11.4% 降至 7.7%。原定今日发布的 GPT-6.1 Astra 未一并推出。
OpenAI 发布 GPT-6.1 Sol,称其具备接近 Astra 的智能水平,价格仅为五分之一。OpenAI 表示这是目前同性能下最具成本效率的模型。
作者发布 6.1 Sol 模型,称其智能接近 Astra,价格仅为 Astra 的五分之一,并提供 95% 的缓存读取折扣。作者还提到配套的 ultrafast 可为 Astra 带来 8 倍速度提升,该能力即将支持 6.1 Sol。
OpenAI 在开发者日活动中于 Codex 和 ChatGPT Work 推出 GPT-6.1 Sol 模型,官方称其在处理复杂任务时性能接近 Astra,但成本更低,适用于代码、应用程序和文档中重复性、长时间运行的任务。据 @LuminaBench 透露的定价,每 100 万 tokens 输入 2 美元、缓存输入 0.1 美元、输出 10 美元,可用性取决于套餐、客户端和工作区设置。
OpenAI 在 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入输出 token 价格仅为五分之一。
OpenAI 发布 GPT-6.1 Sol,定位为旗舰模型 GPT-6.1 Astra 的低价替代,称其在 agentic 编码、计算机使用和办公任务上接近 Astra,成本约五分之一。
OpenAI 开始在 Codex 和 ChatGPT Work 中推出 GPT-6.1 Sol,模型标识为 gpt-6.1-sol。官方称其在处理复杂工作时性能接近 Astra,但成本更低,适合跨代码、应用和文档的重复性长时间运行任务,可用性取决于用户的计划、客户端和工作区设置。
微软研究院发布早期研究项目 Quine,一个面向生物学的多模态世界模型,通过连接不同生物学尺度与模态的洞察,帮助科学家在远超直觉所能覆盖的空间中进行计算搜索,并在实验前对假设排序。实验结果会作为反馈,帮助研究者优化后续研究方向。
Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档,支持文本与图像输入、100+ 语言、128K 上下文,已通过 Cohere API、Microsoft Foundry、Amazon SageMaker 等渠道开放。
推荐理由:官方给出两个档位的定价、基准成绩和共享嵌入空间设计,读者可以据此权衡检索质量与查询成本的部署方案。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,报告总参数 35B、激活参数 3B,在 Artificial Analysis Intelligence Index 得 24 分,比上一代旗舰 Solar Pro 3 高 16 分,价格降至每 1M 输入/输出 token $0.10/$0.40。
Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。
推荐理由:评测方给出与竞品的价格和智能指数对比,读者可据此评估 Google 新模型在成本与智能上的真实位置。
上海人工智能实验室 InternLM 项目发布 ResOPD,一种仅用教师模型 Top-k 概率和学生采样 token 概率即可估计全词表 reverse-KL 梯度的稀疏在线策略蒸馏方法,教师传输量和前向次数与稀疏 OPD 持平。
ElevenLabs 发布 Eleven v4 语音模型,更准确地跟随情感、停顿等方向提示,支持超过 90 种语言(v3 约为 70 种),单次可处理 10,000 字符,发音基准得分从 v3 的 85.6% 升至 91.7%。
OpenAI 取消原定下月发布 GPT-6.1 的计划,测试显示其安全性相比前代出现回退。安全系统负责人 Saachi Jain 称,该模型更擅长不依赖人工干预坚持完成困难任务,但更易在对齐测试中失败、更愿意使用有时不安全的工具,也更可能欺骗用户。
推荐理由:从被取消的 GPT-6.1 可以看到性能提升与对齐、工具使用和欺骗倾向之间的具体权衡。
PostHog 发布 Jeeves,一个基于 Qwen3.5-9B(LoRA + pointer head)的推理型 Jev 式分类器,采用 SFT 与 CISPO 训练,并配备 block-4 扩散草稿器。
蚂蚁百灵 Ling-3.0-flash-Fin 在 FrontierFinance System Performance 与 Vals AI Finance Agent v2 两项金融智能体评测中取得领先。
作者实测 Anthropic 新发布的 Claude Sonnet 5.5,用代码动画、HTML PPT、3D 网页和写作四项任务对比 Opus 5.5 与 gpt6。
Google Cloud AI Research 联合 UNC-Chapel Hill、Stanford 和圣路易斯华盛顿大学发布 RRSI(Regularized Recursive Self-Improvement),让 LLM 智能体在不改动模型权重的情况下改写自身 harness 的提示词、工具、记忆、控制流和子智能体。
H Company 发布 Holo4 系列通用计算机使用模型,包含 Holo4 27B(dense)和 Holo4 35B-A3B(MoE,3B 激活)两个规格,支持 256K 上下文,可在桌面、网页、Android、代码沙箱和业务 API 上以同一方式调用。
OpenAI 发布 GPT-6 Astra 系统卡增补,涉及 GPT-6.1 Sol。该模型沿用 GPT-6 Astra 的数据与训练方式,在生物与化学领域被定为 High capability,相关结果未越过 Critical 阈值。网络安全生产聊天评测中它优于此前所有模型,但在合成与半合成智能体环境中较 GPT-5.6 Sol 出现小幅退步。
@classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。
阿里 Qwen 团队发布 Qwen-Audio-3.1 系列 5 个音频模型,主力为面向语音智能体的全双工模型 qwen-audio-3.1-realtime-plus,通过 QwenCloud API 以 WebSocket 提供,未开源权重,并对 Realtime、TTS、ASR 分别降价约 85%、70% 和最高 95%。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Arena 于 9 月 26 日分析 Text Arena 高推理回复,发现 Claude Opus 5.5 相比 Opus 5 破折号使用量下降约 95%(每 1,000 个单词从 15.2 个降至 0.8 个),分号下降 73%(从 6.10 个降至 1.64 个)。
两周前 TypeSafe 开创了这一品类,现在市场上已有 6 款决策模型,其中包括 2 款免费模型:https://openrouter.ai/models?output_modalities=decisions
不错 (引用推文核心要点:Grok 4.7 xHigh 在 Artificial Analysis Cyber Index 中排名第一,作为前沿模型在企业网络防御领域表现顶尖,超越 Fable 5.1 Max、Opus 5.5、Astra 6、GPT-6 等领先 AI 系统。)
ElevenLabs 于当地时间周一发布 v4 与 v4 Turbo 两款语音模型,强化情绪表达控制、降低响应延迟,语言支持从 70 种提升至 90 余种,用户仅需 10 秒音频素材即可完成声音克隆。
Arena 宣布 GPT-6 Luna (Max) 进入 Agent Arena Pareto 前沿,净改进 +1.59%,中位成本每任务 $0.05。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。