GPT-6.1 Sol 在 ARC-AGI-3 高推理更省成本
GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。
GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。
ARC Prize 发文称,在 ARC-AGI-2 上 GPT-6.1 Sol 的最佳成绩为 94.2%,与 GPT-6 Astra 的 95.0% 相当,且成本低 77%。完整结果见 https://arcprize.org/results/openai-gpt-6-1-sol。
Google 宣布推出 Gemini 4 Argon 模型,该模型仍处于有限测试阶段,公司内部工程师已在大规模使用,外部用户暂时无法访问。
Google 发布 Gemini 4 Argon 前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络防御的复杂工作流,DeepSWE v1.1 得分 77.9% 为新 SOTA。作者称其在多项基准上优于 GPT-6 Astra、Claude Opus 5.5 和 Claude Fable 5.1,即将首先向付费 API 客户和 Google AI Ultra 订阅用户推出。Sundar Pichai 称该模型在复杂工作流、网络防御和软件工程方面表现出前沿性能,团队已在 Google 内部从编码到量子计算广泛使用。
以下是 Gemini 4 Argon 的基准测试预览。 今天开始向网络防御者推出,并尽快向所有人开放。 很高兴看到所有进展,迫不及待想让大家都用上!
了解更多 ↓ https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Google AI 发布新前沿模型 Gemini 4 Argon,面向长程复杂工作流的深度推理,覆盖软件工程、法务与金融等企业知识工作及网络安全防御。模型输出 token 上限扩展至 1M,目前在 Fairwind Program 中向部分可信网络防御者推送,后续将尽快开放更广泛使用。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向部分可信网络防御者开放,后续再向开发者、企业和消费者推出,起售价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入价格低至输入价的 95% 折扣。
Gemini 4 Argon 正通过我们的 Fairwind Program 向首批网络安全防御者推出,让他们能够利用其完整的前沿级网络安全防御能力。 我们将继续收集早期测试者的反馈,同时迭代护栏机制,以便尽快将 Argon 提供给开发者、企业和消费者。 了解更多 ↓ http://goo.gle/4AFGGh1
Google 发布 Gemini 4 Argon 模型,主打真实世界软件工程、知识工作和网络安全防御等复杂工作流的前沿性能。该模型提供业界领先的 1M token 输出上限。
推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者开放。
Sundar Pichai 表示 Argon 具备前沿安全防护并采取负责任的 rollout,模型已交付美国政府,并通过 Fairwind Program 提供给一组受信任的网络防御者。他称会尽快且尽可能安全地开放可用,之后将快速迭代。
外面有很多关于我们下一个模型的讨论(!),所以我想尽快给大家一个提前预览。介绍 Gemini 4 Argon! 它在复杂工作流、网络防御和软件工程方面展现出前沿性能。Google 内部团队正在广泛使用它,从编程到量子计算,反馈很好。 以下是基准测试一览:
Perplexity 开源其上下文嵌入模型,在 turbopuffer 的 context-bench 上表现最佳。被引用内容介绍其新训练方法让每个文档分块在整篇文档语境下编码,pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 的 context-bench 上刷新纪录,详情见 perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage。
我们构建了一种训练上下文嵌入模型的新方法,它能在编码文档的每个片段时,将整篇文档纳入视野。 pplx-embed-v2-context-9b-preview 在 ConTEB 和 @turbopuffer 全新未公开的 context-bench 上创下新的 SOTA。 https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage
Arena 评测榜单显示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格为 $8/MToken。相比 GPT-6 Sol (Max) 同价提升 70 分,排名上升 4 位,且在 Consumer Product 等所有类目均有提升。
推荐理由:评测方公布了 GPT-6.1 Sol (Max) 的排名和价格数据,读者可以据此比较它在成本与性能权衡中的位置。
基于 MiniMax H3,@Creatify_Labs 的 Boreal-H3 是一款专为广告优化的视频模型,在遵循创意简报更准确的同时,保持产品和角色的一致性。 期待看到 MiniMax H3 成为更多面向特定行业的前沿模型的基础!✨
Runway 推出开放权重世界动作模型 Praxis-1,将视频预训练能力转化为机器人真实世界控制,定位为可跨任意具身形态与环境的策略模型。该模型基于其大规模视频预训练与实时基础设施构建,官方称机器人演示数据有限而视频数据无限。Runway 正与 Noble Machines、Standard Bots、Ultra 等早期伙伴测试,并将在未来数月公开权重。
Utopai Studios 发布视频模型 Utopai X,基于 MiniMax H3 后训练,在 Artificial Analysis 文生视频含音频榜单 AA-Video-T2V v2.0 首秀排第 2,仅次于 Wan 3.0,领先 Dreamina Seedance 2.5。
Arena 宣布 Ideogram 4.5 进入 Image Edit Arena 前 20,总排名第 18,得分 1351 分。
认识 Ling-3.1-flash:总参数约 560B,每 token 激活约 25B,上下文窗口最高 1M token。 我们计划很快开源该模型。 在工作、编程与医疗领域:GDPVal-AA v2.1 上 1,673 Elo,FrontierSWE 上 75.16,HealthBench Professional 上 65.35。
Ideogram 发布 Ideogram 4.5 图像模型,主打精准编辑。模型已在 Ideogram、API 及合作服务上可用,原生 2K 分辨率下每张图价格 0.8 至 22 美分,团队还计划尽快发布该模型的开源权重。
极端太空天气事件可能损坏地球电力系统,并降低GPS精度和卫星运行。一个新的机器学习系统能在风暴到达前30-60分钟预测可能发生损害的位置:https://msft.it/6019aYXwh
Astra Ultrafast 🤯 https://openrouter.ai/openai/gpt-6-astra
Nils Reimers 和团队搞出的新模型有点猛。极强的可扩展性、SOTA 准确率,而且一如既往地完全支持私有化部署,并可在 Model Vault 上使用!
哔哩哔哩 Index LLM 团队 9 月 30 日发布基于 Qwen3.5 构建的 Index-Translate 多语言翻译模型家族,2B / 9B / 35B-A3B(preview)权重在 Hugging Face 与 ModelScope 开放。
推出 Cohere Embed 5:我们全新的 SOTA 嵌入模型系列。 用 Embed 5 Pro 获得前沿能力,或用 Embed 5 Fast 获得低延迟性能。
蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。模型围绕通用智能体、搜索、日常办公和软件研发等任务优化,并提升医疗、金融和材料科学研究场景能力。模型开放为期两周的免费体验,期间服务长度为 256K,转付费后计划开放 1M 上下文,届时团队也计划同步开源。
蚂蚁百灵推出 Ling-3.1-flash,总参数约 560B,每个 Token 激活约 25B,上下文窗口上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家)。
推荐理由:官方发布同时给出架构细节、多项长程任务实测结果和对比数据,读者可据此评估其在办公、医疗和软件研发场景的适用性。
Qwen3.8-27B 现已通过 @nebiustf 开放使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳
StepFun 与 ACE Studio 发布 StepAudio 3 Music,可将文本描述和歌词生成完整歌曲,支持歌曲生成、器乐生成、音乐翻唱、人声编排四种工作流,并基于 ABC-COT 先规划音乐结构与编排再合成。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,通过滚动 KV Cache 在 24/7 持续运行下保持内存与延迟恒定。模型每个时钟步输出一个文本 token(12.5/8.3/6.25 次决策/秒),平衡感知粒度与资源开销。HuggingChat 的 ML intern 已搭建 Gradio 工作流供试用。
DeepSeek 于 9 月 30 日通过官方公众号宣布正式开源面向华为昇腾算力平台的基础设施组件,与此前面向英伟达平台的开源组件一一对应,涵盖 TileLang 编译工具、计算库和分布式通信库。
Grok 4.7 在 AA 网络安全指数排名第一
OpenAI 发布 GPT-6.1 Sol,称其在编码、computer use 和跨应用工作流中表现强劲,价格低于 GPT-6 Astra。引用内容提到其面向复杂重构、深度代码库调查和长时间运行的智能体,缓存输入享有较标准输入定价 95% 的折扣,并附文档链接 https://developers.openai.com/api/docs/models/gpt-6.1-sol。
Liquid AI 发布决策模型 d1,专为结构化选择设计,通过 Noul、Choice、Score 三种原语一次调用返回类型化答案和校准概率,output_tokens 为 0。
Dyna Robotics 发布 Dyna-2.1,称其为首个实现可靠超长时程全身自主的 Physical Agent,并搭配全新半人形硬件 Taku。作者转发引用其公开的一小时无剪辑视频:机器人独自运行酒店式洗衣房,装载并启动机器、叠好毛巾并上架,且在别处需要处理时能中断当前动作而不瞬间冻结,这依赖一个并行视觉语言模型监视房间、让 Dyna-2 持续保持手部运作。
Artificial Analysis 发布对 OpenAI 新模型 GPT-6.1 Sol 的评测,其 Intelligence Index 得分仅比 GPT-6 Astra 低 1 分,max effort 下每任务成本 $0.72,不到 GPT-6 Astra($3.26)的四分之一。
Arena 宣布 OpenAI 的 GPT-6.1 现已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。
推荐理由:OpenAI 新模型上架 Agent Arena 和 Code Arena,读者可自行投票并等待基于真实智能体任务的分数。
Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。
推荐理由:原文给出实测榜单名次、分数与价格对比,读者可以据此评估该模型在成本与性能间的实际位置。