Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 宣布推出 Gemini 4 Argon 模型,该模型仍处于有限测试阶段,公司内部工程师已在大规模使用,外部用户暂时无法访问。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
Claude Sonnet 5.5 发布,是 Claude 5.5 家族继 Opus 5.5 之后的第二个模型,比 Sonnet 5 更智能、更高效且快 30%,每 token 价格不变。
推荐理由:官方给出定价、默认 effort 与六项迁移改动,便于判断从 Sonnet 5 切换的成本。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
OpenRouter 上线 OpenAI 的 GPT-5,称其支持 400,000 token 上下文窗口和最高 128,000 输出 token,思考模式下幻觉较 o3 减少约 80%。
推荐理由:给出 GPT-5 三档变体定价与 SWE-Bench Verified 得分,可对照 Claude Sonnet-4 等模型横向比较。