Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 宣布推出 Gemini 4 Argon 模型,该模型仍处于有限测试阶段,公司内部工程师已在大规模使用,外部用户暂时无法访问。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
Claude Sonnet 5.5 发布,是 Claude 5.5 家族继 Opus 5.5 之后的第二个模型,比 Sonnet 5 更智能、更高效且快 30%,每 token 价格不变。
推荐理由:官方给出定价、默认 effort 与六项迁移改动,便于判断从 Sonnet 5 切换的成本。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
Google 推出 Fairwind Program 限定访问计划,向政府机构、Google Cloud 客户及网络安全合作伙伴开放其最先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 与 CodeMender harness 结合,可自主发现、验证并修复漏洞,把原本需数周的手动修复变为几分钟内生成可部署补丁,且运行成本远低于传统前沿模型。
Factory 用自托管 LangSmith 自动化反馈闭环,把提示词迭代速度提升 2 倍。LangSmith 的 Feedback API 将反馈附加到工作流各阶段并导出为数据集,traces 则导出至 AWS CloudWatch 日志,用于追踪 LLM 数据流和定位上下文相关问题。
Addy Osmani 在 The Pragmatic Engineer 播客中讲述自己从 16 岁自建浏览器到 Google 工程总监的路径:在 Google 超过 14 年,先后参与 Chrome、DevTools、Core Web Vitals,最近负责 AI 开发者体验。
Hamel Husain 汇总了其在 AI 产品工程与评估方向的长期写作,最新一篇为 9/30/26 的《Claude 新 auto eval 工具》。他联合教授 AI Evals for Engineers and PMs 课程,已有来自 500+ 公司的 5,000 多名学生,包括 OpenAI、Anthropic 和 Google。
OpenRouter 上线 OpenAI 的 GPT-5,称其支持 400,000 token 上下文窗口和最高 128,000 输出 token,思考模式下幻觉较 o3 减少约 80%。
推荐理由:给出 GPT-5 三档变体定价与 SWE-Bench Verified 得分,可对照 Claude Sonnet-4 等模型横向比较。