Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款。两者分别基于 Qwen3.8-27B 和 Qwen3.5-9B,在 Jev 决策指数(Decision Index 0.2.1)评测中 Clef 处于领先地位,且完全兼容 Jev-API。
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为实时对话模型加入能听、能看、能说的可视化形象,现已在 Gemini Enterprise 提供。
Sarvam Vision 2.1 在 olmOCR-Bench 总体得分 87.3,OmniDocBench v1.6 总体得分 94.97,并新增复杂多页表格结构化抽取、表单 KV 抽取与 Indic 手写识别能力。该模型沿用 harness-with-VLM 架构,在监督微调后进行 RLVR 后训练,缓解了此前的幻觉与不一致问题。团队同时优化推理栈,使 API 定价低于发布时,面向生产负载。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Thinking Machines 发布通用多模态模型 Inkling,可输入文本、图像和音频并输出文本,Modal 以 Day 0 支持将其作为按 token 计费的 Managed Endpoint 上线。