Black Forest Labs 发布 Flux 3 Image,支持多步局部编辑
Black Forest Labs 发布 Flux 3 家族的图像模型 Flux 3 Image,支持多步编辑且不改动画面其余部分,覆盖文生图、图生图、文字渲染和写实生成。
Black Forest Labs 发布 Flux 3 家族的图像模型 Flux 3 Image,支持多步编辑且不改动画面其余部分,覆盖文生图、图生图、文字渲染和写实生成。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款。两者分别基于 Qwen3.8-27B 和 Qwen3.5-9B,在 Jev 决策指数(Decision Index 0.2.1)评测中 Clef 处于领先地位,且完全兼容 Jev-API。
Ideogram 称新模型 Ideogram 4.5 只修改用户指定区域,其余部分保持不变,主打产品摄影、室内设计、照片修复和图内文字编辑。该模型提供 0.8 至 22 美分四档单图价格,均为原生 2K 分辨率,现已在 Ideogram 平台和 API 上线。合作方包括 Picsart、Runway、Pika 和 Leonardo AI,Ideogram 还表示将很快推出开放权重版本。
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。
Google 宣布推出 Gemini 4 Argon 模型,该模型仍处于有限测试阶段,公司内部工程师已在大规模使用,外部用户暂时无法访问。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
Claude Sonnet 5.5 发布,是 Claude 5.5 家族继 Opus 5.5 之后的第二个模型,比 Sonnet 5 更智能、更高效且快 30%,每 token 价格不变。
推荐理由:官方给出定价、默认 effort 与六项迁移改动,便于判断从 Sonnet 5 切换的成本。
H 公司发布 Holo4 系列通用计算机操作智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,已上线 H Models API,并在 Hugging Face 开放 BF16、FP8、NVFP4 和 4-bit GGUF 权重。
推荐理由:Holo4 给出与前沿闭源模型在 OSWorld 2.0 上的分数和成本对比,并公开全部评测轨迹,便于判断通用计算机操作智能体的性价比。
Sarvam Vision 2.1 在 olmOCR-Bench 总体得分 87.3,OmniDocBench v1.6 总体得分 94.97,并新增复杂多页表格结构化抽取、表单 KV 抽取与 Indic 手写识别能力。该模型沿用 harness-with-VLM 架构,在监督微调后进行 RLVR 后训练,缓解了此前的幻觉与不一致问题。团队同时优化推理栈,使 API 定价低于发布时,面向生产负载。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
Sarvam AI 发布新一代语音识别模型 Saaras V4,采用音频编码器加自研 3B 混合状态空间 LLM 解码器,同一模型可输出 transcribe、translate、verbatim、translit、codemix 五种转写格式。
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Thinking Machines 发布通用多模态模型 Inkling,可输入文本、图像和音频并输出文本,Modal 以 Day 0 支持将其作为按 token 计费的 Managed Endpoint 上线。
OpenRouter 上线 OpenAI 的 GPT-5,称其支持 400,000 token 上下文窗口和最高 128,000 输出 token,思考模式下幻觉较 o3 减少约 80%。
推荐理由:给出 GPT-5 三档变体定价与 SWE-Bench Verified 得分,可对照 Claude Sonnet-4 等模型横向比较。
OpenRouter 公布新隐身模型 Cypher Alpha。页面正文目前仅包含 newsletter 订阅说明,未披露模型规模、上下文长度或开放时间等任何参数与可用性信息。