Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。
Cloudflare 推出基于 Qwen 的开源多模态决策模型 Clef,包含 Clef 与 Clef-flash 两款。两者分别基于 Qwen3.8-27B 和 Qwen3.5-9B,在 Jev 决策指数(Decision Index 0.2.1)评测中 Clef 处于领先地位,且完全兼容 Jev-API。
Google 发布新一代前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。
SECRET(SourcE-Conditioned RElay sTeering)是一种免训练方法,在 question relay 处抑制跨模态干扰,缓解音视频大语言模型(AVLLM)的源混淆 grounding 幻觉。
一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为实时对话模型加入能听、能看、能说的可视化形象,现已在 Gemini Enterprise 提供。
Sarvam Vision 2.1 在 olmOCR-Bench 总体得分 87.3,OmniDocBench v1.6 总体得分 94.97,并新增复杂多页表格结构化抽取、表单 KV 抽取与 Indic 手写识别能力。该模型沿用 harness-with-VLM 架构,在监督微调后进行 RLVR 后训练,缓解了此前的幻觉与不一致问题。团队同时优化推理栈,使 API 定价低于发布时,面向生产负载。
阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。
Sierra 的多模态智能体将语音、文本和视觉融入同一对话,并能按场景自动切换模式,无需用户重来或重复说明。智能体一次构建即可跨所有渠道部署,Sierra 的 MCP UI 集成可把产品卡、比较表、日历和表单等交互组件直接带入对话,组件由团队设计并托管且更新无需重新部署。组件需要更多空间时可展开至全屏,显示日历、长比较表和多步表单。
Google Search 提供 5 种家居装饰用法:AI Mode 可上传房间照片、生成沙发等家具在房间中的效果图,Lens 拍照查找同款复古家具,Circle to Search 圈选屏幕画面找相似装饰,Search Live 逐步指导 DIY 安装,商品列表可展开价格历史并开启 Track price 降价提醒。
Google 在搜索中推出 5 项面向学习的新 AI 工具,包括生成互动可视化与模拟、定制练习题、Lens 分步讲解、AI Mode 笔记本,以及基于上传文件的定制学习文档。
VAST 创始人兼 CEO 宋亚宸在播客对谈中表示,VAST 要先用 3D 基础模型把生产成本降至接近于零,再让普通人无需掌握复杂工具也能创作和分享自己的世界。其核心 3D 创作产品 Tripo AI 可从文字或图片生成 3D 模型,VAST AI Research 发布的世界模型研究预览 Project Eden 则
OpenRouter 给出通过 API 向 LLM 发送图像的标准写法:向 POST /api/v1/chat/completions 发送 messages 数组,用户消息的 content 由 text 和 image_url 两个 part 组成,文本 part 需放在前面。
Moonshot 发布 2.8 万亿参数多模态模型 Kimi K3,具备 1M token 上下文窗口和原生视觉能力,Modal 在发布当天以 460 tokens/s 提供推理。
Thinking Machines 发布通用多模态模型 Inkling,可输入文本、图像和音频并输出文本,Modal 以 Day 0 支持将其作为按 token 计费的 Managed Endpoint 上线。