跳到正文

#多模态

今日 0 条
10月2日周五
  1. TechCrunch · AI59

    Google 发布 Gemini 4 Argon,称其为迄今最强模型

    Google 发布 Gemini 4 Argon,称其可处理编程、研究和写作等任务,目前仅通过 Fairwind Program 向部分网络安全合作伙伴开放。该模型专门针对防御性网络安全训练,Google 称它能自主发现、验证并修复关键软件漏洞,自家员工已用它做调试和代码库迁移,还可解析长视频和图表。

10月1日周四
9月29日周二
9月28日周一
  1. HuggingFace Daily Papers32

    音视频联合与跨模态生成及编辑:统一形式化与设计分类法综述

    一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。

9月25日周五
9月24日周四
  1. Sarvam AI50

    Sarvam Vision 2.1:拓展文档智能的帕累托前沿

    Sarvam Vision 2.1 在 olmOCR-Bench 总体得分 87.3,OmniDocBench v1.6 总体得分 94.97,并新增复杂多页表格结构化抽取、表单 KV 抽取与 Indic 手写识别能力。该模型沿用 harness-with-VLM 架构,在监督微调后进行 RLVR 后训练,缓解了此前的幻觉与不一致问题。团队同时优化推理栈,使 API 定价低于发布时,面向生产负载。

9月22日周二
  1. elsewhere56

    阶跃 Step 5 Preview 实测:金融数据能力突出,长思考与美术资产偏弱

    阶跃发布 Step 5 Preview,总参数量 600B、激活参数 27B,支持视觉输入,官方称单任务成本仅为 Claude Opus 5 的 1/8,并称其在 Artificial Analysis 上进入全球开源前三。第三方实测显示,它在利润表桑基图、金融数据获取与交叉验证上表现较好,但在冷门基准、泛化性以及寻找和制作美术资产上偏弱,且思考过程偏长会让长任务耗时明显增加。

9月11日周五
  1. Sierra Blog39

    Sierra 下一代多模态智能体:随对话变形的界面

    Sierra 的多模态智能体将语音、文本和视觉融入同一对话,并能按场景自动切换模式,无需用户重来或重复说明。智能体一次构建即可跨所有渠道部署,Sierra 的 MCP UI 集成可把产品卡、比较表、日历和表单等交互组件直接带入对话,组件由团队设计并托管且更新无需重新部署。组件需要更多空间时可展开至全屏,显示日历、长比较表和多步表单。

8月26日周三
  1. Google Blog · AI29

    用 Google Search 升级家居装饰的 5 种方式

    Google Search 提供 5 种家居装饰用法:AI Mode 可上传房间照片、生成沙发等家具在房间中的效果图,Lens 拍照查找同款复古家具,Circle to Search 圈选屏幕画面找相似装饰,Search Live 逐步指导 DIY 安装,商品列表可展开价格历史并开启 Track price 降价提醒。

8月20日周四
8月14日周五
7月27日周一
7月15日周三