跳到正文

全部动态

今日 9 条
7月17日周五
  1. 英国 AI Security Institute:Blog(网页)70

    AISI 首次公开评估:领先开源权重模型的网络安全能力落后前沿 4 至 7 个月

    英国 AI Security Institute 首次公开分析领先开源权重模型的网络安全能力差距,测试发现 GLM-5.2 是测试时最强的开源权重模型,在 AISI 窄域网络任务上接近 4 个月前发布的 Opus 4.6,在长时程网络靶场上接近 Opus 4.5,整体落后前沿 4 至 7 个月,窄于 2025 年 1 至 9 月内部评估测得的 6 至 10 个月。

    推荐理由:这是 AISI 首次公开量化开源权重模型与闭源前沿在网络安全能力上的差距,并给出成本对比,为防御方的准备窗口提供依据。

  2. IT之家(RSS)79

    Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

    月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。

    推荐理由:Kimi K3 的 2.8T 参数和 100 万上下文不是数字游戏,前端跑分实打实地压过 Claude Fable 5,七个子领域拿六个第一,这对做前端和长文档处理的人是个明确信号,可以下场试了。

7月16日周四
  1. X:Thinking Machines (@thinkymachines)70

    Thinking Machines 发布多模态模型 Inkling

    今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵

    推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

7月15日周三
  1. X:腾讯混元 (@TencentHunyuan)69

    腾讯混元发布 Hy3 1-bit 与 4-bit 版本

    找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF 我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀 迫不及待想看到你们的作品。 #Hy3 #Hy #GGUF #llamacpp

    推荐理由:混元把295B旗舰模型压进单GPU,1-bit和4-bit版本对本地部署是个大礼包,开源社区可以动起来了。

  2. 公众号:通义实验室(千问)78

    Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?

    阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。

    推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

  3. 公众号:通义实验室(千问)73

    阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

    阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。

    推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。

  4. Together AI 研究与产品博客(RSS)76

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 提供 Day 0 推理服务

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 于发布当日在其 Serverless 平台提供访问,支持 1M 上下文窗口和 OpenAI 兼容 API。

    推荐理由:原文来自提供推理服务的合作方,给出了 Inkling 的架构细节、参数规格和初步评测,读者可据此了解新模型的技术取向与可用入口。

  5. Hacker News 热门(buzzing.cc 中文翻译)76

    Bonsai 27B:首款可在手机上运行的27B级多模态模型

    Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

    推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。

  6. Google Developers Blog(RSS)58

    Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

    在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

    推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二
  1. Google AI:DEV 作者专属(RSS)68

    DiffusionGemma 发布:文本扩散模型实现 4 倍加速推理

    Google 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成 256 token 块,推理速度最高提升 4 倍。该 26B MoE 模型仅激活 3.8B 参数,量化后适配 18GB VRAM 消费级 GPU,在单张 H100 上达 1000+ tokens/s。

    推荐理由:Google把扩散模型首次做进大语言模型,生文速度提升4倍,还开源了权重。虽然实验性质量打折,但本地实时交互的开发者终于有个新选项可以玩了。

  2. X:Sam Altman (@sama)70

    GPT-5.6 sol 价格减半 token 效率翻倍

    GPT-5.6 sol 价格减半,且在多数情况下完成相同任务时 token 效率约为 fable 的两倍。 很高兴能以四分之一的价格交付。

    推荐理由:OpenAI把GPT-5.6 sol的价格压到fable的四分之一,token效率翻倍,对大批量调用场景的成本优化很实在,做API集成的可以重点关注。

  3. Inception Labs:Blog(网页)67

    Inception Labs 发布 Mercury 2:首个在 NVIDIA GPU 上每秒解码超 1000 token 的推理扩散语言模型

    Inception Labs 发布 Mercury 2,称其为全球首个推理扩散语言模型(dLLM),在 NVIDIA H100 上以 1000+ token/秒并行解码,300 token 的推理链可在约 300ms 内完成,适配语音对话延迟预算。

    推荐理由:官方给出扩散架构推理模型在 NVIDIA GPU 上的延迟与定价数据,语音 Agent 开发者可以据此评估是否能替换现有默认模型。

  4. X:商汤 SenseTime (@SenseTime_AI)74

    商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

    商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

    推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

  5. HuggingFace Daily Papers(社区热门论文)74

    Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

    Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

    推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

  6. Moonshot AI:Kimi Blog81

    Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

    月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

    推荐理由:首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

7月13日周一
  1. The Decoder:AI News(RSS)70

    德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

    德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。

    推荐理由:德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。

  2. 公众号:腾讯混元78

    腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍

    腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

    推荐理由:轻量端到端OCR的实用化一步,投机解码让长文档生成加速可落地,智能体数据闭环提示了用短板驱动自进化的可复用路径。

  3. 公众号:腾讯混元76

    腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

    腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

    推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月12日周日
  1. X:Sam Altman (@sama)68

    OpenAI 发布 GPT-5.6 系列医疗评估结果

    OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。

    推荐理由:GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日周六
  1. MarkTechPost(RSS)74

    蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

    蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

    推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

  2. X:Greg Brockman (@gdb)71

    GPT-5.6 健康智能升级,Luna 性能提升成本降 25 倍

    GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    推荐理由:GPT-5.6 主打健康智能,虽然还没实测,但 25 倍的降本让高级推理不再是实验室专属,做医疗应用的可以提前评估切换成本了。

  3. HuggingFace Daily Papers(社区热门论文)70

    GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

    GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。

    推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

  4. X:OpenAI (@OpenAI)73

    GPT-5.6 提升健康智能,Luna 性能更强成本更低

    GPT-5.6 是健康智能领域的一大进步。 在整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    推荐理由:GPT-5.6把性价比直接拉了个数量级,做健康AI的团队该重新算账了。但官方只扔了一句话,实际能力等实测再鼓掌。

  5. Timothy B. Lee:Understanding AI(RSS)78

    OpenAI 模型在世界编程大赛 AtCoder 决赛中大幅超越人类顶尖选手

    OpenAI 模型在东京举行的 AtCoder World Tour Finals 2026 两个赛项中击败人类顶尖程序员。启发式赛项中它大幅领先,Psyho 估计人类至少还需数天才能追上其分数;次日算法赛项七小时内解开全部五题,其中两题12名人类选手无一解出,主办方为此向 OpenAI 颁发两个“人类投降”奖。

    推荐理由:作者采访了参赛顶尖选手 Psyho,从当事人视角还原 AI 与人类顶尖程序员差距的量级,便于理解竞技编程格局的变化。

7月10日周五
  1. X:Tibo (@thsottiaux)70

    GPT-5.6 Sol 发布,速率限制将重置两次

    为庆祝 GPT-5.6 Sol 发布,我们将在接下来 24 小时内(两次)重置 ChatGPT Work 和 Codex 的速率限制。 我们希望你有时间真正尝试有挑战性的任务并掌握它。祝探索愉快!

    推荐理由:GPT-5.6 Sol 发布没给性能指标,更像一次稳定迭代,但速率限制重置是个好信号——至少在基础设施层面 OpenAI 有底气让人放开用。

  2. X:Tibo (@thsottiaux)65

    GPT-5.6 Sol 是目前最强模型

    GPT 5.6 Sol 是我们迄今为止在几乎所有方面最好的模型。 与GPT-5.5相比,在编码、困难上下文与策略任务、搭建网站……以及任何我需要完成的事情上,差异非常显著。这完全要求你提升自己的尝试目标。

    推荐理由:OpenAI 员工首次透露 GPT 5.6 Sol,宣称全面超越 5.5,但推文无任何技术细节,目前只是预告。若属实,这将是年内最重要的模型升级,但先保持观望。

  3. Microsoft Research 博客(RSS)65

    微软发布开源地球系统基础模型 Aurora 1.5,新增 22 个天气变量与集合预报

    微软发布 Aurora 1.5,对开源 Aurora 地球系统基础模型进行重大扩展,新增 22 个天气变量(原 4 个)、支持小时级时间分辨率和概率集合预报,已在 GitHub 开源并放出的 Hugging Face 模型检查点。

    推荐理由:原文来自模型发布方,给出新增变量数、小时级分辨率和与 ECMWF 集合的对比数字,读者可据此评估其在能源等场景的适用性。

7月9日周四
  1. X:AI at Meta (@AIatMeta)65

    Meta 发布 Muse Spark 1.1 模型

    来自 @finkd 的消息 — Muse Spark 1.1 已上线。

    推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。

  2. X:Mark Zuckerberg (@finkd)73

    Meta 发布 Muse Spark 1.1 低价智能体模型

    今天我们发布 Muse Spark 1.1——一款价格极低、能力强大的智能体与编程模型。它已通过我们新的 Meta Model API 上线,并集成于 Meta AI 中。

    推荐理由:低价位 agentic coding 模型即日可用,可能使原先因成本顾虑而推迟的智能体原型更早启动。

  3. 公众号:龙猫LongCat(美团)74

    美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

    推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

  4. MarkTechPost(RSS)70

    NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍

    NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。

    推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。

  5. IT之家(RSS)72

    蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video

    蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。

    推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。

  6. IT之家(RSS)73

    蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0

    蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。

    推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。

  7. MarkTechPost(RSS)70

    Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型

    Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。

    推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。

  8. Meta AI:Research Blog(网页)74

    Meta 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测

    Meta Superintelligence Labs 发布 Muse Spark 1.1,定位面向智能体任务的多模态推理模型,在工具与计算机使用、编码、多模态理解上较 Muse Spark 有明显提升,支持 1M token 上下文窗口。

    推荐理由:官方博客给出模型在智能体、编码、多模态上的能力细节和百万 token 上下文,并开放 Meta Model API 公测,可对照现有工作流评估。

7月8日周三
  1. The Decoder:AI News(RSS)74

    OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟

    OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。

    推荐理由:被美国政府按了暂停键的 GPT-5.6 终于要公开了,基准测试小胜 Claude Mythos 5 且 token 消耗仅三分之一,价格也比 Anthropic 便宜近半,开发者可以准备预算了。

  2. OpenAI:部署安全与系统卡(网页)60

    GPT-Live 系统卡:评测配置更正后部分安全指标出现回归

    OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini 系统卡,并因发现评测配置不匹配而重跑了语音原生违禁内容评测。

    推荐理由:OpenAI 公开更正后的语音安全评测数据,附带修正前后对照,读者可看到误配置如何影响安全评估结论。

  3. X:Greg Brockman (@gdb)67

    GPT-5.6 Sol 系列本周四发布

    GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。

    推荐理由:OpenAI的新模型Sol周四上线,虽然信息不多,但任何来自他们的模型更新都值得所有做AI产品的人盯紧机会。