跳到正文

全部动态

今日 0 条
9月9日周三
  1. X:OpenAI Developers (@OpenAIDevs)59

    OpenAI 在 API 发布 GPT-Image-2.5 Flare 和 Sunburst 图像模型

    OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。

    推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。

9月5日周六
  1. IT之家(RSS)83

    奥尔特曼致歉 GPT-6 Astra 发布混乱,现已面向所有 Plus / Pro 等用户推出

    OpenAI 于 9 月 3 日上线 GPT-6 Astra,称其在电脑使用、浏览、软件工程、科学和专业工作方面达到最先进性能。因企业安全客户先于 Pro 订阅者获得访问权限引发高价 Pro 用户不满,CEO 奥尔特曼 9 月 4 日在 X 平台致歉,并提出补偿机制:从 9 月 4 日起付费用户每缺少一天 Astra 访问即获得一次额度重置。

    推荐理由:原文梳理了 GPT-6 Astra 发布混乱的经过、用户不满与补偿机制,可借此了解大模型分阶段发布中的次序争议。

  2. X:Sam Altman (@sama)80

    GPT-6 Astra 开始向 Plus 和 Business 用户推出

    Sam Altman 宣布 GPT-6 Astra 现已向所有 Plus 和 Business 用户推出。此前该模型已面向 Pro、Enterprise 和 Business Premium 用户在 Work/Codex 及 API 中提供。

    推荐理由:原文确认 GPT-6 Astra 的用户覆盖范围扩大到 Plus 和 Business,读者可以据此判断自己的可用入口和时间点。

  3. X:OpenAI (@OpenAI)82

    OpenAI 发布 GPT-6 Astra,面向 Pro、Enterprise 和 Business Premium 用户开放

    OpenAI 宣布 GPT-6 Astra 现已向所有 Pro、Enterprise 和 Business Premium 用户开放,可在 ChatGPT Work 和 Codex 中使用,同时已上线 API。Plus 和 Business 用户的推送可能需要几天时间。

    推荐理由:官方宣布 GPT-6 Astra 上线范围与渠道,Plus 和 Business 用户还需等待几天,读者可据此确认自己能否用上。

  4. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.6 与 MAI-Image-2.6-Flash 图像模型

    Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。

    推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。

9月4日周五
  1. X:Satya Nadella (@satyanadella)63

    GPT-6 Astra 上线 Microsoft Foundry,早期客户已在 Azure 上使用

    Satya Nadella 发文表示,早期客户已开始使用 Azure 上的 Astra。GPT-6 Astra 现已通过 Microsoft Foundry 提供,详情见 Azure 官方博客 https://azure.microsoft.com/en-us/blog/gpt-6-astra-frontier-intelligence-for-work-now-available-in-microsoft-foundry/。

    推荐理由:Satya Nadella 确认 GPT-6 Astra 已在 Microsoft Foundry 开放,早期客户已可在 Azure 上使用。

  2. X:Greg Brockman (@gdb)72

    Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

    Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

    推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。

  3. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)70

    Perplexity 宣布将接入 OpenAI GPT-6 Astra,称其在 WANDR 评测中居首

    Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。

    推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。

  4. TechCrunch:AI(RSS)81

    OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议

    OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。

    推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。

  5. Hacker News 热门(buzzing.cc 中文翻译)78

    IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

    IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

    推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。

9月3日周四
  1. Microsoft AI:官方博客(网页)64

    Microsoft AI 发布语音识别模型 MAI-Transcribe-2

    Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。

    推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。

  2. OpenAI:部署安全与系统卡(网页)75

    OpenAI 发布 GPT-6 Astra 系统卡,披露对齐评测与生化能力分级

    OpenAI 发布 GPT-6 Astra 系统卡,将其在生物化学领域预防性地定为 High 能力,未达 Critical 阈值。

    推荐理由:OpenAI 系统卡详细披露 GPT-6 Astra 在元博弈、隐蔽沙袋和生化能力上的评测结果,读者可据此了解其对齐风险与防护框架的实际边界。

  3. X:Sundar Pichai (@sundarpichai)65

    Google 发布 Gemini 3.8 Flash,称在 DeepSWE v1.1 上超越多数更大前沿模型

    Google 发布 Gemini 3.8 Flash,为 6 周内第 3 次 Flash 更新。官方称相较 3.7 Flash 在软件工程、智能体任务和多步推理上有显著提升,在 DeepSWE v1.1 上以更低成本自主端到端解决复杂工程问题,表现超越多数更大的前沿模型。图中基准显示其 Terminal-bench 2.1 得 89.4%、HLE-Verified 得 54.9%,输入价格 $0.75/1M tokens、输出 $3.75/1M tokens,为 2026 年 12 月 31 日前 introductory 价。详情见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

    推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。

9月2日周三
  1. X:通义千问 / Qwen (@Alibaba_Qwen)69

    Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿

    通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。

    推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。

  2. Meta AI:Research Blog(网页)62

    Meta 发布 Muse Spark 1.3,提升智能体与编码任务表现

    Meta 发布 Muse Spark 1.3,在智能体和编码任务上性能提升,max reasoning 版本现已在 Muse Code 和 Meta Model API 开放。

    推荐理由:官方发布给出智能体协作、编码效率和安全性变化,以及约20%工具调用和25% token的降幅,便于对比现有工作流。

  3. Artificial Analysis 完整文章(网页)66

    Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型

    Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。

    推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。

  4. Artificial Analysis 完整文章(网页)74

    Meta 发布 Muse Spark 1.3,Artificial Analysis 指数达 61/62 分逼近前沿

    Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。

    推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。

9月1日周二
  1. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  2. Meta AI:Research Blog(网页)64

    Meta 发布实时音频感知模型 Muse Voice Transcribe

    Meta Superintelligence Labs 发布 Muse Voice Transcribe,称其为首个实时音频感知模型,提供流式 ASR、最多 20+ 说话人的 diarization 和 endpointing。

    推荐理由:原文给出流式 ASR、说话人分离和自适应延迟的技术细节与架构说明,读者可以了解其实时语音感知的实现方式。

  3. Anthropic:Newsroom(网页)87

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

    推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。

8月31日周一
  1. IT之家(RSS)77

    DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

    DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

    推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

  2. Runway:News(网页)67

    Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

    Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。

    推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。

8月29日周六
  1. IT之家(RSS)72

    智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

    智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。

    推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。

8月28日周五
  1. X:智谱 Z.ai (@Zai_org)65

    GLM-5.3 开源权重,智能体编码与网防最强

    GLM-5.3 现已开放权重。 我们最强大的智能体编码与网络防御模型,现已可供下载、运行和定制。 权重:https://huggingface.co/zai-org/GLM-5.3 技术博客:https://z.ai/blog/glm-5.3

    推荐理由:开放权重让需要私有化部署的编码智能体与安全防御场景可以直接下载、运行和定制模型,不再受闭源 API 限制。

  2. 公众号:腾讯混元82

    腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线

    腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。

    推荐理由:官方盲测中它与 GLM-5.3、Kimi K3 的分差不足 0.1,选型时 1M 上下文和开源部署成本可能比榜单排名更实际。

8月27日周四
  1. X:唐杰(@jietang)71

    唐杰宣布GLM-5.3 Flash AA登顶OpenRouter

    Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。

    推荐理由:OpenRouter 周 token 份额近两成说明开发者已在用真实调用投票,低价模型正从价格敏感场景切入,团队评估模型成本时会更多参考实际使用量而非榜单单项分。

8月26日周三
  1. X:Unsloth (@UnslothAI)81

    Unsloth 发布 Qwen3.8-Flash-Next GGUF,75GB 内存可本地运行

    Unsloth 推出 Qwen3.8-Flash-Next 的 GGUF 量化版本,称该 125B MoE 多模态模型性能超过 Claude-Opus-4.6 (Max),可在 75GB RAM 上本地运行,无需 GPU VRAM。

    推荐理由:原文给出了本地运行所需的内存档位与量化精度权衡,读者可据此判断自己的设备能否跑动这个 MoE 模型。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)84

    Qwen3.8-Flash 开源,Qwen4 架构预览

    通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。

    推荐理由:训练成本降到前代的九分之一,同时编码和办公任务基准分数更高,对成本敏感的 API 调用场景提供了一个新的权衡参考点。

  3. Qwen:Blog Retrieval(API)83

    Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

    通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

    推荐理由:这次提前开放 Qwen4 架构权重,关键在于 QSA 稀疏注意力与 N-gram 查表参数同时降低长上下文成本、扩大容量,为评估下一代模型提供早期样本。

  4. 公众号:腾讯混元67

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 压缩至 440MB,已落地哔哩哔哩直播弹幕翻译

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 量化方案压缩至 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 等商业 API。该模型已联合英特尔完成 x86 适配,并在哔哩哔哩直播弹幕实时翻译中落地,单条弹幕翻译耗时 500~800ms。

    推荐理由:相比精度数字,这套量化给出 x86 优化和直播弹幕实测数据,让端侧替代云翻译 API 的成本与隐私权衡有了可对照的工程基线。

8月25日周二
  1. X:Google AI (@GoogleAI)73

    WeatherNext 预测气旋:提前五天预警五级飓风

    Google AI 发布 WeatherNext 气旋预测模型,可同时预测风暴路径、强度和规模,比现有系统多提供一整天的预警时间。该模型在 2025 飓风季实战测试中,提前五天预测飓风 Melissa 在牙买加的五级登陆,系美国国家飓风中心首次实时使用 AI 模型。模型单场风暴可生成多达 1000 次模拟,代码与权重已开源。

    推荐理由:把路径、强度和尺度放进同一模型,省去过去切换全球与区域模型的步骤,对需要快速判断登陆风险的预报流程是种简化。

8月22日周六
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedAudio 9B 通用音频语言模型

    FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。

    推荐理由:官方发布了代码和权重,读者可以据此了解用一个 9B 骨干同时覆盖语音理解与生成的解耦表征设计。

8月21日周五
  1. X:面壁智能 OpenBMB (@OpenBMB)69

    面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

    面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

    推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。

  2. 公众号:DeepSeek(深度求索)73

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。该模型通过 API 提供,图片按 token 计费,一张最多占 384 tokens,价格与 V4-Flash 一致。同期上线的 Files API 免费,支持图片上传后通过 file_id 复用。

    推荐理由:比文本能力持平更实际的是多模态 Agent 能力接近 Opus-4.8,同时图片按 token 计费与 V4-Flash 一致,原先依赖外部视觉模型的 Agent 流程可能改用单一 API 且成本更低。

8月20日周四
  1. IT之家(RSS)72

    阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕

    阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

    推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。

  2. 公众号:蚂蚁百灵(Ling)68

    Ling-3.0 tiny & flash Base Models 正式开源

    蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。

    推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。

8月19日周三
  1. Hugging Face:Blog(RSS)64

    Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

    Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。

    推荐理由:QAD 量化蒸馏恢复 Q4_0 模型九成六以上 BF16 精度,对应树莓派和手机等边缘设备,在保持低内存与高吞吐的同时缩小与全精度模型的差距。