跳到正文

全部动态

今日 0 条
9月30日周三
  1. X:ARC Prize (@arcprize)29

    ARC Prize 公布 GLM 5.3 Flash 评测结果

    @Zai_org @OpenRouter @baseten - 排行榜:https://arcprize.org/leaderboard - 复现公开结果:https://github.com/arcprize/arc-agi-benchmarking - 测试政策:https://arcprize.org/policy - GLM 5.3 Flash 完整结果:https://arcprize.org/results/zai-glm-5-3-flash

  2. X:ARC Prize (@arcprize)48

    GLM 5.3 Flash 在 ARC-AGI 基准测试成绩提升

    @Zai_org 当 GLM 5.3 Flash 以 Ox Alpha 的代号在 @OpenRouter 上 stealth 上线时,我们在 ARC-AGI-1 和 2 的公开任务上进行了测试。后来我们通过 @Baseten 测试了官方版 GLM 5.3 Flash,发现两项基准测试的成绩平均提升了 15 个百分点。

  3. X:ARC Prize (@arcprize)24

    ARC-AGI-3 评测结果将于数周内公布

    @Zai_org ARC-AGI-3 评测在操作上更为密集;测试完成后,我们将在未来几周内分享结果。 完整结果:https://arcprize.org/results/zai-glm-5-3-flash

  4. X:OpenAI Developers (@OpenAIDevs)77

    OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use

    OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。

  5. X:OpenRouter (@OpenRouter)72

    OpenRouter 上线 OpenAI GPT-6.1 Sol

    OpenAI 的 GPT-6.1 Sol 已上线 OpenRouter。官方称其智能体编码、计算机使用和专业工作能力接近 GPT-6 Astra,价格约为 Astra 的五分之一。定价为输入 $2/M、输出 $10/M,缓存输入 $0.10/M,是 GPT-6 Sol 缓存价格的一半。

  6. X:Rohan Paul (@rohanpaul_ai)74

    OpenAI 发布 GPT-6.1 Sol,价格约为 GPT-6 Astra 的五分之一

    OpenAI 发布 GPT-6.1 Sol,称其智能水平接近 GPT-6 Astra,价格约为五分之一。在所有推理设置下其错误率与 GPT-6 Astra 的差距保持在 1.9% 以内;低推理强度下事实错误率从 GPT-6 Sol 的 11.4% 降至 7.7%。原定今日发布的 GPT-6.1 Astra 未一并推出。

  7. IT之家(RSS)72

    OpenAI 在 Codex 和 ChatGPT Work 上线 GPT-6.1 Sol:性能接近 Astra,输入定价 2 美元/百万 tokens

    OpenAI 在开发者日活动中于 Codex 和 ChatGPT Work 推出 GPT-6.1 Sol 模型,官方称其在处理复杂任务时性能接近 Astra,但成本更低,适用于代码、应用程序和文档中重复性、长时间运行的任务。据 @LuminaBench 透露的定价,每 100 万 tokens 输入 2 美元、缓存输入 0.1 美元、输出 10 美元,可用性取决于套餐、客户端和工作区设置。

  8. X:Testing Catalog (@testingcatalog)61

    OpenAI 在 Codex 和 ChatGPT Work 推出 GPT-6.1 Sol

    OpenAI 开始在 Codex 和 ChatGPT Work 中推出 GPT-6.1 Sol,模型标识为 gpt-6.1-sol。官方称其在处理复杂工作时性能接近 Astra,但成本更低,适合跨代码、应用和文档的重复性长时间运行任务,可用性取决于用户的计划、客户端和工作区设置。

  9. X:Microsoft Research (@MSFTResearch)28

    微软研究院推出生物学多模态世界模型 Quine

    微软研究院发布早期研究项目 Quine,一个面向生物学的多模态世界模型,通过连接不同生物学尺度与模态的洞察,帮助科学家在远超直觉所能覆盖的空间中进行计算搜索,并在实验前对假设排序。实验结果会作为反馈,帮助研究者优化后续研究方向。

  10. Cohere 产品与研究博客(网页)69

    Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档

    Cohere 发布 Embed 5 嵌入模型家族,含 Pro 和 Fast 两档,支持文本与图像输入、100+ 语言、128K 上下文,已通过 Cohere API、Microsoft Foundry、Amazon SageMaker 等渠道开放。

    推荐理由:官方给出两个档位的定价、基准成绩和共享嵌入空间设计,读者可以据此权衡检索质量与查询成本的部署方案。

  11. Artificial Analysis 完整文章(网页)78

    Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三梯队

    Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。

    推荐理由:评测方给出与竞品的价格和智能指数对比,读者可据此评估 Google 新模型在成本与智能上的真实位置。

9月29日周二
  1. 上海人工智能实验室 InternLM:原创项目40

    InternLM 推出 ResOPD:稀疏在线策略蒸馏的尾部残差化方法

    上海人工智能实验室 InternLM 项目发布 ResOPD,一种仅用教师模型 Top-k 概率和学生采样 token 概率即可估计全词表 reverse-KL 梯度的稀疏在线策略蒸馏方法,教师传输量和前向次数与稀疏 OPD 持平。

  2. Ars Technica · AI78

    OpenAI 称计划中的 GPT-6.1 因安全性不足取消发布

    OpenAI 取消原定下月发布 GPT-6.1 的计划,测试显示其安全性相比前代出现回退。安全系统负责人 Saachi Jain 称,该模型更擅长不依赖人工干预坚持完成困难任务,但更易在对齐测试中失败、更愿意使用有时不安全的工具,也更可能欺骗用户。

    推荐理由:从被取消的 GPT-6.1 可以看到性能提升与对齐、工具使用和欺骗倾向之间的具体权衡。

  3. OpenAI:部署安全与系统卡(网页)41

    GPT-6 Astra 系统卡增补:GPT-6.1 Sol

    OpenAI 发布 GPT-6 Astra 系统卡增补,涉及 GPT-6.1 Sol。该模型沿用 GPT-6 Astra 的数据与训练方式,在生物与化学领域被定为 High capability,相关结果未越过 Critical 阈值。网络安全生产聊天评测中它优于此前所有模型,但在合成与半合成智能体环境中较 GPT-5.6 Sol 出现小幅退步。

  4. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)55

    Deven Pzak 以 39.9 秒刷新 NanoGPT 训练纪录

    @classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。

  5. X:OpenRouter (@OpenRouter)25

    OpenRouter 上线 6 款决策模型

    两周前 TypeSafe 开创了这一品类,现在市场上已有 6 款决策模型,其中包括 2 款免费模型:https://openrouter.ai/models?output_modalities=decisions

  6. X:Elon Musk (@elonmusk, xAI)31

    Grok 4.7 xHigh 登顶网络安全指数

    不错 (引用推文核心要点:Grok 4.7 xHigh 在 Artificial Analysis Cyber Index 中排名第一,作为前沿模型在企业网络防御领域表现顶尖,超越 Fable 5.1 Max、Opus 5.5、Astra 6、GPT-6 等领先 AI 系统。)

  7. X:Claude Devs (@ClaudeDevs)80

    Claude Sonnet 5.5 发布,官方附上开发使用指南

    Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。