跳到正文

全部动态

今日 0 条
10月1日周四
  1. X:ARC Prize (@arcprize)38

    GPT-6.1 Sol 在 ARC-AGI-3 高推理更省成本

    GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。

  2. X:Testing Catalog (@testingcatalog)57

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布 Gemini 4 Argon 前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络防御的复杂工作流,DeepSWE v1.1 得分 77.9% 为新 SOTA。作者称其在多项基准上优于 GPT-6 Astra、Claude Opus 5.5 和 Claude Fable 5.1,即将首先向付费 API 客户和 Google AI Ultra 订阅用户推出。Sundar Pichai 称该模型在复杂工作流、网络防御和软件工程方面表现出前沿性能,团队已在 Google 内部从编码到量子计算广泛使用。

  3. X:Ammaar Reshi (@ammaar)45

    Gemini 4 Argon 基准测试预览

    以下是 Gemini 4 Argon 的基准测试预览。 今天开始向网络防御者推出,并尽快向所有人开放。 很高兴看到所有进展,迫不及待想让大家都用上!

  4. X:Google AI (@GoogleAI)55

    Google 发布 Gemini 4 Argon 前沿模型,输出 token 上限扩至 1M

    Google AI 发布新前沿模型 Gemini 4 Argon,面向长程复杂工作流的深度推理,覆盖软件工程、法务与金融等企业知识工作及网络安全防御。模型输出 token 上限扩展至 1M,目前在 Fairwind Program 中向部分可信网络防御者推送,后续将尽快开放更广泛使用。

  5. Hacker News:AI 热帖78

    Google 发布 Gemini 4 Argon 前沿模型,输出上限扩至 1M tokens

    Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向部分可信网络防御者开放,后续再向开发者、企业和消费者推出,起售价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入价格低至输入价的 95% 折扣。

  6. X:Google (@Google)37

    Gemini 4 Argon 向网络安全防御者开放

    Gemini 4 Argon 正通过我们的 Fairwind Program 向首批网络安全防御者推出,让他们能够利用其完整的前沿级网络安全防御能力。 我们将继续收集早期测试者的反馈,同时迭代护栏机制,以便尽快将 Argon 提供给开发者、企业和消费者。 了解更多 ↓ http://goo.gle/4AFGGh1

  7. X:Google DeepMind (@GoogleDeepMind)39

    Gemini 4 Argon 前沿模型发布

    推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者开放。

  8. X:Sundar Pichai (@sundarpichai)39

    Google 预告 Gemini 4 Argon

    外面有很多关于我们下一个模型的讨论(!),所以我想尽快给大家一个提前预览。介绍 Gemini 4 Argon! 它在复杂工作流、网络防御和软件工程方面展现出前沿性能。Google 内部团队正在广泛使用它,从编程到量子计算,反馈很好。 以下是基准测试一览:

  9. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)50

    Perplexity 开源上下文嵌入模型 pplx-embed-v2-context-9b-preview

    Perplexity 开源其上下文嵌入模型,在 turbopuffer 的 context-bench 上表现最佳。被引用内容介绍其新训练方法让每个文档分块在整篇文档语境下编码,pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 的 context-bench 上刷新纪录,详情见 perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage。

  10. X:Perplexity (@perplexity_ai)49

    Perplexity 推出上下文嵌入模型 pplx-embed-v2

    我们构建了一种训练上下文嵌入模型的新方法,它能在编码文档的每个片段时,将整篇文档纳入视野。 pplx-embed-v2-context-9b-preview 在 ConTEB 和 @turbopuffer 全新未公开的 context-bench 上创下新的 SOTA。 https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage

  11. X:Arena (@arena)70

    GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名

    Arena 评测榜单显示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格为 $8/MToken。相比 GPT-6 Sol (Max) 同价提升 70 分,排名上升 4 位,且在 Consumer Product 等所有类目均有提升。

    推荐理由:评测方公布了 GPT-6.1 Sol (Max) 的排名和价格数据,读者可以据此比较它在成本与性能权衡中的位置。

  12. X:MiniMax (@MiniMax_AI)44

    Creatify 基于 MiniMax H3 推出 Boreal-H3

    基于 MiniMax H3,@Creatify_Labs 的 Boreal-H3 是一款专为广告优化的视频模型,在遵循创意简报更准确的同时,保持产品和角色的一致性。 期待看到 MiniMax H3 成为更多面向特定行业的前沿模型的基础!✨

  13. X:Runway (@runwayml)39

    Runway 发布开放权重世界动作模型 Praxis-1

    Runway 推出开放权重世界动作模型 Praxis-1,将视频预训练能力转化为机器人真实世界控制,定位为可跨任意具身形态与环境的策略模型。该模型基于其大规模视频预训练与实时基础设施构建,官方称机器人演示数据有限而视频数据无限。Runway 正与 Noble Machines、Standard Bots、Ultra 等早期伙伴测试,并将在未来数月公开权重。

  14. X:蚂蚁百灵 (@AntLingAGI)45

    蚂蚁百灵发布 Ling-3.1-flash

    认识 Ling-3.1-flash:总参数约 560B,每 token 激活约 25B,上下文窗口最高 1M token。 我们计划很快开源该模型。 在工作、编程与医疗领域:GDPVal-AA v2.1 上 1,673 Elo,FrontierSWE 上 75.16,HealthBench Professional 上 65.35。

  15. X:Testing Catalog (@testingcatalog)51

    Ideogram 发布 Ideogram 4.5 图像模型,主打精准编辑

    Ideogram 发布 Ideogram 4.5 图像模型,主打精准编辑。模型已在 Ideogram、API 及合作服务上可用,原生 2K 分辨率下每张图价格 0.8 至 22 美分,团队还计划尽快发布该模型的开源权重。

  16. X:Microsoft Research (@MSFTResearch)34

    微软新ML系统提前30-60分钟预测太空天气

    极端太空天气事件可能损坏地球电力系统,并降低GPS精度和卫星运行。一个新的机器学习系统能在风暴到达前30-60分钟预测可能发生损害的位置:https://msft.it/6019aYXwh

9月30日周三
  1. X:Aidan Gomez(Cohere CEO,@aidangomez)49

    Cohere 推出 Embed 5 嵌入模型系列

    Nils Reimers 和团队搞出的新模型有点猛。极强的可扩展性、SOTA 准确率,而且一如既往地完全支持私有化部署,并可在 Model Vault 上使用!

  2. X:Cohere(@cohere)45

    Cohere 发布 Embed 5 嵌入模型系列

    推出 Cohere Embed 5:我们全新的 SOTA 嵌入模型系列。 用 Embed 5 Pro 获得前沿能力,或用 Embed 5 Fast 获得低延迟性能。

  3. IT之家(RSS)60

    蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数

    蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。模型围绕通用智能体、搜索、日常办公和软件研发等任务优化,并提升医疗、金融和材料科学研究场景能力。模型开放为期两周的免费体验,期间服务长度为 256K,转付费后计划开放 1M 上下文,届时团队也计划同步开源。

  4. 公众号:蚂蚁百灵(Ling)67

    蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级

    蚂蚁百灵推出 Ling-3.1-flash,总参数约 560B,每个 Token 激活约 25B,上下文窗口上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家)。

    推荐理由:官方发布同时给出架构细节、多项长程任务实测结果和对比数据,读者可据此评估其在办公、医疗和软件研发场景的适用性。

  5. X:通义千问 / Qwen (@Alibaba_Qwen)30

    Qwen3.8-27B 上线 Nebius

    Qwen3.8-27B 现已通过 @nebiustf 开放使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳

  6. X:Rohan Paul (@rohanpaul_ai)60

    StepFun 发布 StepAudio 3 Music 音乐生成基础模型

    StepFun 与 ACE Studio 发布 StepAudio 3 Music,可将文本描述和歌词生成完整歌曲,支持歌曲生成、器乐生成、音乐翻唱、人声编排四种工作流,并基于 ABC-COT 先规划音乐结构与编排再合成。

  7. X:AK (@_akhaliq)48

    Audio8 ASR Infinite 流式语音识别模型发布

    Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,通过滚动 KV Cache 在 24/7 持续运行下保持内存与延迟恒定。模型每个时钟步输出一个文本 token(12.5/8.3/6.25 次决策/秒),平衡感知粒度与资源开销。HuggingChat 的 ML intern 已搭建 Gradio 工作流供试用。

  8. X:OpenAI Developers (@OpenAIDevs)70

    OpenAI 发布 GPT-6.1 Sol,主打智能体编码与跨应用工作流

    OpenAI 发布 GPT-6.1 Sol,称其在编码、computer use 和跨应用工作流中表现强劲,价格低于 GPT-6 Astra。引用内容提到其面向复杂重构、深度代码库调查和长时间运行的智能体,缓存输入享有较标准输入定价 95% 的折扣,并附文档链接 https://developers.openai.com/api/docs/models/gpt-6.1-sol。

  9. X:Rohan Paul (@rohanpaul_ai)60

    Dyna Robotics 发布 Dyna-2.1 与半人形机器人 Taku,独立完成一小时洗衣房任务

    Dyna Robotics 发布 Dyna-2.1,称其为首个实现可靠超长时程全身自主的 Physical Agent,并搭配全新半人形硬件 Taku。作者转发引用其公开的一小时无剪辑视频:机器人独自运行酒店式洗衣房,装载并启动机器、叠好毛巾并上架,且在别处需要处理时能中断当前动作而不瞬间冻结,这依赖一个并行视觉语言模型监视房间、让 Dyna-2 持续保持手部运作。

  10. X:Arena (@arena)67

    GPT-6.1 上线 Arena 评测平台

    Arena 宣布 OpenAI 的 GPT-6.1 现已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:OpenAI 新模型上架 Agent Arena 和 Code Arena,读者可自行投票并等待基于真实智能体任务的分数。

  11. X:Arena (@arena)84

    Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

    Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。

    推荐理由:原文给出实测榜单名次、分数与价格对比,读者可以据此评估该模型在成本与性能间的实际位置。