跳到正文

全部动态

今日 0 条
10月1日周四
  1. X:ARC Prize (@arcprize)62

    OpenAI GPT-6.1 Sol 在 ARC-AGI (Verified) 上的评测成绩

    ARC Prize 公布 OpenAI GPT-6.1 Sol 在 ARC-AGI (Verified) 上的成绩:ARC-AGI-3 为 52.7%(标准 harness,$7.6K),provider adapter harness 下 96.4%($4.4K);ARC-AGI-2 为 94.2%($0.25/task);ARC-AGI-1 为 98.5%($0.06/task)。其在 v3 上的 96.4% 接近 GPT-6 Astra 的 99.9%,但成本低 77%。

  2. X:ARC Prize (@arcprize)38

    GPT-6.1 Sol 在 ARC-AGI-3 高推理更省成本

    GPT-6.1 Sol 在 ARC-AGI-3 上以更高推理等级做出更优决策,完成关卡所需动作更少,从而降低总推理成本。以 sk48 为例,使用保留不透明推理状态并支持自动压缩的 provider adapter 时,max 推理仅用 463 个动作通关,而 low 推理用了 1,078 个。

  3. X:Claude Devs (@ClaudeDevs)31

    Claude 开发者门户网站上线

    https://Claude.dev 是我们为使用 Claude 构建应用的开发者打造的新家园。 你将在这里找到工程深度解析、Claude Code 和 API 指南、来自 Claude 构建团队的建议,还有一些有趣的彩蛋。

  4. X:Rohan Paul (@rohanpaul_ai)23

    OpenAI CFO 谈 Dots 与 Muse 对比

    OpenAI 的 CFO Sarah Friar 回答 CNBC 的提问: “Dots 与 Muse 在市场上的产品相比如何?” ---- 来自“CNBC Television”YouTube 频道,(链接见评论)

  5. X:Testing Catalog (@testingcatalog)57

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布 Gemini 4 Argon 前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络防御的复杂工作流,DeepSWE v1.1 得分 77.9% 为新 SOTA。作者称其在多项基准上优于 GPT-6 Astra、Claude Opus 5.5 和 Claude Fable 5.1,即将首先向付费 API 客户和 Google AI Ultra 订阅用户推出。Sundar Pichai 称该模型在复杂工作流、网络防御和软件工程方面表现出前沿性能,团队已在 Google 内部从编码到量子计算广泛使用。

  6. IT之家(RSS)72

    美光科技 2026 财年归母净利润 849.69 亿美元,同比增长 895.07%

    美光科技发布 2026 财年年报,营业总收入 1331.88 亿美元,同比增长 256.33%;归母净利润 849.69 亿美元,同比增长 895.07%,毛利率达 80.7%。第四财季营收 542.29 亿美元,同比增长 379.27%;公司预计 2027 财年第一季度营收 600 亿至 630 亿美元,并已量产 512GB DDR5 RDIMM 内存模块,速率可达 9200 MT/s。

  7. X:OpenRouter (@OpenRouter)28

    OpenRouter 延长 Space Bunny Alpha 隐身期

    Space Bunny Alpha 更新: 该提供商已推出速度和可靠性改进,隐身期现已延长至 10 月 5 日。 再试一次,告诉我们感受如何:https://openrouter.ai/stealth/space-bunny-alpha 感谢大家持续的反馈!

  8. X:Ammaar Reshi (@ammaar)45

    Gemini 4 Argon 基准测试预览

    以下是 Gemini 4 Argon 的基准测试预览。 今天开始向网络防御者推出,并尽快向所有人开放。 很高兴看到所有进展,迫不及待想让大家都用上!

  9. X:Google AI (@GoogleAI)55

    Google 发布 Gemini 4 Argon 前沿模型,输出 token 上限扩至 1M

    Google AI 发布新前沿模型 Gemini 4 Argon,面向长程复杂工作流的深度推理,覆盖软件工程、法务与金融等企业知识工作及网络安全防御。模型输出 token 上限扩展至 1M,目前在 Fairwind Program 中向部分可信网络防御者推送,后续将尽快开放更广泛使用。

  10. Hacker News:AI 热帖78

    Google 发布 Gemini 4 Argon 前沿模型,输出上限扩至 1M tokens

    Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向部分可信网络防御者开放,后续再向开发者、企业和消费者推出,起售价为每百万输入 tokens $2、每百万输出 tokens $10,缓存输入价格低至输入价的 95% 折扣。

  11. X:Google (@Google)37

    Gemini 4 Argon 向网络安全防御者开放

    Gemini 4 Argon 正通过我们的 Fairwind Program 向首批网络安全防御者推出,让他们能够利用其完整的前沿级网络安全防御能力。 我们将继续收集早期测试者的反馈,同时迭代护栏机制,以便尽快将 Argon 提供给开发者、企业和消费者。 了解更多 ↓ http://goo.gle/4AFGGh1

  12. X:Google DeepMind (@GoogleDeepMind)39

    Gemini 4 Argon 前沿模型发布

    推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者开放。

  13. X:Google DeepMind (@GoogleDeepMind)47

    Google DeepMind 推出 Argon 模型

    Argon 拥有 1M token 输出上限,增加了更深层次的推理能力,可一次性处理长篇多步骤问题。 早期测试者的反馈将帮助我们在不久后更广泛地向开发者、企业和消费者推出之前强化我们的系统。 了解更多 → https://goo.gle/4rZBiSd

  14. X:Sundar Pichai (@sundarpichai)39

    Google 预告 Gemini 4 Argon

    外面有很多关于我们下一个模型的讨论(!),所以我想尽快给大家一个提前预览。介绍 Gemini 4 Argon! 它在复杂工作流、网络防御和软件工程方面展现出前沿性能。Google 内部团队正在广泛使用它,从编程到量子计算,反馈很好。 以下是基准测试一览:

  15. HuggingFace Daily Papers34

    InFlowOp:为故障而非流程付费的无标签流内多智能体工作流优化

    论文提出 InFlowOp,用统一的免标签成本为多智能体工作流中的任务分解粒度和智能体分配定价,并在执行中以最低成本修复故障。该方法在 Braid 基准上跨领域和不同骨干模型运行,较单智能体基线最高提升 +11.97%,其中流内优化带来 +9.64% 提升。Braid 是要求多智能体协作、超出单智能体能力的评测基准。

  16. X:Rohan Paul (@rohanpaul_ai)62

    OpenAI 与 Synopsys 达成多年合作,共同开发芯片设计模型 GPT-Synopsys

    OpenAI 与 Synopsys 宣布多年期合作,共同开发面向芯片设计的专用模型 GPT-Synopsys。模型将基于 Synopsys 的 EDA 工具训练,OpenAI 获得这些工具的许可用于开发,双方还将围绕研发和联合市场推广展开协作,芯片工程师未来可能把时序收敛、功耗优化等目标交给 AI 智能体完成。

  17. Hacker News 热门(buzzing.cc 中文翻译)34

    上次我的家人被科技取代时

    一位开发者在 AI 冲击下回顾家族史:其高祖父原是法国乡村铁匠,看到汽车后转行成为机械师,家族此后世代以“帮人出行”为目的。他认为许多开发者真正热爱的并非写代码本身,而是创造、解决问题和看人使用成果,因此应放下“怎么做”,守住“为什么做”。

  18. X:Rohan Paul (@rohanpaul_ai)42

    Inworld 收购语音智能体平台 Ultravox

    Inworld 已收购语音智能体平台 Ultravox,并将内置语音迁移至 Realtime TTS-2。Ultravox 可理解用户语义、调用工具、完成任务,并实时处理轮次切换与打断。Realtime TTS-2 支持用自然语言内联指令调整语速、语气和情绪表达,例如在讲解复杂步骤时放慢语速再恢复正常。

  19. X:Luma AI (@LumaLabsAI)49

    Ideogram 4.5 上线 Luma

    最好的创意编辑能开启新的可能性,同时不丢失原作最初打动人的东西。 @ideogram_ai 4.5 现已登陆 Luma,让创意团队对哪些要改、哪些要保留拥有更多掌控。 在 Luma 中试用 → https://app.lumalabs.ai

  20. X:Arena (@arena)35

    Claude Sonnet 5.5 与 GPT-6.1 Sol 成本对比测试

    Claude Sonnet 5.5 和 GPT-6.1 Sol 能否以 Fable、Opus 或 Astra 成本的一小部分,交出强劲的结果? 我们刚刚在多个提示词上对它们进行了并排测试,追踪每一代模型的实际成本,并将结果与各自实验室的更大模型进行对比。 结果来自 @petergostev,详见我们的 YouTube。 https://youtu.be/r0ymhRtcTeI?si=hyomPcmon3yHLo6h

  21. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)50

    Perplexity 开源上下文嵌入模型 pplx-embed-v2-context-9b-preview

    Perplexity 开源其上下文嵌入模型,在 turbopuffer 的 context-bench 上表现最佳。被引用内容介绍其新训练方法让每个文档分块在整篇文档语境下编码,pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 的 context-bench 上刷新纪录,详情见 perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage。

  22. X:Rohan Paul (@rohanpaul_ai)53

    AI 热潮推高超大规模企业自身融资成本

    AI 热潮正在抬高其自身的资本成本,物理瓶颈正演变为融资瓶颈。作者引用 The Information 报道,超大规模企业大量发债使其债务相对其他顶级评级公司更贵,投资者要求的额外收益率今年上升约 0.25 个百分点;Fed 主席 Kevin Warsh 表示 AI 驱动的融资是国债收益率走高的部分原因。

  23. X:Eric Zakariasson (@ericzakariasson)53

    Grok Bot 工程类 bot 上线 bot marketplace

    Grok Bot 官方宣布工程类 bot 上架 bot marketplace,入口为 https://x.ai/bot/marketplace/engineering。引用介绍称 bot 可把编码任务交给 Cursor、用 GitHub 和 Origin 插件管理 PR,并分享所构建内容的视频演示;页面展示多款工程 bot,如 Projects Manager、SWE by Cursor 等。

  24. The Decoder59

    OpenAI 与 Synopsys 合作开发芯片设计模型 GPT-Synopsys

    OpenAI 与 Synopsys 签署多年战略合作,共同开发专注芯片设计的专用 AI 模型 GPT-Synopsys。该模型结合 OpenAI 的 AI 技术与 Synopsys 的 EDA 工具,目标是对芯片设计与验证进行推理并直接操作 Synopsys 的工具,工程师负责下达设计目标并审核批准输出,模型运行在 OpenAI 的基础设施上。

  25. X:Noam Brown (@polynoamial)43

    Noam Brown 回忆与 Sokota 的相识经历

    5 年前我在一个会议的 poster session 上遇到了 @ssokota。他的讲解让我印象深刻,于是我给了他一个实习机会。我们持续合作,他现在在 @OpenAI 和我一起工作。后来他告诉我,整场 session 里我是唯一一个在他 poster 前停下来的人。

  26. Claude Code:GitHub Releases(RSS)37

    Claude Code v2.1.286 发布

    Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表“N more”行支持鼠标点击跳转。该版本修复了并行工具调用后 --resume/--continue 丢失对话、工具返回非文本对象导致 API 400 错误、云会话大历史无法唤醒等问题,并改进了 commit 前自动运行 verify 技能等提交引导。

  27. X:OpenRouter (@OpenRouter)53

    Inception 的 Mercury Decide 决策模型上线 OpenRouter,免费早期访问

    Inception 的 Mercury Decide 模型已在 OpenRouter 上线,提供免费早期访问。它是决策模型,接收应用状态和类型化问题,返回附带概率的类型化答案;Inception 称其在 JevBench v1.4 上是 OpenRouter 上最智能的决策模型。地址:https://openrouter.ai/inception/mercury-decide:free

  28. X:Perplexity (@perplexity_ai)49

    Perplexity 推出上下文嵌入模型 pplx-embed-v2

    我们构建了一种训练上下文嵌入模型的新方法,它能在编码文档的每个片段时,将整篇文档纳入视野。 pplx-embed-v2-context-9b-preview 在 ConTEB 和 @turbopuffer 全新未公开的 context-bench 上创下新的 SOTA。 https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage