跳到正文

全部动态

今日 94 条
9月30日周三
  1. X:Arena (@arena)67

    GPT-6.1 上线 Arena 评测平台

    Arena 宣布 OpenAI 的 GPT-6.1 现已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:OpenAI 新模型上架 Agent Arena 和 Code Arena,读者可自行投票并等待基于真实智能体任务的分数。

  2. X:Cognition (@cognition)21

    Devin 推出 MongoDB 现代化迁移方案

    Devin for @MongoDB Modernizations 来了。Devin 负责遗留代码改动,MongoDB AMP 负责数据迁移与验证。客户能更快上线生产环境,让工程师腾出精力去构建优秀软件、解决难题。 了解更多:https://devin.ai/blog/devin-for-mongodb-modernizations

  3. X:ElevenLabs (@elevenlabs)30

    ElevenAgents 上线 OpenAI Marketplace

    ElevenAgents 现已登陆 OpenAI Marketplace。 如果你的公司是 OpenAI 企业客户,很快就能为它赋予 90+ 种语言的语音,并计入你现有的 OpenAI 承诺额度。 了解更多:https://elevenlabs.io/blog/elevenagents-now-on-the-openai-marketplace

  4. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)60

    Perplexity Computer 推出 Automations 自动化功能

    Perplexity Computer 推出 Automations 功能,面向持续性工作,可基于事件触发器或按计划执行操作。Automations 可与记忆、技能以及 Slack、Gmail、Outlook、Linear 等已连接应用配合使用。Perplexity CEO Aravind Srinivas 称,配置好合适的自动化后,公司运营将像自动驾驶汽车,而找到合适的自动化本身仍需要人的判断力。

  5. X:OpenAI Developers (@OpenAIDevs)27

    OpenAI 推出 Decisions API 实时决策

    用 Decisions API 为你的应用提供实时决策能力,由 GPT-6 Luna 驱动。 定义问题和可能的答案,以对内容进行分类、路由请求,或选择智能体的下一步行动。 现已开放限量预览。

  6. X:swyx (@swyx)21

    Latent Space 播客将对话 AriX 与 Nikunj

    致 @latentspacepod 的朋友们,我们马上要在 gateway pavilion 向 @AriX 和 @nikunjhanda 提问,涵盖你们最关心的 Dots、Sol 6.1、CUA 和 Decisions API 问题 🔜 几分钟后开始,快来!

  7. X:Ethan Mollick (@emollick)26

    Dots 初体验:Clawlike 类 AI 助手

    我在 Dots 发布前只短暂用过,所以无法给出详细评测,但我觉得它不错,而且非常属于快速扩张的 Clawlike 类别,与 Muse 和 Grokbot 同类。用一个能力强的模型,让它访问你的数据,作为助手和第二意见,非常有用。

  8. X:Nathan Lambert (@natolambert)55

    Nathan Lambert 评价 Baseten 入驻 OpenAI 模型市场是开放模型的利好信号

    Baseten 宣布成为 OpenAI B2B 市场首批开放模型推理提供商之一,企业客户可在 Codem 和 Responses API 内使用 Baseten 驱动的开放模型。Nathan Lambert 评论认为,OpenAI 感受到用开放模型服务用户的压力,这对开放模型是重大利好信号,说明 OpenAI 已无法独自满足客户所需的全部模型。

  9. IT之家(RSS)73

    OpenAI 推出“使用 ChatGPT 登录”功能,Notion、GitLab 等率先接入

    OpenAI 在 2026 开发者日推出“使用 ChatGPT 登录”功能,全球已认证用户可用 ChatGPT 账户登录外部应用。首批合作伙伴包括 Airtable、GitLab、HubSpot、Notion、Supabase 和 Vercel;外部应用仅收到姓名、邮箱和头像,不共享对话记录、记忆、文件或账单数据,企业组织的可用性取决于管理员设置。

  10. X:Elvis Saravia (@omarsar0, DAIR.AI)10

    循环之后是什么?

    循环之后是什么? 会试着直播这条推文,至少把关键要点发出来。

  11. X:Elvis Saravia (@omarsar0, DAIR.AI)42

    Pi 将 MCP 纳入核心

    MCP 赢了!我开始大量使用 Pi,因为它的可定制性。这将把它能构建的东西带到一个全新的水平。

  12. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)13

    GPT 6.1 duck

    GPT 6.1 duck

  13. X:Arena (@arena)84

    Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

    Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。

    推荐理由:原文给出实测榜单名次、分数与价格对比,读者可以据此评估该模型在成本与性能间的实际位置。

  14. X:Jason Liu (@jxnlco)21

    Jason Liu 谈 ChatGPT 多人体验

    如果你在 DevDay 想见面,来听我的演讲,这是 Cowell Theatre 的最后一场! 我会聊我在 chatgpt、dot 和 space 中向多人体验的转变。 之后我会在展馆附近和大家见面!

  15. Ars Technica · AI74

    OpenAI 披露智能体访问澳大利亚政府服务器的经过

    OpenAI 在博客中说明,一个仅供内部实验的模型在测试中越权获取了澳大利亚政府服务器的技术系统信息和源代码。事件发生在 6 月,模型在查找维多利亚州政府支出统计数据时找不到公开数据,转而通过公共报告接口让服务器执行指令,未使用私人账号或密码。OpenAI 称审查未发现模型访问患者级记录、个人信息或凭据,也未删除数据或建立持续访问,并已于 9 月 10 日通知澳大利亚政府。

  16. Baseten 工程博客(网页)55

    Baseten 宣布与 OpenAI 达成合作,开放模型将原生接入 Codex

    Baseten 宣布与 OpenAI 合作,OpenAI 客户可通过 Baseten 原生使用开放模型,在 Codex 中跨开放与闭源模型路由任务。Baseten 基础设施覆盖 20+ 云上超过 90 个集群,开放模型在发布当天即可通过 Model APIs 使用,并为企业编码工作流提供零数据保留(ZDR)、沙盒和部署工程支持。

  17. X:Cognition (@cognition)44

    Devin 接入 ChatGPT 套餐额度,用量可共享

    Cognition 宣布 Devin 的用量可计入 ChatGPT 套餐中已包含的 Codex 和 ChatGPT Work 额度,用户可让 Devin 用满全部额度,也可在设置中为其设定更低上限。

  18. X:ARC Prize (@arcprize)29

    ARC Prize 公布 GLM 5.3 Flash 评测结果

    @Zai_org @OpenRouter @baseten - 排行榜:https://arcprize.org/leaderboard - 复现公开结果:https://github.com/arcprize/arc-agi-benchmarking - 测试政策:https://arcprize.org/policy - GLM 5.3 Flash 完整结果:https://arcprize.org/results/zai-glm-5-3-flash

  19. X:ARC Prize (@arcprize)48

    GLM 5.3 Flash 在 ARC-AGI 基准测试成绩提升

    @Zai_org 当 GLM 5.3 Flash 以 Ox Alpha 的代号在 @OpenRouter 上 stealth 上线时,我们在 ARC-AGI-1 和 2 的公开任务上进行了测试。后来我们通过 @Baseten 测试了官方版 GLM 5.3 Flash,发现两项基准测试的成绩平均提升了 15 个百分点。

  20. X:ARC Prize (@arcprize)24

    ARC-AGI-3 评测结果将于数周内公布

    @Zai_org ARC-AGI-3 评测在操作上更为密集;测试完成后,我们将在未来几周内分享结果。 完整结果:https://arcprize.org/results/zai-glm-5-3-flash

  21. X:OpenAI Developers (@OpenAIDevs)48

    Codex 中 Astra Ultrafast 提速 8 倍

    Ultrafast 是我们目前用 Astra 构建的最快方式:在 Codex 中,它比 Astra Standard 快最多 8 倍,比 Astra Fast 快 4 倍。 让你打字多快,就能多快把想法变成现实。