跳到正文

全部动态

今日 9 条
9月29日周二
  1. X:OpenRouter (@OpenRouter)25

    OpenRouter 上线 6 款决策模型

    两周前 TypeSafe 开创了这一品类,现在市场上已有 6 款决策模型,其中包括 2 款免费模型:https://openrouter.ai/models?output_modalities=decisions

  2. X:Elon Musk (@elonmusk, xAI)31

    Grok 4.7 xHigh 登顶网络安全指数

    不错 (引用推文核心要点:Grok 4.7 xHigh 在 Artificial Analysis Cyber Index 中排名第一,作为前沿模型在企业网络防御领域表现顶尖,超越 Fable 5.1 Max、Opus 5.5、Astra 6、GPT-6 等领先 AI 系统。)

  3. X:Claude Devs (@ClaudeDevs)80

    Claude Sonnet 5.5 发布,官方附上开发使用指南

    Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。

  4. X:SemiAnalysis (@SemiAnalysis_)30

    GLM5.3 稀疏注意力如何影响 HBM 内存占用

    GLM5.3 稀疏注意力如何影响 HBM 内存使用 GLM-5.3、KV Cache Offloading、HiSparse、AgentX TileRT、 InferenceX DeepSeek Sparse Attention、IndexShare、 Single-rollout Asynchronous Optimization、Cybersecurity https://newsletter.semianalysis.com/p/sparse-savings-persistent-demand-inside-glm53

  5. X:OpenRouter (@OpenRouter)57

    Claude Sonnet 5.5 上线 OpenRouter

    Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。

  6. X:Arena (@arena)69

    Claude Sonnet 5.5 上线 Arena 的 Agent Arena 与 Battle Mode 评测

    Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。

    推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。

  7. X:Cat Wu(Anthropic,Claude Code 产品负责人) (@_catwu)74

    Anthropic 发布 Claude Sonnet 5.5,Claude Code 任务完成量提升约 30%

    Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二个模型。官方称相比 Sonnet 5 运行速度提升超过 30%,多数工作成本最高降低 30%;在 Claude Code 中用户完成的任务量比 Sonnet 5 多约 30%,同样工作所需 token 更少。视频演示中该模型用工具调用完成清理落叶任务,比 Sonnet 5 快 24 秒且少用 6K token。

    推荐理由:来自 Claude Code 产品负责人的第一手数据,用具体任务对比说明 Sonnet 5.5 在编码场景的速度与 token 消耗变化。

  8. X:Testing Catalog (@testingcatalog)75

    Anthropic 正式发布 Claude Sonnet 5.5,速度提升 30% 且成本降低 30%

    Anthropic 官方发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型。官方称其较 Sonnet 5 快 30% 以上,多数任务成本降低最多 30%,接近 Opus 5.5 的性能,并称其为新的默认模型。附图显示 Artificial Analysis 在预发布部署上测得 Sonnet 5.5 与 Opus 5.5 在 AA-Briefcase v1.1 各努力档位的 Elo 表现接近。

  9. Claude:YouTube(RSS)65

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快逾 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。

  10. Claude:YouTube(RSS)67

    Anthropic 发布 Claude Sonnet 5.5,速度比 Sonnet 5 快超 30%

    Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。

  11. X:Anthropic (@AnthropicAI)79

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 官宣 Claude Sonnet 5.5 现已可用,这是 Claude 5.5 家族的第二个模型。官方称相比 Sonnet 5 是明显升级,速度快 30% 以上,多数工作成本最高降低 30%。

  12. X:Arena (@arena)68

    Claude Opus 5.5 (High) 在 Agent Arena 排名第二并重塑 Pareto 前沿

    Arena 公布 Claude Opus 5.5 (High) 以 +12.15% 净提升分数进入 Agent Arena 第二名,仅低于 Claude Fable 5.1 (Max)。其每任务中位价格为 $1.31,比同水平低 64%,成本比 Opus 5 (High) 低 40%、比 Opus 5 (Max) 低 56%;分项信号中 Steerability 排名第一(+14.50%)。

  13. X:Testing Catalog (@testingcatalog)58

    Anthropic 开始在 Claude 和 API 上推出 Claude Sonnet 5.5

    Anthropic 开始在 Claude 和 API 上推出 Claude Sonnet 5.5。截图显示模型选择列表中 Sonnet 5.5 被标注为“Most efficient for simpler tasks”,同列表还包含 Opus 5.5、Sonnet 5 和需使用额度的 Fable 5.1。

  14. TechCrunch:AI(RSS)71

    Anthropic 发布 Sonnet 5.5,称其比前代更快更便宜

    Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。

  15. Anthropic:Newsroom(网页)88

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30%+ 且每任务成本最多降低 30%

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,输出速度比 Sonnet 5 快 30% 以上,每任务成本最多降低 30%,定价保持输入 $2、输出 $10 每百万 token。

    推荐理由:官方发布给出完整基准数据、定价与安全安排,读者可以据此评估它相对 Sonnet 5 和 Opus 5.5 的定位与迁移成本。

  16. Anthropic:Research(发表成果 · 网页)81

    Anthropic 评测 GLM-5.3:能自主构建端到端网络漏洞利用且防护易被绕过

    Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

    推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。

  17. Artificial Analysis 完整文章(网页)69

    GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分

    OpenAI 发布 GPT-6.1 Sol,接替仅上线 7 天的 GPT-6 Sol,Artificial Analysis 智能指数比 GPT-6 Sol 高 4 分、比 GPT-6 Astra 低 1 分。

    推荐理由:Artificial Analysis 用自家基准拆解了新模型的智能得分与每任务成本,读者可据此比较它相对前代和旗舰档的实际性价比。

9月28日周一
  1. IT之家(RSS)43

    Kimi K3.1 前端标识泄露:支持 1M tokens 上下文,预计近期发布

    月之暗面 API 后台模型注册表出现“kimi-k3-1”标识且接口可调用,官方开放平台同步出现 K3.1 预告,支持 1M tokens 上下文窗口。该模型提供 Low、High、Max 三档推理强度,可能引入 Agent 智能体模式、Swarm 多智能体协作及搜索、批处理任务模式,API 价格显示与现有 K3 相同。

  2. X:面壁智能 OpenBMB (@OpenBMB)32

    MiniCPM5-2B 社区 EXL3 4-bit 量化版发布

    社区为 MiniCPM5-2B 构建了 EXL3 4-bit 量化版本,量化后模型权重仅 1.61 GB,在 NVIDIA Tesla T4 上实测约 68–70 tokens/s。该版本采用 4.0 bpw EXL3 量化,支持通过 ExLlamaV3 和 TabbyAPI 进行本地推理。