Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Arena 于 9 月 26 日分析 Text Arena 高推理回复,发现 Claude Opus 5.5 相比 Opus 5 破折号使用量下降约 95%(每 1,000 个单词从 15.2 个降至 0.8 个),分号下降 73%(从 6.10 个降至 1.64 个)。
两周前 TypeSafe 开创了这一品类,现在市场上已有 6 款决策模型,其中包括 2 款免费模型:https://openrouter.ai/models?output_modalities=decisions
不错 (引用推文核心要点:Grok 4.7 xHigh 在 Artificial Analysis Cyber Index 中排名第一,作为前沿模型在企业网络防御领域表现顶尖,超越 Fable 5.1 Max、Opus 5.5、Astra 6、GPT-6 等领先 AI 系统。)
ElevenLabs 于当地时间周一发布 v4 与 v4 Turbo 两款语音模型,强化情绪表达控制、降低响应延迟,语言支持从 70 种提升至 90 余种,用户仅需 10 秒音频素材即可完成声音克隆。
Arena 宣布 GPT-6 Luna (Max) 进入 Agent Arena Pareto 前沿,净改进 +1.59%,中位成本每任务 $0.05。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
Anthropic 发布新模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同。
Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。
一组 Claude Sonnet 5.5 的早期实验。 @_re_pete 用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器对比。
Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。
推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。
GLM5.3 稀疏注意力如何影响 HBM 内存使用 GLM-5.3、KV Cache Offloading、HiSparse、AgentX TileRT、 InferenceX DeepSeek Sparse Attention、IndexShare、 Single-rollout Asynchronous Optimization、Cybersecurity https://newsletter.semianalysis.com/p/sparse-savings-persistent-demand-inside-glm53
Anthropic 的 Claude Sonnet 5.5 上线 OpenRouter。原文称其明显比 Sonnet 5 更聪明、写作更清晰,且对多数工作负载快约 30%、便宜约 30%。
Anthropic 发布 Claude Sonnet 5.5,Terminal-Bench 4.0 得分 70.6%,远高于 Sonnet 5 的 10.3%,价格维持 $2/$10 每百万输入/输出 token。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二款模型,相比 Sonnet 5 更聪明、高效,运行速度快超 30%,多数工作成本最多低 30%。适合修复 bug、快速迭代功能等范围明确的日常任务,Claude Code 用量也会更耐用。
Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。
Arena 宣布 Anthropic 的 Claude Sonnet 5.5 已进入 Agent Arena,并开放投票。Agent Arena 基于全球用户数百万个真实的长程智能体任务评测模型,模型可使用 web search、filesystem 和 terminal 工具完成复杂工作流,榜单用因果追踪方法衡量模型相对平均模型的结果表现。
推荐理由:Arena 介绍了其 Agent Arena 的评测方式,读者可以据此理解 Claude Sonnet 5.5 在真实智能体任务上的衡量口径。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二个模型。官方称相比 Sonnet 5 运行速度提升超过 30%,多数工作成本最高降低 30%;在 Claude Code 中用户完成的任务量比 Sonnet 5 多约 30%,同样工作所需 token 更少。视频演示中该模型用工具调用完成清理落叶任务,比 Sonnet 5 快 24 秒且少用 6K token。
推荐理由:来自 Claude Code 产品负责人的第一手数据,用具体任务对比说明 Sonnet 5.5 在编码场景的速度与 token 消耗变化。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二款模型,相比 Sonnet 5 提速超过 30%,多数任务成本最多降低 30%。作者 Boris Cherny 用视频演示 Sonnet 5.5 修复 Claude Code 中的一个 bug。
Anthropic 官方发布 Claude Sonnet 5.5,为 Claude 5.5 家族第二款模型。官方称其较 Sonnet 5 快 30% 以上,多数任务成本降低最多 30%,接近 Opus 5.5 的性能,并称其为新的默认模型。附图显示 Artificial Analysis 在预发布部署上测得 Sonnet 5.5 与 Opus 5.5 在 AA-Briefcase v1.1 各努力档位的 Elo 表现接近。
Anthropic 发布 Claude Sonnet 5.5,称为 Claude 5.5 家族的第二款模型,相比 Sonnet 5 是明显升级,运行速度提升超过 30%,多数工作成本最多降低 30%。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快超过 30%,写作更清晰,适合快速往复的日常任务。官方称其擅长修复 bug、制作文档、幻灯片和表格并有较强设计感,而 Claude Opus 5.5 面向需要谨慎判断的复杂工作;Sonnet 5.5 即日起全面可用,Claude Haiku 5.5 将在未来几周加入该系列。
Anthropic 发布 Claude Sonnet 5.5,运行速度比 Sonnet 5 快 30% 以上,写作更清晰,适合快速来回交互。定位上与为复杂判断工作打造的 Claude Opus 5.5 区分,Sonnet 5.5 擅长范围明确的日常任务、修复 bug 以及制作文档、幻灯片和表格。模型即日起全量可用,Claude Haiku 5.5 将在未来几周加入该系列。
Anthropic 官宣 Claude Sonnet 5.5 现已可用,这是 Claude 5.5 家族的第二个模型。官方称相比 Sonnet 5 是明显升级,速度快 30% 以上,多数工作成本最高降低 30%。
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二款模型。官方称其相比 Sonnet 5 是明确升级,运行速度快 30% 以上,且多数任务成本最多降低 30%。
Arena 公布 Claude Opus 5.5 (High) 以 +12.15% 净提升分数进入 Agent Arena 第二名,仅低于 Claude Fable 5.1 (Max)。其每任务中位价格为 $1.31,比同水平低 64%,成本比 Opus 5 (High) 低 40%、比 Opus 5 (Max) 低 56%;分项信号中 Steerability 排名第一(+14.50%)。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。
Anthropic 开始在 Claude 和 API 上推出 Claude Sonnet 5.5。截图显示模型选择列表中 Sonnet 5.5 被标注为“Most efficient for simpler tasks”,同列表还包含 Opus 5.5、Sonnet 5 和需使用额度的 Fable 5.1。
Anthropic 发布中端模型 Sonnet 5.5,官方称其比前代 Sonnet 5 快 30%,token 消耗明显更低。公司基准显示该模型在 agentic 编码上优于 Opus 5.5,并称其具备与 Opus 5 相当的网络安全能力,因此成为首个适用与 Fable 和 Opus 相同网络安全防护的 Sonnet 模型;公司还计划在未来几周发布新版本 Haiku。
Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,输出速度比 Sonnet 5 快 30% 以上,每任务成本最多降低 30%,定价保持输入 $2、输出 $10 每百万 token。
推荐理由:官方发布给出完整基准数据、定价与安全安排,读者可以据此评估它相对 Sonnet 5 和 Opus 5.5 的定位与迁移成本。
Arena 官方宣布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。其中位价格为每任务 $1.31,比 Opus 5 (High) 便宜 40%、比 Opus 5 (Max) 便宜 56%,分项上 Steerability 排名第 1(+14.50%)。
Arena 公布 Claude Opus 5.5 (High) 进入 Agent Arena 排名第 2,净改进分 +12.15%,仅次于 Fable 5.1 (Max)。
推荐理由:榜单给出了 Claude Opus 5.5 (High) 在 Agent Arena 的排名、价格与分项信号,读者可据此权衡它与 Opus 5 各档的成本与能力变化。
Anthropic 发布对智谱 GLM-5.3 网络攻击能力的分析,发现其可自主开发端到端漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
推荐理由:Anthropic 第一手评测给出 GLM-5.3 的漏洞利用成功率和防护绕过数据,读者可据此了解开放权重模型带来的攻击面变化。
OpenAI 发布 GPT-6.1 Sol,接替仅上线 7 天的 GPT-6 Sol,Artificial Analysis 智能指数比 GPT-6 Sol 高 4 分、比 GPT-6 Astra 低 1 分。
推荐理由:Artificial Analysis 用自家基准拆解了新模型的智能得分与每任务成本,读者可据此比较它相对前代和旗舰档的实际性价比。
VoiceArena 推出 Monsoon,一个覆盖 50 种语言、基于 23 国无脚本对话构建的语音数据集。
Artificial Analysis 评测显示,ElevenLabs 的 Eleven v4 在 Provider Voice TTS Arena 排行榜和 Pronunciation Robustness 基准上排名第一。
月之暗面 API 后台模型注册表出现“kimi-k3-1”标识且接口可调用,官方开放平台同步出现 K3.1 预告,支持 1M tokens 上下文窗口。该模型提供 Low、High、Max 三档推理强度,可能引入 Agent 智能体模式、Swarm 多智能体协作及搜索、批处理任务模式,API 价格显示与现有 K3 相同。
社区为 MiniCPM5-2B 构建了 EXL3 4-bit 量化版本,量化后模型权重仅 1.61 GB,在 NVIDIA Tesla T4 上实测约 68–70 tokens/s。该版本采用 4.0 bpw EXL3 量化,支持通过 ExLlamaV3 和 TabbyAPI 进行本地推理。
Artificial Analysis 发布 Cyber Index 与 Cyber Index Alliance,联合 @CollinearAI、@IBM、@nvidia、@vercel 作为启动伙伴,用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三个开放基准评估智能体发现和修复漏洞的能力。