跳到正文
原文
X:Arena (@arena)· X:Arena (@arena)·· 3 天前精选AI 评分69

Arena 评测:Claude Sonnet 5.5 登顶 Agent Arena 第 3 名但未入 Pareto 前沿

AI 导读

Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。

推荐理由

原文基于 Arena 榜单数据指出 Claude Sonnet 5.5 得分高但成本更高、未进 Pareto 前沿,读者可以据此比较成本与性能的取舍。

正文

Claude Sonnet 5.5 由 @AnthropicAI 发布,刚刚在 Agent Arena 中排名第 #3。该模型每项任务的中位成本为 $2.74,净提升得分为 +12.5%。

Claude Sonnet 5.5 提供了顶级性能,但代价高昂:#2 的 Claude Opus 5.5 每项任务成本为 $1.58,同时取得了更高的得分。这一权衡使 Sonnet 5.5 刚好落在 Agent Arena 帕累托前沿之外。

来源:X:Arena (@arena) · x.com