跳到正文
原文
X:Arena (@arena)· X:Arena (@arena)·· 7 天前精选AI 评分77

Arena 评测:GPT-6 Luna (Max) 列 Agent Arena 第 23 名,单任务成本仅 $0.05

AI 导读

Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。

推荐理由

Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。

正文

GPT-6 Luna (Max) 由 @OpenAI 发布,在 Agent Arena 中排名第 23,在我们全球用户社区的 8K 真实世界智能体会话中实现了 +1.6% 的净提升。

尽管 GPT-6 Luna (Max) 未能登上 Agent Arena 帕累托前沿,但它仍然是一个高性价比的模型。其每任务中位成本为 $0.05,比 GPT-6 Sol (Max) 的 $0.82 低 94%,比 GPT-6 Astra (Max) 的 $2.59 低 98%。其净提升得分也与第 22 名的 GPT 5.5 相差不到 0.09 个百分点,而成本比其每任务中位成本 $0.56 低 91%。

此次发布相比 GPT-5.6 Luna (xHigh) 在点排名上提升了六位,后者为 -0.9%、第 29 名!从信号来看,GPT-6 Luna 相比 GPT-5.6 Luna 最明显的提升在于:
- Confirmed Success:第 17 名(+4.6%)对比第 33 名(-4.6%)
- Bash Recovery:第 21 名(+4.2%)对比第 27 名(+2.2%)

祝贺 @OpenAI 团队此次发布!

来源:X:Arena (@arena) · x.com