ARC Prize 实测各大 AI 推理系统,ARC-AGI 上没有明显赢家
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,ARC-AGI-2 上则全数近乎失败,最高仅 Claude Opus 4 的 8.6%。文章指出测试时计算扩展方法堆叠可提升准确率但效率大幅下降,ARC-AGI-2 上的一致性差说明前沿系统存在共同局限,AGI 仍需新想法。
推荐理由:官方实测给出了各推理系统在 ARC 上的准确率与成本双轴数据,读者可据此按自身需求选型而非追单一赢家。