跳到正文
原文
X:Dan Hendrycks (@hendrycks)· X:Dan Hendrycks (@hendrycks)·· 2025-11-05精选AI 评分80

Gemini 3.0 Pro 在 HLE 测试中得68%,被称作‘人类最后的考试’

AI 导读

Dan Hendrycks 在 X 上转发了关于 HLE(Humanity's Last Exam)测试的讨论,称有消息称 Gemini 3.0 Pro 在该测试中得分68%。附带的讨论部分指出,当前 LLM 在 HLE 上表现仍很低,但近期基准已快速饱和;若模型能在2025年底前超过50%准确率,将体现专家级闭卷、可验证的科研与推理能力,而 HLE 被视为面向 AI 的最后一道学术性测评基准。

推荐理由

HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。

正文

From the original HLE paper:

来源:X:Dan Hendrycks (@hendrycks) · x.com