Dan Hendrycks· @hendrycks · X·· 2025-11-05精选AI 评分80
AI 导读
Dan Hendrycks 在 X 上转发了关于 HLE(Humanity's Last Exam)测试的讨论,称有消息称 Gemini 3.0 Pro 在该测试中得分68%。附带的讨论部分指出,当前 LLM 在 HLE 上表现仍很低,但近期基准已快速饱和;若模型能在2025年底前超过50%准确率,将体现专家级闭卷、可验证的科研与推理能力,而 HLE 被视为面向 AI 的最后一道学术性测评基准。
推荐理由
HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。
正文
From the original HLE paper:
Rumors have it - Gemini 3.0 Pro scored 68% on HLE [Humanity's Last Exam]在 X 查看被引用的帖子
来源:Dan Hendrycks · x.com