Dan Hendrycks· @hendrycks · X·· 2025-11-26精选AI 评分78
AI 导读
AI 安全研究者 Dan Hendrycks 在 X 上发布对 Claude Opus 4.5 与 Google Gemini 3 的横向评测,包含文本、视觉与安全三个维度的指数得分。结果显示:在控制推理令牌数后,两者文本能力相当;Gemini 3 在图像/视觉任务上显著领先;而 Opus 在对抗性测试(如越狱、诚实性)中表现更优。图表显示了 7 模型的文本能力(Gemini 3 Pro 47.6 领先)、视觉能力(Gemini 3 Pro 57.1 最高)及安全指数(Opus 33.6 最低,即最安全)。
推荐理由
该评测由知名 AI 安全研究者主导,数据维度全面(文本、视觉、安全),且直接对比当前头部模型,为读者提供了可量化的横向参考;尤其安全指标反常识(越低越好),有助于理解“能力”与“安全性”的权衡,对选型和风险评估有实用价值。
正文 · 原文
How does Claude Opus 4.5 compare to Gemini 3?
- Reasoning/Text: Gemini 3 ≈ Opus, controlling for the number of reasoning tokens
- Multimodal: Gemini 3 > Opus on vision/image inputs by a large margin
- Safety: Capabilities ≠ Safety. Opus > Gemini on jailbreaks, honesty, etc.
来源:Dan Hendrycks · x.com