跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)·· 2026-06-04精选AI 评分66

OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔

A Robot is Sprinting Towards You: Do You Want it Running on Claude or Grok?

AI 导读

OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的“大逃杀”挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。

推荐理由

Jacky 把 11 个模型丢进大逃杀,发现 Grok 4.1 Fast 以 27 倍成本优势击败 Sonnet,而获胜关键不在基准分数,在于模型被训练时压制的攻击性。对任何不再只看排行榜选模型的人,这是今年最值得读的实验。

来源:OpenRouter:Announcements(RSS) · openrouter.ai