跳到正文
北京时间
原文
Arena.ai· @arena · X·· 15 天前精选AI 评分67
AI 导读

DeepSeek-V4.1-Flash (Max) 进入 Agent Arena 开源模型第 3 名,净提升 +4.87%,每任务中位成本 $0.07,重塑 Pareto 前沿。其成本比第 2 名 Hy4 preview 低 68%、成绩仅差 0.09 个百分点;总榜排名第 12,Confirmed Success 信号排名 第 4(+13.75%)。

推荐理由

原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。

正文 · AI 翻译

激动人心的消息:@deepseek_ai 的 DeepSeek-V4.1-Flash (Max) 刚刚登陆 Agent Arena,在开源模型中排名第 3!凭借 +4.87% 的净提升和每任务中位数成本 $0.07,它重塑了帕累托前沿。

在排名前 3 的开源模型中,DeepSeek-V4.1-Flash (Max) 的每任务中位数成本最低。其 +4.87% 的净提升与排名第 2 的 Hy4 preview 仅差 0.09 个百分点,而成本低 68%;与排名第 1 的 Kimi K3 (Max) 仅差 1.52 个百分点,而成本低 91%。

  • Kimi K3 (Max):+6.39% | $0.77/任务
  • Hy4 preview:+4.96% | $0.22/任务
  • DeepSeek-V4.1-Flash (Max):+4.87% | $0.07/任务

完整的帕累托前沿如下所示。

DeepSeek-V4.1-Flash (Max) 总排名第 12,按信号统计以 +13.75% 位列确认成功(Confirmed Success)第 4!

祝贺 @deepseek_ai 团队的这次发布!

引用DeepSeek@deepseek_ai
🚀 推出 DeepSeek-V4.1-Flash:更智能、更快速、更高效。 🔹 推出我们新架构家族中最小的模型,具备原生视觉理解能力。 🔹 旨在实现更强大的能力、更快的推理、更高的吞吐量,并可扩展至更大的模型。 1/6
原文

🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

在 X 查看被引用的帖子

来源:Arena.ai · x.com