跳到正文
北京时间
原文
Hacker News:AI 热帖· j-bu·· 2 小时前精选AI 评分77

Mistral 发布 Large 4 公开预览版,1 万亿参数将开放权重

Mistral Large 4: "Le Chonk"

AI 导读

Mistral 发布 Mistral Large 4(代号 le Chonk)公开预览版,为 1 万亿参数、490 亿激活参数的原生多模态模型,可试用于 Mistral Studio,权重将于本月底开放。

推荐理由

官方公布了参数规模、多领域基准数字和月底开放权重的安排,读者可据此评估它在开源模型中的位置。

正文 · AI 翻译

Le Chonk 

今天,我们推出 Mistral Large 4 的公开预览版。非官方名称 ML4,非常官方的称呼:le Chonk。ML4 将开放权重性能推向新前沿。你今天就可以在 Mistral Studio 上试用预览版 API。权重将于本月底发布。

前沿性能

ML4 是一个 1 万亿参数的原生多模态模型,拥有 490 亿活跃参数。它是我们迄今为止规模最大、能力最强的模型,并且随着我们不断优化,它仍在快速提升。

该模型在编程、智能体工作流和多模态理解方面展现出卓越性能。它已经达到与全球最强开源模型相竞争的水平,同时显著超越美国和欧洲开发的任何开放权重模型。在网络安全、金融和法律等关键企业工作负载上,我们发现它在开放模型中处于最先进水平。在视觉定位等某些领域,它更进一步,甚至超越了前沿闭源模型。

我们将在本月底发布权重。在此之前,我们正与网络安全领域领袖、经过审核的合作伙伴以及国家主管部门在真实环境中对该模型进行红队测试,他们将以降低的审核强度和扩展的网络能力访问同一模型。

* DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 的分数使用了 Artificial Analysis 在该测试框架公开发布前私下评估的数字,这些结果将在该框架发布后纳入 Artificial Analysis Coding Agent Index。

在欧洲锻造。为 AI 主权而建。

ML4 在 Mistral 位于欧洲的自有数据中心中,使用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练。公开预览版也部署在同一基础设施上。这是我们在基础设施、研究和产品开发方面长期投资的重要里程碑:在关键垂直领域实现最先进性能,通过开放权重交付,旨在让客户掌控自己的 AI。

这在网络安全领域尤为重要,因为提供商层面的拒绝可能会阻碍合法的漏洞研究和事件响应,而在事件处理过程中失去对某项能力的访问本身就可能成为重大安全风险。ML4 将顶级网络性能与开放权重和自部署相结合,使组织既拥有能力,也拥有自主权,能够按照自己的政策开展高级安全工作。

该模型将在全球多个地区提供,包括由 Mistral 端到端运营的欧洲部署,独立于其他数字服务提供商,并受欧洲法律管辖。有趣的是:ML4 训练数据中有很大一部分是多语言的,涵盖 160 多种语言,包括欧盟所有官方语言。 

我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键任务行业的领先企业密切合作来训练 ML4。事实上,该模型使用了我们通过 Mistral Forge 向客户提供的相同训练、定制和 RL 环境。

立即试用

还有更多内容即将到来。在我们努力发布权重的同时,我们将分享有关模型架构、更多基准测试以及我们后训练方法的更多细节。

该模型还将作为新一代专用和优化 Mistral 模型的基础。与此同时,我们邀请您试用预览版 API,并在社交媒体上与我们分享您的反馈。

能力深度解析

网络安全

ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index 上——一项独立评估 AI 模型在真实软件中发现和修复安全漏洞能力的基准——它位列全球前五,并大幅领先于中国以外开发的开源权重模型。在该指数的一项测试中,要求模型复现开源软件中的真实漏洞并加以修补,ML4 得分 82%,是所有模型中最高的。它还能解决 Cybench 中 93% 的挑战,这是一组取自安全竞赛的 40 道练习题,是开源权重模型报告的最高分之一。

这一最高分反映了一项实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多个领先闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。然而,防御软件往往始于证明漏洞真实存在,而这正是闭源模型中的安全过滤器可能阻止的工作。随着威胁行为者越来越多地越狱这些模型以支持攻击性网络活动,这一点变得更加重要:防御者需要能够匹配这些能力、同时不受同样拒绝限制的系统。ML4 可以完成这项工作,其能力超出了它被明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、确定漏洞优先级以及编写检测规则。对于需要主权、可审计的 AI 用于安全运营的组织,它将能够在私有云或本地部署上运行。

ML4 与同类对比:高效推理多样复杂挑战
恶意软件逆向工程:解决分布外调查任务

智能体编程

ML4 在软件工程、代码库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分 61.7%,在 SWE-Atlas-QnA 上得分 59.4%,在 Terminal-Bench 4 上得分 28.3%。其综合 Coding Agent Index 得分为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。

* DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 的分数使用了 Artificial Analysis 在该测试框架公开发布前私下评估的数字,这些结果将在该框架发布后纳入 Artificial Analysis Coding Agent Index。

我们还与 Surge AI 就编码质量进行了一次盲测人工评估:专业标注员在隐藏模型身份的情况下,按 1–5 分制对模型输出进行评分。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。

智能体工作流

ML4 运行通用智能体,能够在复杂工作流中收集信息、使用工具并产出最终交付物。在 AutomationBench 上——涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用的 657 个业务工作流——它得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

它在知识工作实际产出的专业交付物——电子表格、幻灯片和 PDF——上同样出色。在评估长周期知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态

ML4 是我们模型理解图像能力的一次阶跃式提升。它能在复杂文档、图表和自然图像上进行强大的推理,并将视觉能力带入感知至关重要的行业,如工程、制造和地球观测。

该模型还能进一步将视觉定位与智能体能力相结合:从检查千兆像素卫星图像——帮助灾害响应团队在时间紧迫时采取行动——到分析工程图纸——不断放大、检查和验证,直到答案精确无误。在上方我们的演示中,ML4 对密集自然场景进行定位,验证技术图纸中的机械部件,从 PDF 中检索证据,并在海量地理空间图像中扫描最难找到的目标。

尤其在视觉定位方面,我们发现 ML4 是我们测试过的最强模型之一,例如在 Dense 200 上超过 GPT-6-Astra(42% 对 41%)。

科学与数学

ML4 具备强大的科学能力,这源于将 AI 驱动方法与我们的研究人员在数学、物理和化学方面的专业知识相结合。

它非常擅长面向科学任务的智能体编程,例如数据分析、建模和物理现实模拟,这让研究人员能够专注于问题本身,而不是基础设施。在基准测试中,ML4 在开放权重模型中的 SciCode-Verified 上达到最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——这是一项由一系列高级例程构成的复杂多步骤化学任务。

ML4 的数学能力也更强,无论是在形式推理还是应用数学方面。在我们的人工评估中,它比 GLM-5.3 推理得更精确、更有条理,并且能够持续完成长时间、特定领域的应用数学任务,包括与前沿理论物理相关的工作。

这些能力共同使 ML4 成为贯穿整个技术工作流程的强大研究助手——从最初的问题到最终的结果。

SciCode-Verified 测试模型在物理、数学、材料科学和生物学等领域用代码实现复杂科学工作流的能力。 

ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估

知识工作

ML4 是我们面向专业人士日常处理的真实世界任务的最强模型。它可以创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均表现出色。

值得注意的是,我们通过第三方评估机构(vals.ai)在法律和金融代表性任务上对 ML4 进行了评估,发现该模型在这两种情况下都超过了 GPT-6-Astra。在 HarveyAI 的法律智能体基准测试中,ML4 的表现优于所有开源模型。

FinWorkBench 测试模型在真实金融和会计用例中创建/编辑电子表格的能力。

金融分析要求精确性以及从多个来源综合信息的能力,而这一过程在当今许多金融机构中仍然耗时费力。在本演示中,ML4 与其他顶尖开源模型一同应对同一个多步骤企业金融挑战,检索上市公司文件与财务报告,例如可通过 EDGAR 及同等欧洲数据库获取的那些文件。一张动态语义地图追踪每个模型通向解决方案的路径,并高亮沿途检索到的每一份文档。每条轨迹的位置反映了所收集的证据、计算结果以及仍未解决的问题。观众可以跟随调查的展开过程,并比较每个模型在得出最终答案之前所走的不同路径。

模型安全性

ML4 在抵御间接提示注入的鲁棒性基准上已达到饱和,处于开源模型的前沿(与 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 公开的 B3 AI 安全基准上,ML4 抵御了 93.3% 的攻击——我们在竞争者中未见到更高的分数。

ML4 与用户的互动也比我们以往任何模型都更负责任。我们重点展示在 KORA 基准上的结果,ML4 再次在开源模型中处于我们测得的最高分(1.691,最高为 2,标记为“典范”)。 

尤为相关的是,该模型倾向于拒绝有关网络安全的恶意请求。尽管在网络安全基准上表现强劲,该模型对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示的平均拒绝率高于所有开源模型。

人工评估

我们开展了一项内部评估,由编码、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员对 Mistral Large 4 与 GLM-5.3 进行比较。ML4 在 CAD 和 STEM 领域更受青睐,而在金融和编码领域表现与 GLM-5.3 持平或接近。

大规模强化学习

基础模型正在快速进步,我们的后训练也必须跟上步伐。为昨天的模型调优的配方用在今天的前沿模型上会浪费能力,因为曾经将模型推向极限的真实样本已不再如此。我们使用强化学习(RL),因为它能随模型一同适应:我们基于模型自身尝试的结果进行训练,并且可以随着模型变强而提高任务的难度和广度。

我们的 RL 库旨在让新环境易于添加并支持大规模训练。一个共享、可组合的接口允许单次训练运行组合从单轮对话、复杂科学问题求解到安全对齐、事实性和长时程工具使用等各类任务。这些环境共享脚手架和资源,例如代码沙箱、网络搜索和外部 API。同样的可组合性也延伸到验证环节,可根据每项任务的需要组合奖励模型、单元测试、LLM 评判器和静态检查。

在运行时,一个自动扩缩容的 actor 集群会并行生成数万条 rollout,同时模型训练异步进行。生成与训练流水线针对长轨迹进行了优化,支持跨多次压缩、高达数百万 token 的 rollout 预算,同时保持较低的陈旧度。两个阶段中的新颖方法与优化最大限度地减少了离策略漂移,使长时程下的稳定 RL 成为可能。

在我们当前的规模下(3k GPU),单次训练运行每天大约产生 330 亿 token,其中经过过滤和掩码后约有 160 亿可训练补全 token。我们可以直接从训练 rollout 中看到运行进展:随着策略学会解决越来越复杂的任务,训练奖励在多个代表性环境中上升。以下是一些示例。

这些改进并非针对我们训练所用的环境;它们可以迁移到下游评估中,而最终模型的提升归功于两个后训练阶段(监督微调和 RL),如图所示。

接下来是什么

这仅仅是开始。ML4 是我们由 30 亿欧元 D 轮融资所资助的路线图上的第一个里程碑——这是欧洲科技公司有史以来筹集的最大股权融资轮。这笔资金已经在投入使用:我们正在我们自己的欧洲数据中心大幅扩展算力容量,未来几个月还会有更多算力上线。

更多算力意味着更多训练。本次预览背后的强化学习运行仍在进行中,模型没有显示出饱和的迹象——前方仍有巨大的提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计在未来数周和数月内将取得巨大而快速的进步。

我们将在月底发布权重,同时公布更多关于架构、额外基准测试以及我们后训练方法的细节。而 ML4 只是基础:它将作为新一代专用且优化的 Mistral 模型的基础,这些模型专为我们的客户最关心的行业和工作负载而构建。

从此刻起,进展的步伐将会很快。敬请关注。

来源:Hacker News:AI 热帖 · mistral.ai