跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 2026-07-28精选AI 评分71

Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

Microsoft AI Releases MAI-Cyber-1-Flash: A 5B-Active-Parameter Cyber Model That Pushes MDASH to 95.95% on CyberGym

AI 导读

Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。

推荐理由

微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。

正文 · AI 翻译

MAI-Cyber-1-Flash 是一个带有自注意力和稀疏 Mixture-of-Experts 层的 Transformer。它拥有 137B 总参数,其中 5B 为激活参数,以及 256k 上下文长度。输入和输出均为纯文本。

它是 MAI-Code-1-Flash 的网络安全专用微调版本,后者是已嵌入 GitHub Copilot 和 VS Code 的轻量级智能体编程模型。发布说明将其描述为源自 MAI-Thinking-1 谱系。

基准测试

CyberGym 是一个公开测试套件,包含 1,507 个真实世界漏洞复现任务,取自 188 个 OSS-Fuzz 项目。Microsoft 在 CyberGym 默认的 level 1 配置下进行了评估,该配置提供存在漏洞的源代码和一份高层描述。

MDASH 搭配 MAI-Cyber-1-Flash 与 GPT-5.4 运行时得分 95.95%。Microsoft 称这比 Anthropic 的 Mythos 高出约 12 个百分点,而发布图表显示四个竞争系统的得分介于 83.2% 至 85.6% 之间。

当 Microsoft 于 2026 年 5 月首次 详细介绍 MDASH 时,该测试框架仅使用通用可获得的模型就在 CyberGym 上取得了 88.45% 的成绩。这已经是公开排行榜上的最高分,比排名第二的 83.1% 高出约五个百分点。研究团队直白地说明了这一提升:将 MDASH 中 80% 的现有模型替换后,该测试框架的得分从 88.4% 提升至 95.95%。

为什么路由才是真正的产品

MDASH 通过五个阶段管理超过 100 个专用智能体:准备、扫描、验证、去重和证明。审计智能体标记发现项,辩论智能体就可利用性展开争论(将分歧作为信号),而证明阶段则针对 C/C++ 目标使用 ASan 执行触发输入。

为了大规模控制前沿模型的成本,MAI-Cyber-1-Flash 处理了 高达 90% 的 MDASH 任务,并将最难的 10% 升级交由 GPT-5.4 处理。相比此前由 GPT-5.4、5.4 mini 和 5.3 codex 组成的配置,这种路由方式带来了 50% 的成本节省。

MDASH 由微软的 Autonomous Code Security (ACS) 团队开发,团队成员来自赢得 DARPA AI Cyber Challenge 的 Team Atlanta。今年 5 月,MDASH 辅助的工作在 Windows 网络与身份验证栈中发现了 16 个 CVE(其中包括四个严重的远程代码执行漏洞)。回顾性地看,它在五年时间窗口内找回了 28 个 MSRC 案例中 96% 的 clfs.sys 相关问题,以及 7 个案例中 100% 的 tcpip.sys 相关问题。

性能

研究团队展示了来自轻量级终端测试框架的独立结果:

基准测试MAI-Cyber-1-Flash
CVEBench0.314
CyberSecEval4 — 威胁情报0.553
CyberSecEval4 — 恶意软件分析0.33
CRSBench0.651(POV=1200)
ExploitGym — 内核 / 用户空间 / 浏览器0 / 0 / 0

ExploitGym 上清一色的零是刻意为之,而非缺陷。Microsoft 团队表示,该模型被训练用于执行防御性任务,例如修补漏洞,而非部署恶意软件等攻击性任务。一个无法生成漏洞利用、却能驱动 95.95% 发现流水线的 5B 激活参数模型,恰恰是纯防御型产品所需要的产物。

如何使用

核心要点

  • MAI-Cyber-1-Flash 总参数量 137B / 激活参数 5B,是 MAI-Code-1-Flash 的稀疏 MoE 微调版本,上下文窗口为 256k。
  • CyberGym 上的 95.95% 是系统得分——由 MDASH 加上新模型再加上 GPT-5.4 共同取得,较 2026 年 5 月的 88.45% 有所提升。
  • 它能处理多达 90% 的 MDASH 任务,并将剩下 10% 的难题升级交由 GPT-5.4 处理,据称可降低成本 50%。
  • ExploitGym 得分按设计为 0/0/0——该模型只修补漏洞,不编写漏洞利用程序。
  • 访问受到限制

来源:MarkTechPost(RSS) · marktechpost.com