AI 网络攻防的竞赛刚被 OpenAI、Google、Anthropic 拉高,微软又把牌桌换了一次。
7 月 27 日,Microsoft AI 发布 MAI-Cyber-1-Flash,并把它放进 MDASH 多智能体漏洞识别与修复系统。微软给出的叙事很直接:顶级安全模型不能只拼一次高分,还要在企业每天扫代码、补漏洞、留审计记录时跑得起。
这篇新闻的钩子不在“微软也有网络安全模型”。它更像一次成本实验:把大多数普通任务交给紧凑模型,把少数难题交给 GPT-5.4,再由 MDASH 这套 harness 调度。
96分背后是一套分工
官方页披露,MDASH 加 MAI-Cyber-1-Flash 在 CyberGym 评测中达到 95.95%,正文里四舍五入写作 96%,比 Anthropic 的 Mythos 高 12 个百分点。配图说明里,其他四个模型的区间落在 83.2% 到 85.6%。
CyberGym 的评测对象是系统能否在大型代码库里推理、定位真实漏洞。微软此前 5 月公布 MDASH 时,曾写过一组老成绩:公开 CyberGym 的 1,507 个真实漏洞任务中达到 88.45%,私有测试驱动里 21 个植入漏洞找出 21 个且零误报,并在 clfs.sys 五年 MSRC 案例上做到 96% recall、tcpip.sys 上做到 100% recall。
新发布把分数从 88.45% 推到约 96%,但微软强调的重点转向成本。官方说,MAI-Cyber-1-Flash 设计目标是高效处理最多 90% 的任务,让 MDASH 只在其余 10% 特别困难的任务上调用更贵的大模型,当前组合里这个大模型是 GPT-5.4。
Satya Nadella 给出的公开说法是:英文原句为 “When combined with MDASH, it delivers world-class performance at 50 percent of the cost of leading models.” 直译成业务语言,就是同样放进 MDASH 后,微软想用一半成本跑到领先模型水平。
小模型真正管的是预算
安全团队每天面对的并非一两个漂亮样例。代码库持续变化,依赖持续更新,攻击者也会自动扫描。微软在官方页里写道:“As the cost of finding a flaw collapses, the old model of security, where you scan occasionally and patch eventually, is now obsolete.” 这句话的中文意思很硬:找漏洞的成本下降后,偶尔扫描、慢慢修补的老办法已经失效。
这正是 MAI-Cyber-1-Flash 的产业位置。它不抢“最强大模型”的名号,目标是安全运营里最贵、最频繁的那部分推理量。若 90% 任务可以由小模型先处理,安全团队就能把预算留给高难漏洞链、补丁验证和误报排查。
微软还把这套机制放进更大的数据闭环里解释。官方列出两组规模数字:Microsoft 每天看到 100 万亿以上安全信号,服务 160 万客户。这些数据不能直接证明模型泛化能力,却能解释为什么微软要把模型、历史漏洞、修复记录和 agent harness 捆在一起卖。
Perception把人留在回路里
同一天出现的另一个名字是 Project Perception。Help Net Security 引述 Microsoft Security 执行副总裁 Hayete Gallot 的说法:英文原句为 “Project Perception brings together signals, context, models and specialized agents into a continuously learning system of defense.” 她后面还强调系统可以以机器速度推理、排序和行动,同时让人类保持控制。
这句话比产品名更有用。微软把 MAI-Cyber-1-Flash 嵌进安全运营系统:多模型、专用 agent、漏洞识别、修复建议、审计和沙箱执行一起出现。
官方页列出的治理配置也很具体:MDASH 为客户提供 基于角色的控制、租户隔离、加密、可审计性,以及 无互联网访问的沙箱执行环境。这几个条件决定它更像企业安全流水线的一部分,而非一个让研究员随手调用的攻击模型。
Project Perception 计划在 2026 年 8 月 3 日进入公开预览,后续还会扩展更多专用安全 agent。这里有一个可验证节点:预览版开放后,企业安全团队能否把“发现漏洞”推进到“验证补丁、关闭风险、留下审计证据”。
竞赛正在从模型榜转向系统榜
把这条新闻放进最近两周的安全 AI 线索里看,方向更清楚。Google 刚发布面向漏洞检测的 Gemini 3.5 Flash Cyber;英国 AISI 和美国 CAISI 也把 Kimi K3 放进攻防评测,显示通用模型榜单和网络攻防能力不能混看。
微软这次给出的新增量,是把“分数”改写成“系统成本”。如果只看 95.95%,它像一次 benchmark 新闻;但把 90%/10% 调度、50% 成本、100+ agents、沙箱和审计放在一起,它讲的是安全 AI 进入企业预算表后的形态。
对中文读者来说,最该盯住两件事。第一,CyberGym 这类漏洞评测会不会成为云厂商安全 AI 的采购指标。第二,国内大模型公司做安全能力时,是否也会从单模型跑分转向模型、数据和 harness 的组合。
微软没有公开 MAI-Cyber-1-Flash 的完整模型参数和训练细节,官方口径里很多数字仍来自自家评测。后续更硬的验证,应看 Project Perception 预览后的真实客户案例、第三方复测,以及这些 agent 在无外网沙箱里处理复杂代码库时的误报率。
网络安全模型的竞争不会停在一张柱状图。企业最后买的,往往是谁能把漏洞发现、修复和责任链条放进可控成本里。
参考来源:Microsoft AI 官方发布、Microsoft Security Blog、Help Net Security、CocoLoop;核验 MAI-Cyber-1-Flash/MDASH 发布口径、CyberGym 95.95%/96% 分数、较 Mythos 高 12 个百分点、50% 成本节省、90%/10% 任务调度、100+ agents、100 万亿日安全信号、160 万客户及 Project Perception 预览计划。