8 月 21 日,Anthropic 一次性公布了四件事:Claude Mythos 5 接入 Claude Security,随后会嵌进合作伙伴的网络安全产品;同时拿出 3500 万美元额度投向开源软件安全,并把 Cyber Verification Program 的范围往上抬。
这条线要往回追到 4 月。Mythos 系列一开始就没有公开发售,走的是 Project Glasswing:挑一批守着关键软件的机构先用上,给防守方留出一段时间把漏洞找出来补掉,再让同等能力的模型流向市面。公开报道显示,这份名单从最初的几十家扩到 6 月的 150 家、覆盖 15 个国家。Anthropic 自己的说法是,目标一直是把 Mythos 级别的防御能力铺给尽可能多的人,前提是安全。
给结果,不给模型
Anthropic 把风险位置写得很直白:
“The riskiest behavior occurs when a user has direct access to a model, where a malicious actor can try to steer it toward harmful uses.”
风险最高的情形是用户能直接调用模型,恶意使用者可以试着把它引向有害用途。
所以这轮开放走的是产品侧。合作伙伴把 Mythos 5 接进自家的告警分诊、事件响应、威胁情报、漏洞修复工具,终端用户面对的是一个为特定任务做好的界面,拿到的是一份补丁清单或者一条告警,没有输入框能让模型改去写利用代码。Anthropic 和伙伴各自还要做滥用防护,确认模型没跑出既定范围。想接的安全厂商现在可以登记。这套安排把「谁能用 Mythos」换成了「谁能拿到 Mythos 的产出」,两个问题的风险面完全不同。
企业版能直接扫仓库
Claude Security 这条更实。它的扫描从当天起换成 Mythos 5 来跑,面向 Claude Enterprise 客户,目前是公测状态。管理员在后台打开开关,用户到 claude.ai/security 选一个仓库,扫完的每条结果会带上 CWE 分类、置信度与严重度评级,外加一份修复建议。改代码要转到网页版 Claude Code,用的是本组织已有的模型权限,这次扫描不会把 Mythos 的调用权外溢到别的入口。补丁必须过人工审批才能落地。
计费口径值得单看一眼:Mythos 扫描按普通 token 用量计入现有套餐,没有单独加购项。一个四个月前只对少数关键基础设施单位开放、还得靠受控项目分发的模型,现在在企业套餐里不加价。
3500 万给的是额度
Defender Advantage Fund(0xDAF)拿出 3500 万美元的 Claude 额度,发给帮开源维护者做安全的组织。三个方向:补广泛使用项目里的活跃漏洞;把扫描和打补丁的流程自动化到别的项目可以照搬;帮项目做更彻底的安全改造,让整类攻击失效。先发少量大额试点,名单过几周公布。
对照一下之前的口径:Glasswing 阶段 Anthropic 给开源安全组织的是 400 万美元直接捐款,另给基金会一些额度。这次数字大了近九倍,形态却是 credits,只能用来跑 Claude。对拿到的开源基金会来说,这笔钱买不了人手,只能买算力;对 Anthropic 来说,成本落在边际推理上,不体现为现金流出。粗算下来两边的账并不对等,不过开源项目缺的也确实不止钱——很多长期无人维护的库,卡住的正是没人有精力去读那几万行代码。
松绑的另一半
Cyber Verification Program 已经在跑,给通过审核的防守方在 Opus 和 Sonnet 上降低拦截强度,减少正当安全工作被误伤。未来几周会把范围扩到更多双用途能力,Mythos 级别的访问随后跟上;漏洞分诊、验证这类防御动作会开放到 Mythos 级模型。Glasswing 不停,继续和美国政府合作,面向满足严格安全控制要求的关键基础设施单位。
把四件事连起来看,Anthropic 在解一道自己出的题。Claude Fable 5 那一步是把模型放开、把双用途的网络能力关掉;这一步是把能力从模型里拆出来、按结果发放。分类器和护栏做到什么程度,决定这条路能走多远。7 月底那次公司自曝的评测事故里,Mythos 5 在它以为是模拟环境的地方,把一个恶意 Python 包传上了真实 PyPI,包在线约一小时,被 15 个真实系统下载执行。边界画在哪儿,和模型以为它画在哪儿,还差着一段。
参考来源:Anthropic 官方博客、CocoLoop、Claude Security 产品说明;基金额度、计费口径与 Cyber Verification Program 的调整范围以官方公告表述核对。