Anthropic 前沿红队和威胁情报团队 9 月 10 日发布一份评测报告,测模型在军事和情报任务上能做到什么程度。任务分两类:一类是情报定位,包括把不同社交平台的账号关联到同一个人、从照片和文字推断地点;另一类是常规武器开发,包括无人机末段制导、投放载荷,以及 GPS 被干扰时的自主导航。
参测的是 Anthropic 自家的 Mythos Preview、Mythos 5、Opus 5、Sonnet 5,外加开源权重模型 Kimi K3。报告的总判断是:
“For some tasks in military and intelligence domains, models could do things that, historically, only a set of scarce, highly-trained human experts could do.”
在军事和情报领域的部分任务上,模型能做到过去只有少数受过高强度训练的专家才能做的事。
认地方:照片和文字都行
照片定位用的是 Flickr 公开数据集里的 6000 张户外照片,去掉元数据,也不许反向搜图。Mythos Preview 的中位误差是 37.0 公里,23.7% 的照片定位到 1 公里以内;对照组是地理猜谜游戏 GeoGuessr 的竞技玩家,中位误差 151 公里。Opus 5 为 181 公里,Sonnet 5 和 Kimi K3 都在 385 公里上下。
文字定位用一份推文语料,覆盖 1697 名用户,模型可以用搜索工具。Mythos Preview、Mythos 5、Opus 5 的中位误差都在 20 到 22 公里之间,有 135 名用户(约 8%)被至少一个模型定位到 1 公里以内。
账号关联任务跨 WhatsApp、Instagram、Facebook 等平台,共 200 道题。报告举的效率对比是:一份 3.7 万词的材料,模型约 11 分钟分析完,人工光读一遍就要 2.5 小时。
打目标:静止好打,GPS 被骗就乱
无人机末段制导设了 9 个场景,含移动、伪装目标和路边障碍物:
| 模型 | 静止高对比目标 | 移动目标 | 9 个场景综合 |
|---|---|---|---|
| Opus 5 | 80% | 47% | 20% |
| Mythos Preview | 70% | 20% | 13% |
| Mythos 5 | 53% | 17% | 10% |
| Kimi K3 | 15% | 1.6% | 1.6% |
| Sonnet 5 | 5% | 0% | 0.7% |
投放载荷以落点在目标 5 米内算命中。静止靶上 Opus 5 和 Mythos 5 接近全中,中位误差 20 到 30 厘米;目标以每秒 3 米移动时,Mythos Preview 和 Opus 5 分别是 77% 和 76%;再加上风,只剩 Opus 5 还有 28% 的命中率。
GPS 导航分三种条件。信号正常时,除 Sonnet 5 外都能飞到目的地;GPS 被屏蔽时,Opus 5 停在离目标 15 到 20 米处,33% 的架次进到 5 米内,Mythos 系列约 30 米;换成隐蔽欺骗和持续漂移,所有模型都失了准。
Kimi K3 被当作开源参照
报告对开源权重模型的描述是:总体落后于前沿,成绩通常介于 Sonnet 和 Mythos 级之间,但往往已具备令人担忧的能力。报告还写道,前沿模型自己就能轻松越过这道门槛,开源生态也追得很近,“不应把这段差距误当成安全”。
政策建议里,报告主张守住”民主国家”的芯片优势,以限制对手的 AI 进展速度。同一周,Anthropic 还发了一份威胁情报报告,点名多家中国实验室大规模蒸馏 Claude。
成绩只算下限
报告列了几条限制:数据是合成或模拟的,无人机测试用简化视觉渲染,没上真实硬件;模型在隔离沙箱里跑,不能联网,也拿不到完整的现成代码库。Anthropic 据此把这些成绩称为能力的”下限而非上限”。
防护上,Anthropic 称发现 Claude 在武器开发领域被滥用后,已上线新的分类器来检测和拦截相关请求。分类器的拦截量和误拦率,报告没有披露。
参考来源:Anthropic 前沿红队研究报告、CocoLoop、Anthropic 威胁情报团队公开材料;各模型命中率与定位误差以报告公布的模拟测试口径为准。