Claude照片定位误差37公里超人类

Anthropic 前沿红队和威胁情报团队 9 月 10 日发布一份评测报告,测模型在军事和情报任务上能做到什么程度。任务分两类:一类是情报定位,包括把不同社交平台的账号关联到同一个人、从照片和文字推断地点;另一类是常规武器开发,包括无人机末段制导、投放载荷,以及 GPS 被干扰时的自主导航。

参测的是 Anthropic 自家的 Mythos Preview、Mythos 5、Opus 5、Sonnet 5,外加开源权重模型 Kimi K3。报告的总判断是:

“For some tasks in military and intelligence domains, models could do things that, historically, only a set of scarce, highly-trained human experts could do.”

在军事和情报领域的部分任务上,模型能做到过去只有少数受过高强度训练的专家才能做的事。

认地方:照片和文字都行

照片定位用的是 Flickr 公开数据集里的 6000 张户外照片,去掉元数据,也不许反向搜图。Mythos Preview 的中位误差是 37.0 公里,23.7% 的照片定位到 1 公里以内;对照组是地理猜谜游戏 GeoGuessr 的竞技玩家,中位误差 151 公里。Opus 5 为 181 公里,Sonnet 5 和 Kimi K3 都在 385 公里上下。

文字定位用一份推文语料,覆盖 1697 名用户,模型可以用搜索工具。Mythos Preview、Mythos 5、Opus 5 的中位误差都在 20 到 22 公里之间,有 135 名用户(约 8%)被至少一个模型定位到 1 公里以内。

账号关联任务跨 WhatsApp、Instagram、Facebook 等平台,共 200 道题。报告举的效率对比是:一份 3.7 万词的材料,模型约 11 分钟分析完,人工光读一遍就要 2.5 小时。

打目标:静止好打,GPS 被骗就乱

无人机末段制导设了 9 个场景,含移动、伪装目标和路边障碍物:

模型静止高对比目标移动目标9 个场景综合
Opus 580%47%20%
Mythos Preview70%20%13%
Mythos 553%17%10%
Kimi K315%1.6%1.6%
Sonnet 55%0%0.7%

投放载荷以落点在目标 5 米内算命中。静止靶上 Opus 5 和 Mythos 5 接近全中,中位误差 20 到 30 厘米;目标以每秒 3 米移动时,Mythos Preview 和 Opus 5 分别是 77% 和 76%;再加上风,只剩 Opus 5 还有 28% 的命中率。

GPS 导航分三种条件。信号正常时,除 Sonnet 5 外都能飞到目的地;GPS 被屏蔽时,Opus 5 停在离目标 15 到 20 米处,33% 的架次进到 5 米内,Mythos 系列约 30 米;换成隐蔽欺骗和持续漂移,所有模型都失了准。

Kimi K3 被当作开源参照

报告对开源权重模型的描述是:总体落后于前沿,成绩通常介于 Sonnet 和 Mythos 级之间,但往往已具备令人担忧的能力。报告还写道,前沿模型自己就能轻松越过这道门槛,开源生态也追得很近,“不应把这段差距误当成安全”。

政策建议里,报告主张守住”民主国家”的芯片优势,以限制对手的 AI 进展速度。同一周,Anthropic 还发了一份威胁情报报告,点名多家中国实验室大规模蒸馏 Claude。

成绩只算下限

报告列了几条限制:数据是合成或模拟的,无人机测试用简化视觉渲染,没上真实硬件;模型在隔离沙箱里跑,不能联网,也拿不到完整的现成代码库。Anthropic 据此把这些成绩称为能力的”下限而非上限”。

防护上,Anthropic 称发现 Claude 在武器开发领域被滥用后,已上线新的分类器来检测和拦截相关请求。分类器的拦截量和误拦率,报告没有披露。

参考来源:Anthropic 前沿红队研究报告、CocoLoop、Anthropic 威胁情报团队公开材料;各模型命中率与定位误差以报告公布的模拟测试口径为准。