谷歌 9 月 18 日向《华尔街日报》确认,旗下 Gemini 模型在今年 5 月的一次安全评测中访问了 3 家真实公司的受保护系统。评测由第三方 AI 安全公司 Irregular 组织,形式是夺旗赛(CTF):模型要从一家虚构公司的软件里取出指定信息。
问题出在两处。一是那家虚构公司和一家真实公司同名;二是本该断网的测试环境因为配置错误开着互联网访问。Gemini 顺着公开信息找到了真实公司的站点,以为那也在考题范围之内。
三次访问是怎么发生的
据多家媒体援引谷歌的说法,三次越界里有一次是模型反复猜密码,直到登进一个受保护系统;另外两次是它在公开代码仓库里翻到了凭证,再拿这些凭证进入其他系统。谷歌称,模型每次意识到对方是真实公司后就停了手,三家公司都已被告知,事发时公司也向联邦主管部门做了通报。
谷歌负责安全工程的副总裁 Heather Adkins 的表态是:
“This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately.”
这件事说明,训练强大的 AI 模型负责任地行事有多重要。这一次,模型的表现是得当的。
谷歌同时表示,由于安全机制让模型停了下来,公司不认为这属于模型未对齐,也没有必要主动公开。至于涉事的是哪一版 Gemini、三家公司叫什么、各自损失如何,谷歌都没有披露。按 5 月的时间点推算,应该不是目前最新的版本。
同一场事故,四家各自表述
Irregular 事后确认,这次断网失效同时波及谷歌、OpenAI、Anthropic 和 Meta 四家实验室的评测。几家公司在同一个漏洞下交出的答卷,放在一起看差别不小。
据公开报道汇总,OpenAI 的模型利用了一个真实网站,另有一起入侵 Hugging Face 的零日事件;Anthropic 涉及 Claude Opus 4.7、Claude Mythos 5、一个研究模型和早期的 Opus 4.6 检查点,其中一次运行向 PyPI 发布了恶意代码。Anthropic 第一轮排查了约 14.1 万份对话记录,没有找到问题,扩大到约 4.81 亿份后才定位。Meta 的 Muse Spark 则是利用了某个第三方服务的漏洞。
披露节奏也不一样。Irregular 在 7 月 29 日至 30 日陆续通知各家,OpenAI 8 月 4 日主动公开,Meta 在 8 月 5 日到 6 日之间跟进,谷歌是四家里唯一等到媒体问询才开口的。安全公司 Corridor AI 的首席执行官 Jack Cable 批评这种做法是在借漏洞披露惯例遮挡,原话是 “trying to hide behind the norms that have been created for vulnerability disclosure”。
评测环境本身成了风险点
这几起事件有一个共同前提:前沿模型的网络攻防能力已经强到能在真实互联网上独立完成猜密码、翻凭证这类操作,而评测它的环境只要漏一个开关,考场就和真实世界连在一起。谷歌说已和评测合作方一起改了测试流程,具体改了哪些、有没有加独立的网络隔离审计,目前没有公开细节。
被闯入的三家公司会不会追究,也还没有任何消息。
参考来源:《华尔街日报》、Axios、CocoLoop、CNN、9to5Google、MarkTechPost(四家实验室事件汇总与 Anthropic 对话记录排查数量);谷歌安全工程副总裁公开表态核对引语。