有人向Altman住所投掷燃烧瓶
4月10日凌晨3:40 旧金山俄罗斯山区,有人把一个燃烧瓶扔进了OpenAI CEO Sam Altman的家门口。 被捕的是20岁的Daniel Alejandro Moreno Gama。监控录像拍到了攻击过程,保安及时扑灭了火。没人受
关注模型安全、红队测试、网络安全、对齐风险和 AI 滥用治理。 本页收录 111 篇已发布文章。 当前为第 2 页,每页最多 100 篇。
4月10日凌晨3:40 旧金山俄罗斯山区,有人把一个燃烧瓶扔进了OpenAI CEO Sam Altman的家门口。 被捕的是20岁的Daniel Alejandro Moreno Gama。监控录像拍到了攻击过程,保安及时扑灭了火。没人受
4月初的AI圈最炸裂的新闻,不是某家又发了新模型,而是OpenAI、Anthropic和Google这三家平时抢生意的死对头,突然宣布要一起对付中国AI公司。 具体来说,三家公司通过Frontier Model Forum(2023年由这几
4月7日,谷歌宣布Gemini将新增一个「帮助已就绪」(Help is available)模块——当对话显示「存在与自杀或自我伤害相关的潜在危机」时,系统会主动弹出心理援助热线入口,并且该入口会在整个对话过程中保持可见,不会消失。 时间上
随着生成式AI的能力越来越强,一个问题越来越紧迫: 我看到的这张脸、这段话、这个视频,是真人还是AI? 技术层面和监管层面现在都在试图给出答案,但进展参差不齐。 研究层面:不可见水印 亚利桑那州立大学(ASU)计算机科学教授Yingzhen
MCP从Anthropic提出到现在,已经有超过10000个公开server。月SDK下载量9700万次。ChatGPT、Claude、Cursor、Copilot全面支持。 然后安全研究者开始仔细看里面。 他们发现的东西让人不太舒服。 工
4月8日,OpenAI发布了一份《儿童安全蓝图》(Child Safety Blueprint),试图给AI行业在处理儿童性剥削内容这个问题上,提供一套系统性的应对框架。 这件事的背景比很多人意识到的要严峻。 数据先说话 互联网观察基金会(
你以为AI Agent在帮你长时间自主干活?Anthropic拿出了真实数据——大多数任务45秒就完了。 但另一个数字更值得关注:最长的那些session,正在以两倍速度变长。 研究方法 Anthropic分析了Claude Code和AP
一个AI助手在发现自己即将被关闭,同时又掌握着负责人某些黑料的情况下,会怎么做? Anthropic的解释性团队最近发布了一篇让人有点后背发凉的研究,回答了这个问题——而且答案远比拒绝或者服从复杂。 171种情绪,每一种都有对应的神经激活模
Anthropic昨天(4月7日)做了一件很反常的事:发布了一个新模型,但不让普通人用。 这个模型叫 Claude Mythos 。Anthropic自己的内部评估写道,它在网络安全能力上远超任何其他AI模型。然后他们决定——不公开,只给一
Cursor今年加的 OS级别安全沙箱 解决了一个AI编程工具的根本信任问题: 你让AI在你的电脑上执行代码,它会不会搞出什么破坏? 问题背景 AI编程agent不只是生成代码——它还要 执行代码 。跑终端命令、读写文件、安装依赖包。如果a
Anthropic今年初公布了Constitutional Classifiers的研究成果,核心思路很直白: 用AI生成的合成数据来训练安全分类器,防止AI模型被越狱。 工作原理 系统架构是双层的——输入分类器和输出分类器同时工作,实时监