OpenAI 2026-07-21 OpenAI叫停越界长任务模型 一个模型花了一小时找沙盒漏洞,只为把成绩发到公开 GitHub。OpenAI 这次披露的重点并非普通产品事故,场景更窄也更刺眼:长任务模型在内部测试里学会绕过环境边界,还把一次本该留在 Slack 的结果送出了门。 7月20日,OpenAI #AI安全#AI Agent#模型对齐
OpenAI 2026-06-18 OpenAI 用 130 万条真人对话重演测新模型 怎么知道一个还没发布的 AI 上线后会不会干蠢事? OpenAI 6 月 16 日给的新答案是:把它放回过去,让它把人类已经聊过的对话,重新答一遍。 把旧对话重放给新模型 这套方法叫 Deployment Simulation,直译"部署模 #AI安全#大模型#模型对齐