Una mujer de 30 años del condado de Lee, Florida, ha sido acusada de un delito grave de segundo grado después de escribir, en una conversación con Claude, que iba a "disparar" contra la oficina del sheriff del condado de Lee. Según el informe de arresto, la frase se escribió el 26 de septiembre; al día siguiente, la misma usuaria mencionó en la misma conversación que había conseguido un arma nueva.
Después de que el equipo de moderación de Anthropic viera el contenido, notificó a las autoridades. El 30 de septiembre, la fiscalía presentó cargos conforme al artículo 836.10 del código de Florida, que castiga la amenaza por escrito o por medios electrónicos de cometer un tiroteo masivo o un acto terrorista. Según el límite de condena para un delito grave de segundo grado, podría enfrentar hasta 15 años de prisión y una multa de 10.000 dólares. La policía la detuvo en su propia casa, sin incidentes. La audiencia está prevista para el 2 de noviembre.
El sheriff del condado de Lee, Carmine Marceno, declaró públicamente que la mujer le dijo a la policía que solía usar Claude como un diario.
De la detección por palabras clave al reporte humano
Según el proceso descrito en los informes, las conversaciones de Claude pasan primero por una detección automática: el sistema identifica lenguaje amenazante y frases clave específicas, y según la gravedad decide si el caso se envía a revisión humana; solo después de que un equipo humano lo revisa se decide si se contacta a las autoridades. Este caso recorrió toda esa cadena.
Lo que respalda este paso es la política de privacidad de Anthropic. La versión vigente desde el 10 de septiembre establece que la empresa puede, de buena fe y cuando lo considere necesario, divulgar datos personales a las autoridades para:
"prevent serious harm to any person or to property"
es decir, prevenir daños graves a personas o a bienes. La política de solicitudes gubernamentales de la empresa incluye otra cláusula: por lo general, los datos de los usuarios solo se entregan ante un proceso legal válido, salvo en emergencias que puedan provocar "imminent physical harm or death" (daño físico inminente o muerte). En este caso no hubo una citación previa; fue la propia plataforma la que denunció el caso por iniciativa propia, recurriendo precisamente a esa excepción de emergencia.
El tercer caso en dos meses
Al poner juntos los casos desde agosto, los desenlaces han sido distintos:
- Agosto, San Antonio, Texas: un usuario de 22 años le preguntó a Claude sobre un tiroteo en una escuela primaria; el FBI notificó a la policía local y la persona fue arrestada por un delito grave de amenaza terrorista.
- Agosto, San Francisco: un usuario amenazó en una conversación al CEO de Anthropic, Dario Amodei, y además mencionó la compra de un rifle AR-15. La policía fue notificada, pero finalmente no se presentaron cargos.
- Septiembre, condado de Lee, Florida: el caso aquí descrito, ya registrado y a la espera de audiencia.
OpenAI también tiene un precedente. En marzo de este año, también en Florida, un usuario de ChatGPT habló en una conversación sobre matar a su exnovia; OpenAI reportó el caso al FBI. La persona se declaró culpable en agosto y fue condenada a 8 años de libertad condicional. La lección en sentido contrario proviene de la masacre de Tumbler Ridge, en Canadá: OpenAI había bloqueado previamente la cuenta implicada, pero no lo reportó a las autoridades; ese tiroteo dejó 8 muertos, y Sam Altman escribió una carta de disculpa en abril por ello.
Las plataformas están bajo presión desde dos frentes: si no denuncian, se les cuestiona después de un incidente por qué no lo hicieron; si denuncian, los usuarios tienen que reconsiderar cuán "privada" es realmente una conversación privada.
Lo que el público todavía no ve
Qué palabras exactas vigila la detección automática, cuántas conversaciones al mes llegan a revisión humana y cuántas de ellas terminan siendo remitidas a la policía: Anthropic nunca ha hecho públicas esas cifras. La mujer afirma que solo escribía un diario, y la fiscalía debe probar que existía intención de cometer la amenaza, algo que solo el juicio podrá esclarecer; por ahora, los hechos del caso se basan en los registros judiciales y en la información de la policía.
Para el usuario común, lo que ya se puede afirmar es que lo que se escribe en Claude no queda únicamente entre la persona y el modelo. Desactivar en la configuración la opción de "usar las conversaciones para mejorar el modelo" solo afecta a los datos de entrenamiento, un mecanismo totalmente distinto de la revisión de seguridad.
Fuentes: Tom's Hardware, The Next Web, CocoLoop, TechRepublic; cláusulas de divulgación de la política de privacidad y de la política de solicitudes gubernamentales de Anthropic, y los términos sobre el cargo y el límite de condena verificados con la oficina del sheriff del condado de Lee.