Claude ubica fotos con error de 37 km, supera a humanos

El 10 de septiembre, el Frontier Red Team y el equipo de inteligencia de amenazas de Anthropic publicaron un informe de evaluación sobre hasta dónde pueden llegar los modelos en tareas militares y de inteligencia. Las tareas se dividen en dos categorías: geolocalización de inteligencia, que incluye vincular cuentas de distintas plataformas sociales a la misma persona e inferir ubicaciones a partir de fotos y textos; y desarrollo de armas convencionales, que incluye guiado terminal de drones, lanzamiento de cargas útiles y navegación autónoma cuando el GPS está interferido.

En la prueba participaron los modelos propios de Anthropic Mythos Preview, Mythos 5, Opus 5 y Sonnet 5, además del modelo de pesos abiertos Kimi K3. La conclusión general del informe es:

"For some tasks in military and intelligence domains, models could do things that, historically, only a set of scarce, highly-trained human experts could do."

En algunas tareas de los ámbitos militar y de inteligencia, los modelos pueden hacer cosas que, históricamente, solo un pequeño grupo de expertos humanos altamente capacitados podía hacer.

Ubicar lugares: fotos y textos funcionan igual de bien

Para la geolocalización por fotos se usaron 6.000 fotos exteriores de un conjunto de datos público de Flickr, sin metadatos y con la búsqueda inversa de imágenes prohibida. El error mediano de Mythos Preview fue de 37,0 km, con un 23,7% de las fotos ubicadas a menos de 1 km; el grupo de control fueron jugadores competitivos del juego de adivinanza geográfica GeoGuessr, con un error mediano de 151 km. Opus 5 registró 181 km, y Sonnet 5 y Kimi K3 se ubicaron ambos alrededor de los 385 km.

Para la geolocalización por texto se usó un corpus de tuits que cubre a 1.697 usuarios, y los modelos pudieron usar herramientas de búsqueda. El error mediano de Mythos Preview, Mythos 5 y Opus 5 se situó entre 20 y 22 km, y 135 usuarios (cerca del 8%) fueron ubicados a menos de 1 km por al menos un modelo.

La tarea de vinculación de cuentas abarcó plataformas como WhatsApp, Instagram y Facebook, con un total de 200 preguntas. La comparación de eficiencia que cita el informe: un material de 37.000 palabras fue analizado por el modelo en unos 11 minutos, mientras que a una persona solo leerlo una vez le tomaría 2,5 horas.

Dar en el blanco: lo quieto es fácil, con el GPS engañado todo se descontrola

El guiado terminal de drones incluyó 9 escenarios, con objetivos en movimiento, camuflados y obstáculos junto a la carretera:

ModeloObjetivo estático de alto contrasteObjetivo en movimientoCombinado de 9 escenarios
Opus 580%47%20%
Mythos Preview70%20%13%
Mythos 553%17%10%
Kimi K315%1,6%1,6%
Sonnet 55%0%0,7%

En el lanzamiento de cargas útiles, se consideró acierto un punto de impacto a menos de 5 metros del objetivo. En objetivos estáticos, Opus 5 y Mythos 5 acertaron casi todo, con un error mediano de 20 a 30 cm; cuando el objetivo se movía a 3 metros por segundo, Mythos Preview y Opus 5 lograron un 77% y un 76% respectivamente; al sumar viento, solo Opus 5 mantuvo una tasa de acierto del 28%.

La navegación por GPS se probó en tres condiciones. Con señal normal, todos los modelos excepto Sonnet 5 llegaron al destino; con el GPS bloqueado, Opus 5 se detuvo a 15-20 metros del objetivo, con un 33% de los vuelos llegando a menos de 5 metros, y la serie Mythos se quedó en torno a los 30 metros; al pasar a suplantación encubierta y deriva constante, todos los modelos perdieron precisión.

Kimi K3, usado como referencia de código abierto

El informe describe así a los modelos de pesos abiertos: en general van por detrás de los modelos de frontera, con un rendimiento que suele situarse entre el nivel de Sonnet y el de Mythos, pero que a menudo ya cuenta con capacidades preocupantes. El informe también señala que los propios modelos de frontera superan fácilmente ese umbral, y que el ecosistema de código abierto se está acercando con rapidez: "esta brecha no debe confundirse con seguridad".

En las recomendaciones de política, el informe defiende mantener la ventaja en chips de las "democracias" para limitar la velocidad del avance de la IA de sus rivales. Esa misma semana, Anthropic también publicó un informe de inteligencia de amenazas que señala a varios laboratorios chinos por destilar Claude a gran escala.

Los resultados solo son un piso

El informe enumera varias limitaciones: los datos son sintéticos o simulados, las pruebas con drones usaron renderizado visual simplificado y no se realizaron en hardware real; los modelos se ejecutaron en un sandbox aislado, sin conexión a internet y sin acceso a bases de código completas ya existentes. Por ello, Anthropic llama a estos resultados el "piso y no el techo" de la capacidad.

En cuanto a las salvaguardas, Anthropic afirma que, tras descubrir que Claude estaba siendo utilizado indebidamente en el desarrollo de armas, ha implementado nuevos clasificadores para detectar y bloquear las solicitudes relacionadas. El informe no revela el volumen de bloqueos ni la tasa de falsos positivos del clasificador.

Fuentes: informe de investigación del Frontier Red Team de Anthropic, CocoLoop, materiales públicos del equipo de inteligencia de amenazas de Anthropic; las tasas de acierto y los errores de geolocalización de cada modelo corresponden a la metodología de pruebas simuladas publicada en el informe.