Trail of Bits publicó el 15 de septiembre un artículo que cuestiona las conclusiones del informe de benchmark de parches de IA de 1Password. 1Password había anunciado una tasa de "corrección limpia" del 26%; Trail of Bits recalculó el mismo conjunto de datos y llegó a otra cifra: de 3.067 parches, 2.634 lograron bloquear con éxito el exploit asociado, es decir, 86%.
Ambas cifras difieren en 60 puntos porcentuales, y la diferencia está en el método de puntuación.
Cuatro fallos señalados
Trail of Bits enumeró cuatro puntos:
- Muestra demasiado estrecha: todo el benchmark se basa en solo seis vulnerabilidades complejas, cuyas tasas de corrección individuales oscilan entre 3% y 60%. Usar su promedio para representar la "capacidad de la IA para parchear" hace que el ruido de la muestra domine sobre la señal real.
- El propio prompt tiene un problema: el 22% de los datos proviene de pruebas en las que se dirigió deliberadamente al agente hacia una corrección equivocada. Ese tipo de prueba mide si el modelo se deja engañar, no si es capaz de corregir bien.
- Herramientas retiradas: en el 36% de las pruebas no se permitía al modelo compilar ni probar el código. Un desarrollador humano, en las mismas condiciones, tampoco rendiría mucho mejor al corregir una falla de seguridad.
- Configuración inconsistente: distintos modelos usaron ajustes de razonamiento diferentes, por lo que las puntuaciones no son comparables entre sí.
El artículo lleva la firma de cuatro autores: Anish Naik, Dan Guido, Benjamin Samuels y Marcelo Morales. Por el momento, 1Password no ha respondido públicamente a este nuevo análisis.
La línea base humana
La parte más convincente del artículo es el grupo de control que aporta. Trail of Bits cita datos según los cuales, en condiciones ideales, la tasa de fallo en el primer intento de un desarrollador al corregir una falla de seguridad ronda el 12,5%, es decir, falla una de cada ocho veces.
Con esta línea base, la afirmación de que "la IA no parchea limpio" adquiere un marco de referencia. Una tasa limpia del 26% suena a suspenso, pero poner el 86% junto a una línea base humana del 87,5% cuenta otra historia: prácticamente empatados, todavía sin superarla.
De paso, Trail of Bits también publicó datos de su propio proyecto Patch the Planet: se enviaron 186 pull requests, se fusionaron 126, una tasa de fusión del 67,7%; de los fusionados, el 72,2% no necesitó una revisión de seguridad adicional. Este conjunto mide algo distinto del benchmark: si un parche es aceptado por mantenedores reales, lo cual está más cerca de un entorno de producción que simplemente bloquear un exploit.
Dos habilidades publicadas de paso
Al final del artículo se anunciaron dos skills para agentes: post-patch-validation, que hace que el agente pruebe y valide su propio parche antes de enviarlo, y review-walkthrough, que ayuda a los ingenieros a repasar los cambios de código en orden lógico.
La existencia misma de estas dos herramientas es en sí una respuesta al benchmark cuestionado. En el 36% de las pruebas se prohibió compilar y probar, y la primera skill que ofrece Trail of Bits es precisamente la validación previa al envío: sugiere que buena parte de la calidad de un parche depende de si el agente tiene o no la oportunidad de autoverificarse.
Qué deben mirar los equipos locales al leer este tipo de benchmarks
Este año numerosas empresas han publicado sus boletines de rendimiento de IA en la corrección de vulnerabilidades, cada una con criterios distintos. Este artículo ofrece una lista de verificación aplicable de inmediato: cuál es el tamaño de la muestra, si hay prompts deliberadamente engañosos mezclados, si se permite al modelo compilar y probar, si la configuración de razonamiento es consistente entre modelos y si existe una línea base humana de comparación. Si falta cualquiera de estos cinco puntos, el porcentaje publicado no debería usarse directamente como criterio de selección.
Algo más práctico para los equipos locales es que estas dos skills se publicaron de forma abierta y pueden incorporarse directamente al propio flujo de revisión de código sin necesitar autorización de nadie. En cuanto a cuánto mejoran las cosas una vez incorporadas, varía demasiado según la base de código, y no hay una respuesta única.
Fuentes: blog oficial de Trail of Bits, CocoLoop, informe de benchmark de 1Password; los cuatro cuestionamientos metodológicos, el recuento de parches 3.067 y 2.634, y los datos de fusión 186/126 de Patch the Planet siguen el artículo original del blog.