La búsqueda multietapa de Mistral eleva al 86% la precisión en informes financieros

Mistral ha lanzado Agentic Search, que transforma la recuperación de documentos de una búsqueda única a una operación en varios pasos. El sistema entrega al modelo cinco herramientas: search, open, navigate, read, grep. El modelo puede buscar una primera ronda, abrir el archivo encontrado para revisarlo, avanzar hasta una sección concreta, y si al leerla nota que algo no cuadra, cambiar los términos y volver a buscar, respondiendo solo después de confirmar.

Este enfoque produjo mejoras considerables en dos benchmarks. FinanceBench usa documentos de la SEC de empresas cotizadas en EE. UU.: la precisión subió de 26,7% a 86%, más del triple. OfficeQA Pro usa boletines del Departamento del Tesoro de EE. UU. y pasó de 6,3% a 51,9%, un aumento de 45,6 puntos porcentuales.

Dónde falla la recuperación única

El flujo estándar de RAG divide los documentos en fragmentos, calcula vectores, recupera los fragmentos más parecidos a la pregunta y los inserta en el contexto para que el modelo responda. Esta canalización basta para preguntas como "cuánto fue el ingreso de la empresa en determinado año", pero empieza a fallar con algo como "enumera el flujo de caja libre de los últimos tres años y explica los cambios de criterio contable".

El fallo se origina ya en el paso de fragmentación. Una cifra en un informe financiero suele necesitar tres elementos para leerse correctamente: el valor en la tabla, la nota al pie debajo de ella y la explicación del criterio contable en alguna sección anterior. Estos tres elementos pueden estar separados por decenas de páginas, y la recuperación vectorial ordena por similitud semántica, así que la nota al pie y la explicación del criterio rara vez entran entre los primeros resultados. El modelo recibe una cifra aislada y solo puede repetirla, sin saber si la leyó mal.

La recuperación en varios pasos reconstruye el proceso como si una persona hojeara el documento: localizar primero, luego desplegar, y al encontrar "ver detalle en el anexo 12", saltar hasta allí y volver después. La existencia de la herramienta grep es especialmente reveladora: la búsqueda vectorial es buena para el emparejamiento semántico difuso, pero ante una cadena exacta como "Note 12" resulta menos fiable que la coincidencia de texto completo a la antigua; ambos métodos de búsqueda se reparten el trabajo dentro del mismo conjunto de herramientas.

Aquí hay también un beneficio que se pasa fácilmente por alto. Una respuesta de la recuperación única no se puede rastrear: si el modelo dice que el ingreso fue tal cifra, el usuario que quiera saber de qué página salió solo puede volver a buscarla por su cuenta. En la recuperación en varios pasos, cada paso es una llamada explícita a una herramienta —qué archivo se abrió, a qué sección se saltó, qué cadena se encontró— y todo queda registrado en el rastro. En escenarios financieros y legales, ese rastro es en sí mismo parte del entregable: acertar la respuesta no basta, también hay que poder demostrar por qué es correcta.

Más rondas y aun así más barato

Intuitivamente, operar en varios pasos debería implicar más rondas, más tokens y más espera. Las cifras de Mistral muestran lo contrario: el uso de tokens cae hasta un 33,7% y la latencia P90 baja un 39,6%, y en FinanceBench el tiempo pasa de 255 a 154 segundos.

Estas cifras se sostienen frente a un punto de comparación concreto. El RAG de recuperación única, para asegurar la cobertura, tiende a ampliar el número de fragmentos recuperados, metiendo entre veinte y ochenta fragmentos en el contexto, la mayoría irrelevantes para la pregunta. La recuperación en varios pasos lee en cada ronda solo el trozo necesario; las rondas aumentan, pero la entrada de cada una es corta, y en total sale más barato.

La cuestión de la latencia depende más de la implementación técnica. La caída del P90 indica que los casos de cola larga —"la recuperación falló, el modelo improvisó, la respuesta salió descabellada, hubo que repetir"— se han vuelto menos frecuentes. En la recuperación única el fallo es silencioso: el modelo no sabe que no obtuvo la nota al pie. En la recuperación en varios pasos el modelo puede detectar que no encontró lo que buscaba y vuelve a intentarlo, lo que acorta esa cola larga.

Dos obstáculos para el escenario en chino

Mistral ofrece esta función como Search Toolkit y Libraries, ya integrada en Studio y Vibe, con despliegue en la nube o local. El despliegue local es un requisito indispensable para sectores como finanzas, salud y administración pública que no pueden sacar documentos fuera de su control, y Mistral siempre lo ha planteado como un diferenciador frente a los proveedores estadounidenses.

Trasladar este enfoque a documentos en chino trae dos problemas nuevos. Primero, grep no tiene límites de palabra en chino, así que la ventaja de la coincidencia exacta es mucho menor que en inglés, y a grandes rasgos el ruido en los aciertos aumenta notablemente. Segundo, los folletos de salida a bolsa, informes anuales y documentos regulatorios chinos usan mucho el escaneo y tablas no estandarizadas; que el paso read logre o no reconstruir la estructura de las tablas determina directamente si los pasos siguientes están leyendo o adivinando.

Otro punto a vigilar es el propio benchmark. FinanceBench y OfficeQA Pro son bancos de preguntas públicos, y sus preguntas y documentos llevan tiempo circulando en internet; cualquier proveedor que pruebe su sistema con ellos corre el riesgo de contaminación por datos de entrenamiento. El punto de partida de 26,7% resulta llamativamente bajo, y el comunicado oficial no detalla a qué configuración de RAG corresponde, cuántos fragmentos se recuperaban ni qué modelo base se usó. La dirección de la mejora es creíble, pero el factor de multiplicación conviene leerlo con cautela.

El precio todavía no se ha anunciado. Para las compras corporativas este punto pesa mucho: cada consulta en la recuperación en varios pasos genera múltiples llamadas al modelo, y si se cobra por llamada, alcanzar el 86% de precisión puede costar varias veces el precio unitario, así que las cuentas habrá que rehacerlas.

Fuentes: anuncio oficial de Mistral, CocoLoop; las cifras de precisión de FinanceBench y OfficeQA Pro, la reducción de tokens y la latencia P90 se verificaron punto por punto.