Llega el agente de búsqueda de código abierto Iris: gestionar el contexto gana a apilar parámetros

AllSpark Research ha publicado en Hugging Face los pesos de dos agentes de búsqueda bajo el nombre Iris. El más pequeño, Iris-mini, se entrenó a partir de Qwen3.6-35B-A3B y tiene 35.000 millones de parámetros en total, de los cuales 3.000 millones se activan durante la inferencia; el más grande, Iris-pro, parte de Qwen3.5-397B-A17B, con 397.000 millones de parámetros en total y 17.000 millones activos. Ambos son modelos de mezcla de expertos con una ventana de contexto de 256K, los pesos se publican bajo licencia Apache 2.0 y el informe técnico correspondiente se subió a arXiv el 3 de septiembre.

La diferencia entre un agente de búsqueda y un modelo de conversación normal está en que debe decidir por sí mismo qué buscar, si conviene seguir buscando tras ver los resultados y cuándo la evidencia ya es suficiente para detenerse. Este terreno ha estado dominado en los dos últimos años básicamente por productos de código cerrado; en el lado del código abierto había poco con qué comparar.

Los resultados en cuatro pruebas de referencia

El artículo presenta cuatro benchmarks: BrowseComp, BrowseComp-ZH, DeepSearchQA y HLE. Iris-mini obtiene 82,2, 84,8, 86,9 y 52,3 puntos; Iris-pro logra 88,6, 85,1, 92,9 y 56,4, donde DeepSearchQA se calcula por F1. Ambos modelos alcanzan los mejores resultados conocidos para agentes de búsqueda de código abierto dentro de su categoría de parámetros, y la mayor brecha aparece en BrowseComp.

Hay un dato que resulta poco intuitivo: en BrowseComp-ZH, en chino, el modelo pequeño de 35.000 millones de parámetros obtiene 84,8 puntos y el grande de 397.000 millones logra 85,1, solo 0,3 puntos de diferencia. Ese mismo par de modelos, en el BrowseComp en inglés, difiere en 6,4 puntos. En la prueba en chino, el mayor tamaño de parámetros casi no aportó nada.

Otra comparación del artículo deja más clara la causa. El equipo probó tres estrategias de gestión del contexto durante la inferencia: no hacer nada; «discard-all» (cuando el contexto supera un umbral, se borra todo el historial acumulado de llamadas a herramientas y se retoma desde la pregunta original); y «retry» (se resumen las pistas ya descartadas antes de continuar). Con la gestión de contexto activada, ambos modelos mejoran, y Iris-mini mejora más que Iris-pro. Es decir, para los modelos pequeños, controlar ese historial de búsqueda que no deja de crecer resulta más eficaz que simplemente añadir parámetros.

Los datos de entrenamiento, deducidos a partir de hipervínculos

Las preguntas de búsqueda multisalto son las más difíciles de crear. Escribir a mano una pregunta que solo se pueda responder recorriendo tres o cuatro páginas web resulta carísimo y, además, es fácil de eludir mediante coincidencia de cadenas de texto: si el enunciado deja algún nombre propio, el modelo solo tiene que buscarlo para dar directamente con la página de la respuesta.

El método de Iris invierte el proceso: primero elige una página semilla a partir de la estructura de hipervínculos de un corpus web, sigue sus enlaces salientes para destilar un grafo de entidades, compone sobre ese grafo cadenas de varios saltos y, por último, reescribe el enunciado para asegurarse de que ninguna pista pueda resolverse por coincidencia literal.

El entrenamiento en sí sigue lo que el artículo llama «SFT-RL climbing», alternando ajuste fino supervisado y aprendizaje por refuerzo. La fase de aprendizaje por refuerzo se ejecuta contra la búsqueda real, no sobre capturas offline; tanto el modelo de recompensa que puntúa como el módulo que resume las observaciones se despliegan dentro del propio clúster de entrenamiento. Esta configuración implica que cada paso del entrenamiento lanza peticiones de red reales, lo que no sale barato en términos de ingeniería.

Our policy is optimized by RL against live search.
(Nuestra política se optimiza mediante aprendizaje por refuerzo contra la búsqueda en tiempo real.)

El código abierto por fin tiene un rival a la altura

Visto en conjunto, los modelos abiertos ya casi han alcanzado a los productos cerrados en conversación general y en código; la búsqueda es el terreno donde más rezagados van. La razón no es difícil de entender: la capacidad de un agente de búsqueda reside mitad en el modelo y mitad en el marco de orquestación de herramientas que lo rodea; los productos cerrados afinan ambas partes a la vez, mientras que el código abierto suele publicar solo el modelo, sin el marco.

Esta vez Iris ha dejado claros a la vez los pesos del modelo, la estrategia de gestión del contexto y el método de construcción de datos; el código del pipeline de entrenamiento aparece marcado como «próximamente». Entre los agradecimientos del repositorio de GitHub figuran los proyectos MiroThinker, Relax, ms-swift y slime, los dos primeros también intentos de código abierto en agentes de búsqueda del último año.

El informe compara a Iris con modelos cerrados como GPT-5.5 Pro y Gemini 3.1 Pro en la misma tabla de BrowseComp, pero el texto del artículo limita la afirmación de «liderazgo dentro de su categoría» al ámbito del código abierto, y las cifras detalladas de esos modelos cerrados no se desarrollan en el resumen. Otro dato que tampoco se hace público es la afiliación institucional del equipo AllSpark Research: informaciones públicas lo relacionan con una plataforma de contenidos china, pero ni la página de arXiv ni el repositorio de GitHub especifican la entidad, y las páginas personales de los nueve autores tampoco lo indican.

Para quien quiera poner en marcha su propio sistema de búsqueda profunda, la configuración de 35.000 millones de parámetros con 3.000 millones activos resulta un tamaño adecuado, y combinada con la gestión de contexto descrita en el artículo puede ejecutarse en una sola máquina. El alcance de la licencia Apache 2.0 también deja margen suficiente para el uso comercial.

Fuentes: artículo de arXiv 2609.04304, repositorio AllSpark-Research/Iris, CocoLoop, página del modelo en Hugging Face; los resultados de las cuatro pruebas de referencia y los parámetros de ambas versiones del modelo siguen las tablas del artículo.