El laboratorio chino AllSpark ha presentado Iris-mini e Iris-pro, dos agentes de búsqueda de pesos abiertos (el modelo entrenado se puede descargar y usar en equipos propios) que, según el equipo, ofrecen los mejores resultados dentro de su clase de tamaño frente a otros modelos open-weight. Según recoge The Decoder, el lanzamiento incluye también una receta de entrenamiento completa.
Los agentes de búsqueda basados en modelos de lenguaje investigan la web por su cuenta: tienen que entender la pregunta, decidir qué buscar, interpretar los resultados y juzgar cuándo ya han reunido pruebas suficientes. Cuánto de eso hacen realmente los modelos es objeto de debate, porque en los benchmarks habituales los sistemas líderes suelen usar la web solo para confirmar conocimiento que ya tenían de su entrenamiento.
Iris-mini tiene 35.000 millones de parámetros e Iris-pro, 397.000 millones
Iris-mini construye sobre Qwen3.6-35B-A3B e Iris-pro sobre Qwen3.5-397B-A17B, y ambos trabajan con una ventana de contexto de 256.000 tokens. Según el equipo, entregan los resultados más fuertes entre los agentes de búsqueda de pesos abiertos en sus respectivas categorías de tamaño.
La canalización de entrenamiento construye las tareas al revés: parte de una página semilla y sus enlaces salientes para levantar un grafo de términos y relaciones, y de ahí genera una pregunta de varios pasos cuya respuesta exige encadenar varios eslabones conectados. Todos los términos salvo la respuesta final se sustituyen por paráfrasis, de modo que ninguna pista se resuelve con una búsqueda de texto simple. Solo entran en el conjunto de datos las preguntas que un modelo de referencia no puede resolver sin herramientas pero sí con las fuentes adecuadas.
Un filtrado en dos rondas descarta los datos de entrenamiento defectuosos
Un modelo profesor más potente genera caminos de solución hechos de razonamiento, consultas de búsqueda y resultados. Esos caminos pasan por dos rondas de filtrado: la primera revisa la corrección, los bucles de repetición y la profundidad de búsqueda del camino completo; la segunda es una revisión paso a paso hecha por un modelo juez cuyos criterios, según el artículo, se derivaron de los propios datos y no se fijaron a mano. Después, el modelo se mejora mediante aprendizaje por refuerzo contra una búsqueda web en vivo, en un proceso que los autores llaman «SFT-RL climbing»: las tareas más difíciles resueltas y los caminos de solución más eficientes de cada ronda realimentan el ciclo siguiente.
La gestión del contexto puede pesar más que las diferencias entre modelos
El equipo sostiene que, en los benchmarks habituales, la forma en que se gestiona el contexto durante la ejecución a menudo marca más diferencia que las brechas que se reportan entre sistemas. Durante sesiones de investigación largas, el contexto puede llenarse antes de que el agente resuelva todas las subpreguntas, y trucos como descartar el historial de la conversación alargan la investigación de forma artificial sin decir mucho sobre la calidad real del modelo. Para aislar el efecto, el equipo probó cada benchmark con y sin gestión de contexto, manteniendo fijas las herramientas, los límites de contexto y el modelo juez. Las puntuaciones de Iris proceden de un único agente, sin agentes auxiliares ni pasos de verificación adicionales al final.
Las pruebas cubrieron cuatro benchmarks: BrowseComp, BrowseComp-ZH, DeepSearchQA y Humanity’s Last Exam. Con la gestión de contexto activada, Iris-mini obtiene 82,2, 84,8, 86,9 y 52,3 puntos, mientras que Iris-pro llega a 88,6, 85,1, 92,9 y 56,4, según el artículo. En su categoría, Iris-mini lidera en tres de los cuatro benchmarks y supera al siguiente mejor modelo, XYZ-Aquila-mini, por 3,4 puntos en BrowseComp, aunque queda por detrás en DeepSearchQA. La gestión de contexto tiene un efecto mucho mayor sobre el modelo pequeño, con mejoras de hasta 21,2 puntos en BrowseComp, y la razón no es un presupuesto de tokens menor sino un consumo más rápido: Iris-mini necesita más pasos para las mismas tareas y alcanza antes el límite de contexto.
Un caso donde el propio equipo admite que la referencia estaba mal
En un apéndice, el equipo describe un caso de BrowseComp-ZH sobre la serie «Juego de Tronos»: el agente respondió «Bolton» pero la referencia decía «Lannister», cuando el personaje en cuestión, Sansa Stark, se casa en segundas nupcias con Ramsay Bolton. El equipo reconoce que la respuesta del agente era correcta y dice que contradicciones así entre la referencia y el material fuente les motivan a construir mejores benchmarks.
Más allá de la búsqueda, los autores reportan un efecto inesperado: tanto los datos generados como los modelos especializados mejoraron el rendimiento en tareas para las que nunca se entrenaron, incluido el uso general de herramientas y trabajo de oficina. El equipo sugiere que la búsqueda podría funcionar más como una habilidad de base que como una especialidad estrecha.
Los pesos ya están disponibles, el resto de la infraestructura llegará después
Los pesos de Iris-mini e Iris-pro están disponibles en una colección de Hugging Face, y el código está en GitHub. El lanzamiento incluye por ahora el Iris Harness, con el bucle del agente, las herramientas, las estrategias de gestión de contexto y los cuatro benchmarks con su evaluación, y funciona contra cualquier endpoint compatible con OpenAI. La canalización de construcción de datos y de entrenamiento, según el equipo, se publicará más adelante. Quien quiera reproducir el proceso completo de entrenamiento tendrá que esperar a esa segunda entrega; de momento solo puede desplegar los agentes ya entrenados y evaluarlos con el harness publicado.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Secretlab Titan Evo, tejido | Silla ergonómica · espuma de alta densidad · reposabrazos 4D metálicos · talla Regular | Ver precio en Amazon |
![]() |
Corsair TC100 Relaxed | Silla de diseño inspirado en las carreras · refuerzo esponjoso · exterior textil | Ver precio en Amazon |
![]() |
SONGMICS Escritorio eléctrico, 160 × 70 cm | 160 × 70 cm · regulable de 72 a 120 cm · cuatro alturas memorizadas · marco de acero, hasta 70 kg · USB-C de carga rápida de 20 W | Ver precio en Amazon |
![]() |
Invision MX200, brazo de monitor | Para pantallas de 19 a 32″ · VESA 75/100 mm · abrazadera de escritorio · altura, inclinación y giro | Ver precio en Amazon |
Escrito por Eloy Andrade









