El laboratorio de pruebas The Decoder recoge los resultados de Andon Labs, que ha sometido a GPT-6 Astra, el nuevo modelo de OpenAI, a dos benchmarks muy distintos: Vending-Bench, que mide la gestión autónoma de un negocio, y Drone-Bench, que mide la capacidad de escribir código para pilotar un dron real. Astra supera a todos los modelos de frontera anteriores en ambas pruebas, según Andon Labs.
Astra gana casi tres veces más que Claude Fable 5.1 gestionando una máquina expendedora
En Vending-Bench, cada modelo recibe 500 dólares y tiene que sacar adelante una máquina expendedora durante un año simulado: buscar proveedores, negociar precios de compra, encargar mercancía, fijar precios de venta e intentar hacer crecer el saldo. A lo largo de seis simulaciones, GPT-6 Astra promedió 15.515 dólares, frente a los 5.422 dólares de Claude Fable 5.1, según los datos de Andon Labs. La mejor simulación de Fable, con 9.874 dólares, se quedó por debajo incluso de la peor de Astra, que llegó a 13.272 dólares. Es la primera vez que un modelo de OpenAI encabeza la clasificación de Vending-Bench 2, y Andon Labs señala que la distancia con el segundo puesto es la mayor que ha registrado nunca el benchmark.
Una de las diferencias más claras aparece en las compras. Fable acepta acuerdos cada vez peores con el tiempo: el precio medio que paga por una lata de Coca-Cola sube de 1,17 dólares en los primeros 90 días a 2,21 dólares hacia el final del año simulado. Astra negocia con más consistencia: en un caso documentado por Andon Labs, un proveedor pidió 226,32 dólares por un lote de productos y Astra se mantuvo firme en 108 dólares y cerró el trato a ese precio.
Fable rompió su propia norma para evitar pagar a proveedores que ya habían cerrado
Astra también gestiona mejor a los proveedores poco fiables. En las seis simulaciones, Fable 5.1 hizo 45 pagos por adelantado a proveedores que ya habían cerrado, perdiendo 14.331 dólares. Astra se encontró con más cierres todavía, 64 en total, pero Andon Labs no registró ninguna pérdida identificada por este motivo. Fable llegó a detectar el problema y escribió una regla para pagar solo tras confirmación por escrito; días después, el propio modelo se saltó su regla.
Andon Labs también prueba a los modelos en Vending-Bench Arena, donde varios agentes de IA gestionan máquinas expendedoras que compiten en el mismo lugar. Astra rechazó explícitamente una propuesta de fijación de precios del modelo chino GLM-5.3, y no se observó ningún caso de mentira por parte de Astra en las tres partidas de arena estudiadas. Claude Fable 5.1, en cambio, participó en lo que Andon Labs clasifica como un acuerdo ilegal de fijación de precios con GLM-5.3, y solo lo respetó cuando le convenía. Astra ganó las tres partidas. Andon Labs valora a Astra como el mejor tanto en resultado económico como en alineamiento, aunque aclara que esa valoración se basa en comportamientos observados en el benchmark y no se traslada automáticamente a otras situaciones.
Astra es el primer modelo que supera las cinco tareas de Drone-Bench
Drone-Bench mide otra capacidad: escribir código que permita a un dron DJI Tello EDU barato navegar de forma autónoma por una oficina, identificar a una persona concreta y seguirla. El benchmark tiene cinco pasos: reconstrucción 3D del entorno, localización del dron, navegación, detección de la persona objetivo y seguimiento, cada uno puntuado frente al código que un desarrollador humano construyó con agentes de codificación para la demo de Andon.
En el artículo original de julio, Claude Fable 5 era el modelo más fuerte, y los modelos de frontera habían superado la referencia humana en cuatro de las cinco tareas en al menos un intento; la reconstrucción 3D seguía sin resolverse. Andon Labs informa de que Astra es el primer modelo cuyos mejores envíos superan la referencia en las cinco tareas, incluida la reconstrucción. Astra construyó un proceso que combina COLMAP y DA3 con un filtrado de profundidad añadido, y usó grabaciones de vídeo de la oficina para generar un modelo 3D navegable que puntuó por encima de la solución de referencia humana, según Andon Labs.
Un buen resultado puntual no significa fiabilidad
Los mejores resultados no equivalen a un rendimiento constante. En detección de personas, Astra supera la referencia en cuatro de cada diez intentos; en reconstrucción 3D, solo en uno de cada diez. Andon Labs calcula que un intento medio de Astra solo tiene un 2,8% de probabilidades de superar las cinco etapas seguidas. Astra demuestra por primera vez que un modelo de propósito general puede producir código por encima de la referencia en cada parte de la tarea, pero al multiplicar las probabilidades de un intento completo, el resultado sigue siendo bajo. Según el ritmo de avance de los dos últimos años, el equipo de Andon Labs proyecta que un modelo de frontera podría resolver las cinco tareas en un solo intento a partir del primer trimestre de 2027.
Para quien esté valorando construir agentes de IA sobre GPT-6 Astra para tareas físicas como el pilotaje de drones, el dato que importa no es que sea el primer modelo en superar las cinco pruebas, sino ese 2,8% de probabilidad de completar la secuencia entera en un solo intento: hoy, desplegar este tipo de agente en producción sigue exigiendo supervisión humana y varios intentos, no una automatización directa de principio a fin. Solo cuando esa cifra se acerque a la fiabilidad constante que Andon Labs proyecta para el primer trimestre de 2027 tendría sentido plantearse prescindir de ese respaldo.
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Samsung 990 Pro 2 TB | 2 TB · M.2 NVMe · disipador y protección térmica dinámica contra sobrecalentamiento | Ver precio en Amazon |
![]() |
WD_BLACK SN850X 2 TB | 2 TB · M.2 2280 PCIe Gen4 · hasta 7300 MB/s de lectura y 6600 MB/s de escritura | Ver precio en Amazon |
![]() |
Crucial P310 2 TB | 2 TB · M.2 2280 PCIe Gen4 · hasta 7100 MB/s · compatible con portátil, sobremesa y consola | Ver precio en Amazon |
![]() |
MSI Spatium M560 2 TB | 2 TB · M.2 2280 PCIe 5.0 · hasta 10 300 MB/s de lectura y 8700 MB/s de escritura · 3D NAND | Ver precio en Amazon |
Escrito por Eloy Andrade









