ESCRÍBENOS: contacto@techplanet.es

Tech Planet

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS
  • Inicio
  • Noticias
  • Qwen-Drive 1.0 de Alibaba reduce del 24% al 12% las salidas de vía en simulación

Qwen-Drive 1.0 de Alibaba reduce del 24% al 12% las salidas de vía en simulación

Imagen oficial de Qwen-Drive 1.0: el oso mascota de Qwen al volante de un coche blanco junto a capturas de detección de tráfico y mapas
lunes, 07 septiembre 2026 / Publicado en Noticias

Qwen-Drive 1.0 de Alibaba reduce del 24% al 12% las salidas de vía en simulación

Imagen: Qwen

El equipo de investigación de Alibaba ha presentado Qwen-Drive 1.0, un modelo de IA para conducción que combina en un solo sistema tres tareas: percepción espacial del entorno, respuesta a preguntas sobre situaciones de tráfico y planificación de rutas. Según recoge The Decoder, los investigadores parten de una idea concreta: un modelo de texto e imagen no entiende automáticamente el espacio tridimensional solo porque sepa describir fotografías.

El modelo se construye sobre Qwen3.5-4B, el modelo de lenguaje-visión que Alibaba lanzó en febrero, y le añade dos componentes nuevos. El primero genera un mapa del entorno visto desde arriba, localizando objetos en el espacio, calculando qué zonas están ocupadas y trazando el trazado de la carretera; según los investigadores, este módulo sirve también como herramienta de medición para saber cuánta información espacial extrae realmente el modelo de las imágenes. El segundo, llamado Planning Expert, usa los datos internos del modelo para planificar el movimiento futuro del vehículo.

Esquema oficial de Qwen-Drive 1.0: el modelo de lenguaje Qwen3.5 con el módulo de percepción BEV y el Planning Expert
Imagen: Qwen

Solo entrenar el módulo nuevo no basta para entender el espacio

Cuando el equipo entrenó únicamente el componente añadido y dejó el modelo de lenguaje-visión sin tocar, la precisión espacial se mantuvo baja, lo que confirma que un modelo capaz de describir imágenes con detalle no comprende automáticamente el espacio tridimensional. Solo al entrenar también el propio modelo de lenguaje-visión en tareas espaciales el rendimiento mejoró de forma significativa, es decir, la capacidad de entender espacialmente las escenas de tráfico hay que construirla de forma deliberada.

El entrenamiento empieza por el módulo de percepción, sigue combinando percepción y respuesta a preguntas, continúa con la planificación de ruta y termina con un ajuste mediante aprendizaje por refuerzo. Para la parte de lenguaje-visión, el equipo combinó 24 conjuntos de datos públicos de escenas de tráfico, con estructuras distintas y a veces con errores, que un modelo de IA se encargó de estandarizar. Además, construyeron sus propios ejemplos explicando por qué el coche debía tomar una decisión concreta, como qué objeto provoca un frenazo.


El mismo modelo sirve para el habitáculo y para conducir

Los autores argumentan que un modelo que sacrifica capacidades generales a cambio de puro rendimiento de conducción no sirve en los vehículos modernos, donde el sistema de infoentretenimiento y el sistema de conducción convergen en una sola unidad de cómputo: si el modelo pierde conocimiento general, el habitáculo necesitaría su propio modelo aparte para el diálogo o las preguntas abiertas.

Según el estudio, Qwen-Drive 1.0 puntúa muy por encima del modelo base sin modificar, Qwen3.5-4B, en preguntas sobre escenas de tráfico, y la mayor diferencia aparece cuando el modelo tiene que explicar causa y efecto, por ejemplo por qué el coche debería frenar o girar. El conocimiento general se mantiene: el modelo apenas pierde rendimiento fuera del ámbito de la conducción e incluso puntúa algo más alto en algunas tareas espaciales.


En el simulador, la tasa de salidas de vía cayó del 24% al 12%

Para la planificación de conducción, el equipo probó el modelo en varios niveles de dificultad, desde predicciones simples hasta un simulador donde los errores se acumulan con el tiempo. En ese simulador, la versión reentrenada con recompensas redujo la tasa de salidas de vía del 24% al 12%, y además condujo de forma más prudente, cubriendo menos distancia en total.

Las explicaciones del modelo, sin embargo, no siempre señalan la causa real de una situación: un semáforo en rojo a lo lejos y un niño que se cruza en la calzada exigen tiempos de reacción muy distintos, y el modelo puede confundir ambos casos. La maniobra planificada tampoco coincide siempre con el razonamiento que el modelo había dado antes. Algunos resultados se apoyan en pruebas diseñadas o reconstruidas por los propios autores, así que las métricas concretas dicen poco sobre cómo se comportaría el sistema en una conducción real y desordenada.


Los mismos problemas ya aparecieron en PaLM-E y en un ataque contra DriveLM

El propio equipo de Qwen midió este vacío en la comprensión espacial con su banco de pruebas HopChain, donde los modelos de lenguaje-visión clasificaron mal objetos y confundieron relaciones espaciales pese a puntuar bien en pruebas de imagen y texto. El olvido catastrófico es un problema conocido: cuando Google DeepMind construyó PaLM-E en 2023, un modelo para lenguaje, imágenes y control de robots, las variantes más pequeñas perdieron buena parte de su capacidad de lenguaje tras el entrenamiento con robots, mientras que la versión más grande, de 562.000 millones de parámetros, apenas perdió nada.

Combinar un modelo de lenguaje con una función de conducción abre además una nueva superficie de ataque: investigadores de UC Santa Cruz colocaron un cartel etiquetado en el campo de visión de la cámara y consiguieron que el sistema de conducción DriveLM virara hacia peatones que estaban cruzando, aunque los había detectado correctamente. La investigación se está desplazando mientras tanto hacia los llamados World Action Models, que además predicen cómo cambia el entorno en respuesta a las propias acciones del agente. El equipo de Qwen distribuye el modelo de forma gratuita para la comunidad investigadora en Hugging Face, ModelScope y GitHub.


Escrito por Eloy Andrade

También podría interesarte

AMD Ryzen 9 9950X3D2 y Ryzen 7 9850X3D: todo lo que sabemos
Estructura tridimensional abstracta con paneles grises y naranjas, placas de circuitos rojo brillante conectadas por cables. Imagen generada con IA.
Casi 22.000 servidores Exchange, expuestos y sin parchear un fallo crítico
El nombre OpenAI en el centro, rodeado de páginas de documento que se multiplican en perspectiva sobre un fondo geométrico. Imagen generada con IA.
OpenAI admite que no reveló el secuestro de un wiki alemán por sus agentes

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

BUSCAR

POSTS RECIENTES

  • Imagen oficial de Qwen-Drive 1.0: el oso mascota de Qwen al volante de un coche blanco junto a capturas de detección de tráfico y mapas

    Qwen-Drive 1.0 de Alibaba reduce del 24% al 12% las salidas de vía en simulación

    El equipo de investigación de Alibaba presenta ...
  • Chip de memoria DRAM con líneas de tendencia alcista en verde y módulos electrónicos a su alrededor sobre fondo gris. Imagen generada con IA.

    Los ingresos de la industria DRAM suben un 59,5% por la demanda de IA

    Los ingresos de la industria DRAM alcanzaron ca...
  • Render oficial de la GeForce RTX 5090 Founders Edition sobre fondo negro y verde

    DLSS 5 sube hasta un 50 % el consumo de la RTX 5090 y ya hay un conector de 16 pines fundido

    Un usuario de un foro de hardware asegura que s...
  • Arte oficial de Super Smash Bros. Ultimate con decenas de luchadores de Nintendo y Mario y Link en el centro

    Un filtrador afirma que Nintendo prepara un nuevo Smash Bros y un Nintendogs

    Según un filtrador que ya acertó otras predicci...
  • Arte oficial de StarCraft II: un marine terran disparando, un guerrero protoss con hojas de energía y Kerrigan a la derecha

    El shooter de StarCraft se revelará en BlizzCon el 12 de septiembre

    El periodista Jason Schreier descarta que el es...

ARCHIVO

  • septiembre 2026
  • agosto 2026
  • julio 2026
  • junio 2026
  • mayo 2026
  • abril 2026
  • marzo 2026
  • febrero 2026
  • enero 2026
  • diciembre 2025
  • noviembre 2025
  • octubre 2025
  • septiembre 2025

CATEGORÍAS

  • Consolas
  • Formación
  • Gaming
  • Guías
  • Hardware
  • Noticias
  • Periféricos
  • Presupuestos PC
  • Productividad
  • Rankings
  • Redes
  • Seguridad
  • Sistemas operativos
  • Software
  • Tablets
  • Tecnología
  • Todas las noticias

Tech Planet es tu punto de encuentro para estar al día en informática y hardware. Publicamos comparativas, configuraciones de PC, consejos de software y guías prácticas para que saques el máximo partido a tus equipos. Con un estilo claro y accesible, acercamos la tecnología a usuarios de todos los niveles.

Únete a la newsletter de Tech Planet

Cada domingo enviamos un resumen con los mejores artículos de la semana.

¡No hacemos spam! Lee nuestra política de privacidad para obtener más información.

Revisa tu bandeja de entrada o la carpeta de spam para confirmar tu suscripción.

contacto@techplanet.es

CATEGORÍAS

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS

SOCIAL MEDIA

TEXTOS LEGALES

  • AVISO LEGAL
  • POLÍTICA DE PRIVACIDAD
  • POLÍTICA DE COOKIES

Powered by Trígono Comunicación | © 2026  Tech Planet | En calidad de Afiliado de Amazon, Tech Planet obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.

SUBIR
Gestionar consentimiento
Para ofrecer las mejores experiencias, utilizamos tecnologías como las cookies para almacenar y/o acceder a la información del dispositivo. El consentimiento de estas tecnologías nos permitirá procesar datos como el comportamiento de navegación o las identificaciones únicas en este sitio. No consentir o retirar el consentimiento, puede afectar negativamente a ciertas características y funciones.
Funcional Siempre activo
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferencias
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Estadísticas
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Administrar opciones
  • Gestionar los servicios
  • Gestionar {vendor_count} proveedores
  • Leer más sobre estos propósitos
Ver preferencias
  • {title}
  • {title}
  • {title}