Lemonade ha publicado hoy la versión 11.9 de su servidor de IA local, un proyecto de código abierto respaldado por AMD que funciona en Linux, Windows y macOS. Según recoge Phoronix, la novedad que destaca de esta entrega es el soporte experimental de un nuevo backend de ROCm HRX integrado con Llama.cpp, algo que la propia publicación describe como lo más interesante que ha traído el proyecto en mucho tiempo.
Qué es HRX y por qué AMD lo está desarrollando
HRX es una pieza nueva dentro del ecosistema ROCm de AMD, vinculada a los esfuerzos de Loom y Hyperloom que la compañía anunció en el evento AMD Advancing AI de San Francisco, centrados en optimizar cargas de trabajo agénticas. HRX se presenta como una implementación alternativa de HIP, la capa que ROCm usa hoy en día, y forma parte del compilador y la pila de representación intermedia Loom, pensada como sustituto más rápido que la tradicional LLVM IR a la hora de generar código ensamblador AMDGPU optimizado. La propia documentación de AMD lo describe, según cita el artículo, como «una colección de componentes de runtime mínimos que ofrecen una implementación alternativa de HIP tal como se distribuye actualmente en ROCm», y que sirve como sustrato común para lograr integración de baja latencia y alto rendimiento con las GPU, NPU y CPU de AMD.
La ingeniera de AMD Stella Laurenzo explicó el motivo del cambio
El desarrollo de HRX en el contexto de Llama.cpp lo puso sobre la mesa hace dos semanas la ingeniera de AMD Stella Laurenzo, que abrió la discusión en la comunidad. Laurenzo explicó que ROCm se diseñó originalmente para el centro de datos y que eso genera problemas al llevarlo a sistemas cliente, y detalló que «como ROCm ha madurado en sistemas cliente, nos hemos encontrado repetidamente con los costes de no tener backends nativos de AMD y bibliotecas cliente optimizadas que puedan optimizarse de forma independiente para el mejor rendimiento posible de las GPU y NPU de nuestro silicio». Por eso, según sus palabras, AMD lleva «un par de meses» trabajando en «un subconjunto de ROCm más ligero y enfocado», que llaman HRX, con la idea de que termine integrándose en ROCm como un conjunto de bibliotecas redistribuibles.
La propuesta inicial que AMD ha llevado a la comunidad de Llama.cpp, en forma de RFC, se limita deliberadamente a lo mínimo: una biblioteca de kernels suficiente para ejecutar el modelo unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF en formato Q4_K_M sobre RDNA3 (Radeon W7900) y RDNA3.5 (Strix Halo). Laurenzo aclaró que el trabajo seguirá ampliándose desde esa rama hacia más modelos, sistemas operativos y hardware.
El propio equipo de AMD habla de mejoras de entre el 30% y el 50% frente a Vulkan y HIP
El mensaje de Laurenzo, tal y como lo recoge el artículo, apunta cifras concretas de rendimiento. Según su explicación, HRX permitiría una mejora de entre el 30% y el 50% en tokens por segundo durante el prefill frente a los backends Vulkan y HIP que Llama.cpp/GGML usan hoy, y una ganancia de hasta el 10% en tareas de decodificación que no son MTP, con paridad en el resto de los casos. Además, según la misma fuente, la pila de HRX resulta más sencilla de mantener para quienes desarrollan sobre ella. Son cifras que vienen del propio anuncio de AMD y no de una medición independiente, así que conviene leerlas como una estimación del fabricante y no como un benchmark verificado por terceros.
Qué cambia para quien ya usa Lemonade en Linux
Para quien monta modelos locales sobre hardware de AMD, la novedad tiene un alcance concreto y limitado por ahora. El backend experimental llamacpp-hrx, tal como llega en Lemonade 11.9, funciona sobre los objetivos de GPU GFX1100 y GFX1151 en Linux, es decir, tarjetas de la serie Radeon RX 7900 (RDNA3) y los APU Strix Halo. No hay, según el material disponible, soporte para Windows ni para otras GPU de AMD en este primer paso, y tampoco hay indicación de que vaya a llegar a corto plazo: el propio autor del artículo original señala que se trata de un estado experimental en 2026, cuando este tipo de trabajo llevaba años esperándose. Quien tenga una de esas GPU o APU y ya use Lemonade puede probarlo hoy mismo bajo Linux; quien esté en Windows o con otra tarjeta de AMD tendrá que esperar a que el soporte se amplíe, algo que ni el proyecto ni AMD han fechado.
Más novedades de la actualización
Al margen del backend HRX, Lemonade 11.9 añade soporte para Qwen3-Next en su backend fijo de Llama.cpp, junto con otras mejoras que la nota de la versión no detalla más allá de mencionarlas. El backend HRX sigue siendo, con diferencia, el cambio que marca esta entrega: es la primera vez que se ve funcionando en público una pieza que AMD lleva meses desarrollando junto a la comunidad de llama.cpp, y que la compañía plantea como el futuro reemplazo parcial de HIP en el terreno cliente.
Escrito por Eloy Andrade





