Hay una parte de la carrera por la IA local que no tiene nada que ver con cuántos TOPS puede dar un NPU o una GPU o el sistema completo... Podemos tener una GPU enorme, memoria suficiente y una computadora perfectamente capaz de mover un modelo, pero si cada vez que aparece una arquitectura nueva tenemos que esperar semanas a que drivers, runtimes y aplicaciones aprendan qué hacer con ella, todo ese hardware se convierte temporalmente en un bonito pisapapeles. AMD quiere evitar justamente eso con Qwen3.8 27B, anunciando soporte desde el día 0, con disponibilidad para ejecutarlo localmente sobre Ryzen AI Max+ y la Radeon AI PRO R9700 mediante herramientas como llama.cpp y LM Studio.

Y vale la pena aclarar desde el principio qué acaba de salir, porque llamarlo simplemente "otro LLM de 27B" se queda un poco corto. Qwen describe al Qwen3.8 27B como un modelo denso de visión y lenguaje, con 27 millardos de parámetros (27 mil millones, pero me gusta mas el término millardos por exótico), comprensión nativa de imágenes y video, razonamiento configurable y una ventana de contexto nativa de 262,144 tokens que puede extenderse hasta un millón bajo configuraciones compatibles. La familia está orientada especialmente a programación, trabajo profesional, investigación y tareas agentivas largas, es decir, aquellas donde no solamente queremos una respuesta bonita sino mantener una secuencia de acciones durante bastante tiempo.
La otra palabra importante es denso. A diferencia de un modelo Mixture of Experts donde podemos tener una cantidad gigantesca de parámetros pero activar solamente una fracción en cada paso, aquí los 27B forman parte del modelo que estamos moviendo. Eso pone presión directa sobre memoria y ancho de banda, dos cosas que explican bastante bien por qué AMD está señalando específicamente a Ryzen AI Max y una Radeon con 32 GB de VRAM como plataformas recomendadas.
Qué es Qwen3.8 27B
| Característica | Qwen3.8 27B |
|---|---|
| Arquitectura | Modelo denso de visión y lenguaje |
| Parámetros | 27 mil millones |
| Visión | Sí, imágenes y video |
| Razonamiento | Configurable, activado por defecto |
| Contexto nativo | 262,144 tokens |
| Contexto extensible | Hasta 1 millón de tokens |
| Enfoque | Coding, trabajo profesional, investigación y agentes |
| Multi-Token Prediction | Sí |
| Ejecución local | Disponible mediante cuantizaciones para herramientas compatibles |
| LM Studio | Disponible desde lanzamiento |
| llama.cpp | Compatible |
| AMD Day 0 | Sí |
Day 0 significa que puedes usarlo hoy, no que ya terminó de optimizarse
"Day 0 support" suena muy bonito en una diapositiva, pero aquí tiene un significado bastante concreto: Qwen3.8 27B apareció y AMD ya tiene una ruta funcional para ejecutarlo localmente sobre su hardware, sin esperar a una actualización futura que agregue compatibilidad. En Windows puede utilizarse mediante llama.cpp con backend Vulkan y también aparece ya dentro de LM Studio, donde un usuario puede descargar una cuantización compatible, cargar el modelo y comenzar a probarlo sin tener que armar manualmente todo el stack de inferencia.
Eso tampoco significa que el trabajo haya terminado. De hecho AMD dice exactamente lo contrario: los números publicados son preliminares y espera que el rendimiento mejore conforme maduren las optimizaciones de modelo y software. Esto es importante porque un benchmark de lanzamiento nos dice "ya funciona y esto logramos hoy", no necesariamente dónde terminará la plataforma dentro de tres meses, por ejemplo en el Ryzen AI Max+ 395 AMD midió hasta 24.5 tokens por segundo, mientras una sola Radeon AI PRO R9700 llegó hasta 51.8 tokens por segundo. Las pruebas se hicieron en Windows 11 con llama.cpp sobre Vulkan, promediando generación de tokens durante tres o más ejecuciones. En el Ryzen AI Max+ utilizaron MTP=4 y en la R9700 MTP=2.
Aquí hay que evitar otra de esas comparaciones que terminan arruinando las discusiones de IA. Los tokens por segundo reportados corresponden a velocidad de generación, no necesariamente al tiempo que tarda el modelo en procesar un prompt enorme, cargar contexto, analizar una imagen o entregar el primer token. Dos sistemas pueden generar texto a velocidades similares y sentirse completamente distintos si uno tarda mucho más en comenzar a responder.
Aun así, 24.5 tokens/s ya entra cómodamente en una velocidad donde una conversación puede sentirse natural; 51.8 tokens/s significa que, para muchas respuestas, el modelo puede generar texto bastante más rápido de lo que una persona consigue leerlo. No necesitamos mil tokens por segundo para un chatbot, pero la velocidad sobrante se vuelve interesante cuando el modelo comienza a trabajar como agente, generar código o encadenar múltiples pasos sin una persona esperando cada palabra.

La memoria vuelve a ser el verdadero lujo de la IA local
AMD recomienda aproximadamente 24 GB de VGM o VRAM para correr Qwen3.8 27B cómodamente, y ahí probablemente encontramos la barrera más importante para quien lea "27B local" y quiera probarlo inmediatamente en cualquier laptop Ryzen. LM Studio muestra actualmente una cuantización del modelo con 17 GB como memoria mínima del sistema, pero mínimo y cómodo son dos palabras bastante diferentes. Una cuantización reduce la cantidad de memoria necesaria representando los pesos con menor precisión, y esa es precisamente una de las razones por las que podemos meter modelos de decenas de millardos de parámetros dentro de hardware personal. Después todavía tenemos contexto, caché KV, runtime y otras cosas queriendo su propio pedazo de RAM o VRAM.
En una Radeon AI PRO R9700 la situación es fácil de visualizar porque tenemos 32 GB de GDDR6 dedicados y 640 GB/s de ancho de banda. El modelo entra dentro de la memoria disponible y la GPU puede trabajar sobre él sin depender de la RAM principal para cada movimiento. La R9700 además está diseñada precisamente alrededor de este tipo de cargas locales, con 64 Compute Units y 128 aceleradores de IA sobre RDNA 4.
Ryzen AI Max juega un truco diferente. La plataforma utiliza memoria unificada y AMD Variable Graphics Memory permite reservar una parte de la RAM como memoria gráfica. Una configuración Ryzen AI Max+ 395 con 64 GB puede dedicar hasta 48 GB mediante VGM según las recomendaciones de AMD, mientras las máquinas de 128 GB pueden reservar todavía más. En la prueba de Qwen3.8, AMD utilizó específicamente un GMKtec EVO X2 con 128 GB de RAM y 64 GB configurados como VGM.
Es básicamente convertir una enorme piscina de memoria en un espacio compartido donde CPU y GPU pueden trabajar sin que el modelo tenga que caber dentro de los 8, 12 o 16 GB que normalmente encontraríamos en una GPU de consumo. El precio es que la memoria LPDDR de una APU no tiene el ancho de banda de la GDDR6 dedicada de una R9700, y ahí empezamos a entender por qué una GPU dedicada logra más del doble de tokens por segundo en las cifras iniciales de AMD.
Rendimiento preliminar publicado por AMD
| Plataforma | Memoria usada / disponible | Backend | MTP | Rendimiento anunciado |
|---|---|---|---|---|
| Ryzen AI Max+ 395 | Sistema de 128 GB, VGM configurado a 64 GB | llama.cpp / Vulkan | 4 | Hasta 24.5 tokens/s |
| Radeon AI PRO R9700 | 32 GB GDDR6 | llama.cpp / Vulkan | 2 | Hasta 51.8 tokens/s |
LM Studio es la puerta fácil; llama.cpp está debajo haciendo el trabajo
Para quien simplemente quiera probar Qwen3.8 27B, LM Studio es probablemente la ruta menos dolorosa. El modelo apareció en su catálogo el mismo día, puede descargarse desde la interfaz y soporta razonamiento, entrada visual y el contexto nativo de 262K tokens descrito por Qwen. AMD recomienda configurar MTP con cuatro draft tokens en Ryzen AI Max+ y dos en Radeon AI PRO R9700, además de desactivar "Try mmap" dentro de las opciones avanzadas de carga para su configuración recomendada, MTP significa Multi-Token Prediction. Simplificando bastante, el modelo fue entrenado para predecir más de un token hacia adelante y el runtime puede aprovechar esta característica para acelerar la generación cuando esas predicciones resultan útiles. No significa simplemente que "MTP=4 hace la IA cuatro veces más rápida", y precisamente por eso AMD publica valores distintos para cada plataforma.
Debajo tenemos llama.cpp, que se ha convertido prácticamente en una navaja suiza de la IA local gracias al formato GGUF y su capacidad para ejecutar modelos sobre una enorme variedad de hardware. No hay nada exclusivo de AMD en Qwen3.8 27B ni en llama.cpp; el punto del anuncio es que el backend y la configuración sobre AMD funcionan desde el lanzamiento, por eso para que la IA local realmente crezca, lo saludable es tener: modelos abiertos, formatos comunes y herramientas que puedan moverse entre diferentes tipos de hardware.

Lemonade quiere resolver el problema que viene después de instalar el modelo
Abrir LM Studio, escribir una pregunta y recibir una respuesta es divertido, pero para un desarrollador la pregunta siguiente suele ser bastante menos divertida: ¿cómo meto esto dentro de mi aplicación sin convertirme también en especialista en cinco runtimes diferentes? Ahí entra Lemonade.
AMD desarrolla Lemonade como una plataforma local-first y open source que expone una interfaz unificada mientras selecciona diferentes backends para CPU, GPU o NPU. Actualmente soporta motores como llama.cpp, Ryzen AI, FastFlowLM, whisper.cpp y stable-diffusion.cpp, además de proporcionar una API compatible con el formato utilizado por OpenAI. Una aplicación que ya habla con un endpoint de ese estilo puede cambiar la dirección hacia Lemonade y comenzar a comunicarse con un modelo ejecutado localmente.
Pongámoslo como una metáfora, es como escribir una aplicación para un enchufe/conector en lugar de cablearla directamente a la planta eléctrica. El desarrollador llama a una interfaz relativamente conocida y Lemonade se encarga de decidir qué backend utilizar según el hardware disponible, ahorrando tiempo de desarrollo.
Con Qwen3.8 27B esto significa que el modelo puede dejar de ser solamente una ventana de chat y convertirse en una parte interna de un programa: clasificación de documentos, asistente de programación, análisis visual, RAG local, automatización o un agente que trabaja sobre datos que no queremos mandar permanentemente hacia Internet. AMD además señala que Lemonade puede empaquetarse junto con la aplicación como una capa local de inferencia.
LM Studio vs llama.cpp vs Lemonade
| Herramienta | Para quién tiene más sentido | Qué hace |
|---|---|---|
| LM Studio | Usuario, entusiasta o desarrollador que quiere probar el modelo rápidamente | Descarga, administra y ejecuta modelos mediante interfaz gráfica |
| llama.cpp | Usuarios avanzados y desarrolladores que quieren mayor control | Runtime abierto para inferencia local y modelos GGUF |
| Lemonade | Desarrolladores que quieren integrar IA dentro de aplicaciones | Capa/API local que administra diferentes backends según hardware |
| Qwen3.8 27B | El modelo | Proporciona razonamiento, visión, coding y capacidades agentivas |
Hay un detalle del benchmark que todavía nos falta
AMD publicó hardware, sistema operativo, driver, backend, configuración MTP y metodología general, lo cual es bastante más información que simplemente lanzar dos barras de colores. Sin embargo, no encontramos especificada en el anuncio la cuantización GGUF exacta utilizada para obtener los 24.5 y 51.8 tokens/s, por ejemplo, un modelo de 27B puede comprimirse con distintos niveles de precisión, y reducir bits normalmente disminuye consumo de memoria y puede acelerar inferencia, pero también existe una relación con calidad. Por eso esos números sirven para entender qué rendimiento obtuvo AMD en su configuración inicial, pero no los utilizaría todavía para hacer una comparación directa contra otra GPU, Apple Silicon o cualquier otra plataforma a menos que ambas ejecuten exactamente la misma cuantización, contexto y configuración, de hecho, la propia ficha oficial de Qwen ofrece los pesos completos y enlaza hacia distintas cuantizaciones para llama.cpp, Ollama y LM Studio, así que por ahora la lectura correcta sería: una R9700 puede correr Qwen3.8 27B localmente por encima de 50 tokens/s en la prueba preliminar de AMD. Lo que no podemos decir todavía es que "R9700 corre Qwen3.8 a 51.8 tokens/s y X GPU a tanto" sin igualar el resto del laboratorio.
Day 0 empieza a importar más que otro número de TOPS
Durante los primeros años de las AI PCs vimos una cantidad francamente obscena de números sobre TOPS, NPUs y aceleradores que a veces tenían un problema muy sencillo: uno compraba la computadora y después tenía que preguntarse qué demonios podía hacer realmente con esos TOPS. Este tipo de lanzamiento me parece más interesante precisamente porque comienza desde el otro lado. Qwen3.8 27B apareció hoy, podemos abrir LM Studio hoy, descargar una versión cuantizada y ponerla a trabajar sobre una máquina AMD compatible hoy. Si somos desarrolladores, también podemos comenzar a conectarla mediante Lemonade o trabajar directamente sobre llama.cpp.
Qwen3.8 además está justo en un tamaño interesante, 27B sigue siendo lo suficientemente grande como para necesitar hardware serio, pero no tanto como para obligarnos automáticamente a tener un rack en el sótano. En un Ryzen AI Max podemos aprovechar una piscina enorme de memoria compartida; en una R9700 tenemos 32 GB dedicados y mucho más ancho de banda. Son dos formas bastante diferentes de solucionar el mismo problema, la IA local probablemente se va a parecer cada vez más a lo que ocurrió con los videojuegos en PC. A nadie le importa demasiado que una GPU soporte una API si no existen juegos que quiera correr con ella. Con IA va a ocurrir algo parecido: el hardware importa, pero el ecosistema de modelos y la velocidad con la que podamos utilizarlos importa todavía más.
FUENTES CONSULTADAS
AMD (Qwen3.8 27B Day 0 Support)
Fuente principal del anuncio, plataformas compatibles, requisitos aproximados de memoria, configuración en LM Studio y resultados preliminares de 24.5 y 51.8 tokens por segundo.
https://www.amd.com/en/blogs/2026/run-qwen-3-8-27b-on-amd-ryzen-ai-max-and-radeon-graphics-cards-day-0.html
LM Studio (Qwen3.8 27B)
Página del modelo disponible para LM Studio, capacidades, memoria mínima indicada y soporte para razonamiento y entrada visual.
https://lmstudio.ai/models/qwen/qwen3.8-27b
AMD Lemonade
Documentación oficial de la plataforma local-first de AMD, arquitectura multi-engine, compatibilidad con llama.cpp y API compatible con OpenAI para integrar inferencia local dentro de aplicaciones.
https://www.amd.com/en/developer/resources/technical-articles/2026/lemonade-for-local-ai.html
AMD Radeon AI PRO R9700
Especificaciones oficiales de la GPU utilizada en las pruebas, incluyendo 32 GB GDDR6, 640 GB/s de ancho de banda y arquitectura RDNA 4.
https://www.amd.com/en/products/graphics/workstations/radeon-ai-pro/ai-9000-series/amd-radeon-ai-pro-r9700.html
AMD (Variable Graphics Memory)
Explicación oficial de VGM y de cómo Ryzen AI Max puede reservar grandes cantidades de memoria del sistema para la GPU integrada al ejecutar modelos locales.
https://www.amd.com/en/blogs/2025/faqs-amd-variable-graphics-memory-vram-ai-model-sizes-quantization-mcp-more.html







Comentarios
Aún no hay comentarios. ¡Sé el primero en comentar!