Qwen3.8-27B en local: frontier en el bench, atasco en el reloj

El 27B de Alibaba corre agentes de código en un portátil y puntúa 52 frente a Opus. En nueve tareas reales fue unas 30 veces más lento que DeepSeek V4 Flash.

7 min de lectura

En este artículo

El Cuñado dice: El Qwen de 27B ya es frontier. Lo bajas a 17GB, lo tiras en el portátil y te olvidas de pagar a Anthropic. Se acabó la API.

La realidad es: El 27B sí escribe código en local, sí puntúa como un frontera en índices concretos y sí mantiene un bucle de agente. VentureBeat y Artificial Analysis coinciden en esa parte. Lo que no sobrevive es el filtro siguiente: con razonamiento encendido, en nueve tareas, apenas mejoró a DeepSeek V4 Flash y fue unas 30 veces más lento y 4,5 veces más caro.

Por qué importa saberlo: El techo local se mide con el mejor. Se despliega el más barato que aguante ese techo. Confundir las dos decisiones es cómo acabas con un modelo que pega en el bench y te deja el agente pensando mientras el café se enfría.

Lo que sí está medido

Qwen3.8-27B no llega recortado a chatbot. VentureBeat detalla comprensión nativa de imagen y vídeo, una ventana de 262.144 tokens, razonamiento configurable y soporte explícito para flujos de coding y agentes. La ficha de Artificial Analysis confirma el mismo modelo con contexto de 256k tokens, mismo orden de magnitud, cifra redondeada distinto, y una verbosidad de 160 millones de tokens de salida.

La cuantización a 4 bits lo deja en unos 17GB. Nadie regala la inferencia: compras el derecho a quemar tu propia máquina.

Artificial Analysis le da 52 en el Intelligence Index, un compuesto de nueve evaluaciones que mezclan coding, ciencia, razonamiento y tareas profesionales. La propia página del modelo lo confirma. En el Agentic Index saca 51 y supera a Claude Opus 4.8 en máximo esfuerzo de razonamiento, un frontera de Anthropic de hace menos de tres meses.

La tabla comparativa de Alibaba, otra cocina, otro incentivo, pone al 27B por delante de Claude Opus 4.6 Max en SWE-bench Pro y LiveCodeBench. Opus sigue delante en Terminal-Bench, GPQA Diamond y Humanity's Last Exam.

Ahí hay tensión útil. Alibaba enseña donde gana. Artificial Analysis entrega un compuesto y un índice de agente. Las dos fuentes coinciden en que el 27B pega en coding agentico. Ninguna dice que gane en todo. Mezclar la tabla del fabricante con el índice de terceros como si fueran la misma medición es hacerse trampas al solitario.

Simon Willison no puntúa un PDF: carga una cuantización Q4_K_M de unos 17GB en un MacBook Pro M5 Max y en una Nvidia DGX Spark. Escribe código, interpreta imágenes y mantiene un bucle de agente con el framework Pi. En una prueba navega un codebase para explicar cómo funciona la autenticación. En otra escribe y testea una utilidad Python que convierte un transcript de agente de JSONL a Markdown.

Eso es capacidad contra el mundo. El script corre o no corre. Un 8 de un juez LLM sobre "la técnica" no vale lo mismo y cuesta parecido.

Cybernews, citado por VentureBeat, reporta más de 3 millones de descargas en Hugging Face en los tres primeros días. Eso mide hambre de pesos abiertos. No mide si el agente te cierra el ticket.

El embudo que el bench no enseña

Un modelo local para coding agentico se evalúa en dos rejas. La primera es capacidad: benches agenticos, contexto amplio, una tarea real con verificador externo. La segunda es operación: velocidad que aguante el bucle, contexto que quepa de verdad en tu máquina, coste del trabajo cerrado.

El 27B pasa la primera. La segunda es donde se le ve el costurón.

Tomasz Tunguz lo enchufó a su stack de agentes con razonamiento activado. Resultado en nueve tareas: Qwen gana por los pelos a DeepSeek V4 Flash en calidad, y se come aproximadamente 30 veces más tiempo y 4,5 veces más dinero.

En un bucle de agente esa lentitud no se paga una vez. Se paga en cada llamada a herramienta, cada reintento y cada test que el modelo lanza. Si el campo que invalida el registro entero es el reloj, el medio punto de calidad no salva la fila. Una mejora local que no mueve el trabajo terminado es una dependencia nueva a cambio de nada. Ya vimos la cara inversa con DeepSeek V4 Flash: barato por token, caro cuando cierras la tarea.

El coste de un modelo es el del trabajo terminado, no el del token.

El filtro de contexto es el hermano callado del reloj. 262.144 tokens en la ficha no significan 262.144 tokens útiles en un portátil: hay que dejar RAM para la caché KV y para el arnés. No consta en las fuentes consultadas que esa ventana se use de forma efectiva en hardware de consumo. Si llenarla convierte el 30x en algo peor, el modelo suspende el filtro aunque el comunicado sea enorme.

La infra local tampoco es un único número. Willison midió una mejora de rendimiento de aproximadamente 72% en su DGX Spark al activar Multi-Token Prediction con llama.cpp, frente a su configuración por defecto en LM Studio. Mismos pesos, otro runtime, otro reloj. Si no miras qué stack está infiriendo, estás midiendo el arnés y firmando el resultado como si fuera el 27B.

Eso importa para evaluar si un modelo vale la pena sin tragar el comunicado: el sujeto de la medición tiene que ver exactamente el estímulo que dices estar midiendo. Un bloque de razonamiento de más, un runtime distinto o un juez que empata lo bueno y lo mediocre te dejan un ranking que no discrimina.

Dónde

La tesis de partida era sencilla: Qwen es el sitio donde mirar cuando quieres correr en local sin montar una centralita, y de los entrenamientos frontera salen destilaciones que vuelven a reinar en casa. El 27B pone esa idea a prueba. No la canoniza.

Sirve para marcar el techo. Si quieres saber qué calidad local es posible hoy en un agente que navega un repo y escribe una utilidad, este es el listón que hay que golpear. Después despliegas el más barato que aguante ese listón. Si Flash, o el primo pequeño de la misma casa, cierra las mismas nueve tareas con una diferencia que un evaluador honesto no separa, el 27B se queda en el banco de pruebas.

No consta en las fuentes consultadas si la cuantización de 4 bits mantiene la calidad de la versión completa en esos benches. Willison corre el Q4_K_M; Alibaba y Artificial Analysis puntúan el modelo. Son columnas distintas.

Tampoco consta rendimiento en coding de larga duración más allá de los benches citados, ni en producción con carga sostenida, ni una comparación de coste total de propiedad entre el 27B local y un frontera por API. Las fuentes no recogen la latencia de extremo a extremo de un agente en un PC típico.

El 27B no es humo. Es un techo local con un reloj que, en el único head-to-head de trabajo cerrado que tenemos, se come el ahorro de no pagar la API. Su sitio depende de qué tareas aguante sin que el bucle se vuelva una siesta, y de si quemar tu propia máquina sale más barato que esperar.

Preguntas frecuentes

¿Qwen3.8-27B es un modelo frontier-class para coding agents?

En benches concretos, sí se acerca. Artificial Analysis le da 52 en Intelligence Index y 51 en Agentic Index, por encima de Claude Opus 4.8 en máximo esfuerzo de razonamiento. La tabla de Alibaba lo pone por delante de Opus 4.6 Max en SWE-bench Pro y LiveCodeBench, no en Terminal-Bench ni GPQA Diamond. Eso no demuestra que sea frontier como herramienta de producción.

¿Se puede correr Qwen3.8-27B en un ordenador de casa?

Sí, en equipos de gama alta. La cuantización a 4 bits lo deja en unos 17GB; Simon Willison lo usó en un MacBook Pro M5 Max y una Nvidia DGX Spark para escribir código y mantener un bucle de agente. No consta en las fuentes consultadas que la versión de 4 bits iguale la calidad de la completa, ni que la ventana de 262.144 tokens se use entera en hardware de consumo.

¿Es más barato usar Qwen3.8-27B en local que un modelo frontera por API?

No hay una comparación de coste total de propiedad en las fuentes consultadas. En el stack de Tomasz Tunguz, con razonamiento activado, el 27B fue 4,5 veces más caro y unas 30 veces más lento que DeepSeek V4 Flash en nueve tareas, con una ventaja de calidad mínima. El ahorro de no pagar API puede evaporarse si mides el trabajo terminado y no el token.

¿Qwen3.8-27B sirve para cualquier tarea de programación?

No hay evidencia de pruebas exhaustivas que cubran todas las tareas de coding. Willison documentó dos casos reales: explicar autenticación en un codebase y escribir una utilidad Python de JSONL a Markdown. Los benches cubren SWE-bench Pro, LiveCodeBench y Terminal-Bench, con resultados mixtos frente a Opus. Las fuentes no recogen tareas de coding largas ni cargas de producción.

Fuentes

  1. Qwen3.8-27B runs frontier-class coding agents and reasoning on a high-end laptop, no cloud API requiredventurebeat.com · 2026-08-18
  2. Qwen3.8 27B - Intelligence, Performance & Price Analysisartificialanalysis.ai
  3. China’s Alibaba takes another swipe at America’s AI supremacytheverge.com · 2026-08-03