Código abierto

Qwen3.8-27B en NVFP4: 27.000 millones de parámetros en 24,6 GiB

Qwen3.8-27B, el modelo denso de 27.000 millones de parámetros del equipo Qwen, cabe comprimido a cuatro bits en 24,6 GiB con un millón de tokens de contexto. Encima lleva un ajuste, ThinkingCap, que recorta un 40 % los tokens de razonamiento en los problemas difíciles. La cifra la mide y la publica el propio autor del ajuste, y su propia tabla explica que el recorte ni es universal ni es mérito suyo del todo.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Qwen3.8-27B en NVFP4: 27.000 millones de parámetros en 24,6 GiB
📷 Imagen generada con IA

En resumen

  • Qwen3.8-27B se publicó en agosto de 2026 y su cuantización NVFP4 esa misma tarde: los pesos ocupan 24,6 GiB. El contexto va aparte, y a un millón de tokens la caché suma 6,6 millones de tokens de KV.
  • Exige una GPU de la generación Blackwell de NVIDIA y se sirve con vLLM o con SGLang.
  • La versión con ThinkingCap la publicó la cuenta «hotdogs» en Hugging Face el 24 de agosto de 2026; las mediciones del 40 % son del 15 de septiembre.
  • En la suite difícil los tres modelos comparados aciertan lo mismo, un 70,0 %, y el ajuste baja la media de 235 a 141 tokens de razonamiento.
  • En la suite fácil el recorte desaparece: 87, 101 y 101 tokens, dentro del propio ruido.

27.000 millones de parámetros en 24,6 GiB

Qwen3.8-27B es el modelo denso que el equipo Qwen, del grupo chino de comercio electrónico y nube Alibaba, publicó en agosto de 2026: atención híbrida —lineal en 48 de sus 64 capas—, torre de visión y cabeza de borrador MTP incorporada. Su contexto nativo es de 262.000 tokens y se estira hasta un millón con YaRN, una técnica de extensión; la propia ficha de NVIDIA sirve el modelo con 262.144.

La compresión no trata todo por igual: NVFP4 en las capas MLP y en la cabeza del modelo de lenguaje, FP8 en las de autoatención y atención lineal. Unsloth —proyecto que publica cuantizaciones y herramientas para ajustar modelos abiertos— la construye con Unsloth Dynamic V3.0, todavía preliminar. Salen 24,6 GiB de fichero —los pesos, no la caché— y una velocidad en torno a 1,5 veces la de los puntos de control en BF16. A un millón de tokens de contexto, la caché KV añade 6,6 millones de tokens por encima de esa cifra. La compresión cuesta algo de acierto: Unsloth cifra en un 92-97 % la precisión conservada, un 96,68 % en código y un 92,15 % en conversación.

La letra pequeña es el hardware: NVFP4 exige una GPU de la generación Blackwell de NVIDIA y se sirve con vLLM, el motor de código abierto para desplegar modelos de lenguaje, y también con SGLang, que la ficha de NVIDIA documenta con su propio comando. En Hugging Face, la plataforma estadounidense donde se publican los modelos abiertos, hay ya versiones de esta cuantización de tres procedencias: nvidia, unsloth y RadixArk. Sin una Blackwell, Qwen3.8 se ejecuta en otros formatos con llama.cpp o con Unsloth Desktop.

Leer más: Hugging Face — nvidia/Qwen3.8-27B-NVFP4 ↗

ThinkingCap es un ajuste para que el modelo piense menos

ThinkingCap es un ajuste fino —SFT con LoRA— para que un modelo de razonamiento piense menos sin perder acierto. La familia original la publica Bottle Cap AI sobre Qwen3.6-27B. La de hoy es otra: la aplicada sobre Qwen3.8-27B por la cuenta «hotdogs» en Hugging Face el 24 de agosto de 2026, con licencia Apache-2.0.

La ficha da un detalle poco habitual: LoRA fusionada con r=32 y alpha=64 sobre todas las capas lineales y las in_proj de GDN, 339 filas de SFT, una época, siete RTX 3090 y una pérdida de evaluación de 0,2143. El conjunto de datos trae 369 pares SFT y 244 DPO, verificados por oráculo en un 84,2 %.

Conviene fijar el calendario, porque nada de esto es de ayer: el modelo es de agosto, el ajuste del 24 de agosto y lo del 15 de septiembre son las mediciones. Y conviene fijar quién mide: el 40 % no lo publica nadie como tal. El autor del ajuste cuelga en su ficha las dos medias de su comparación A/B, 235 y 141 tokens; el porcentaje es la cuenta que sale de ahí. Su ficha sí da otros dos: un 63 % para la ablación y un 62 % para el ítem que se desboca. Lo que la salva no es un sello externo, sino que viene con la tabla entera.

Leer más: Hugging Face — hotdogs/Qwen3.8-27B-thinkingcap-abliterated ↗

En la suite difícil, el mismo acierto con menos tokens

Tokens de razonamiento en la suite difícil
Qwen3.8-27B base: 235tokens Qwen3.8-27B base 235tokens Solo ablado: 99tokens Solo ablado 99tokens Ablado + ThinkingCap: 141tokens Ablado + ThinkingCap 141tokens
Ver los datos en tabla
Qwen3.8-27B baseSolo abladoAblado + ThinkingCap
Tokens 235tokens99tokens141tokens
Medias comunicadas por el autor del ajuste. El acierto es idéntico en los tres: 70,0 %.
Suite difícil: 10 problemas de álgebra de varios pasos, media de 3 ejecuciones
Métrica Qwen3.8-27B base Solo ablado Ablado + ThinkingCap
Acierto 70,0 % 70,0 % 70,0 %
Tokens de razonamiento (media) 235 99 141
Caracteres de razonamiento (media) 636 235 358
Caracteres de razonamiento (mediana) 170 170 159
Medición hecha y publicada por el propio autor del ajuste en la ficha de su modelo, con el mismo arnés y temperatura 0. El recorte del 40 % de la columna de la derecha se mide contra el modelo base y va casi todo en un solo problema, en el que el base se desboca hasta 4.868 caracteres.

El banco de pruebas tiene dos suites y compara tres modelos a temperatura 0, con el mismo arnés. La difícil son 10 problemas de álgebra de varios pasos promediados en 3 ejecuciones, 30 ítems por modelo. Los tres son el «normal» —Qwen3.8-27B con MTP, sin tocar—, el «abliterated» y el «ablit+cap», que suma ThinkingCap al anterior.

El acierto es idéntico en los tres: 70,0 %, 21 de 30. Lo que cambia es el borrador, y de 235 a 141 tokens de media hay un 40 %. Pero la fila siguiente ya avisa: la mediana de caracteres apenas se mueve —170, 170 y 159—, y cuando la media cae y la mediana no, la media la lleva un caso, no el conjunto.

En la suite fácil no hay nada que recortar

Suite fácil: 52 ítems de una pasada, media de 5 ejecuciones
Métrica Qwen3.8-27B base Solo ablado Ablado + ThinkingCap
Acierto general 94,2 % 93,8 % 94,6 %
Tokens de razonamiento (media) 87 101 101
Tasa de rechazo más del 80 % 0 % 0 %
En prompts cortos no hay nada que recortar: los tres modelos caen dentro de su propia banda de ruido. La misma fuente y el mismo arnés que la tabla anterior.

La otra suite son 52 ítems de una sola pasada —opción múltiple, matemáticas cortas, acertijos— promediados en 5 ejecuciones, 260 ítems por modelo. Aquí el efecto no es pequeño: es inexistente. Los tres gastan prácticamente los mismos tokens de razonamiento, y las dos versiones retocadas usan incluso algo más de borrador que el modelo base.

Lo que sí cambia de forma radical en esta suite es otra cosa, y no es obra de ThinkingCap: la tasa de rechazo pasa de más del 80 % en el modelo base a un 0 % limpio en los otros dos. Ese salto lo firma la ablación.

El 40 % se lo lleva casi entero un solo problema

Los tres ítems que descolocan la media (caracteres de razonamiento)
Ítem de la suite difícil Qwen3.8-27B base Solo ablado Ablado + ThinkingCap
Trabajador que gana 750 dólares 4.868 852 1.843
Sylvia 169 168 349
Rectángulo 157 163 392
Cifras de la ficha del modelo, publicadas por el autor del ajuste, que da los diez ítems para los tres modelos. El base y el ablado se mueven en la misma horquilla; lo que se dispara es la versión con ThinkingCap.

El ítem que lo explica todo es un problema sobre un trabajador que gana 750 dólares. Ante ese enunciado el modelo base se desboca hasta 4.868 caracteres de razonamiento; ThinkingCap lo deja en 1.843, un 62 % menos, y la ablación sola, en 852. Ese caso aislado es el que tira de la media de toda la suite y el que fabrica el 40 %.

En dirección contraria hay dos ítems en los que ThinkingCap razona más que la versión solo ablada: Sylvia y el rectángulo, con 349 y 392 caracteres frente a 168 y 163. El autor lo explica sin adornos: la ablación le quitó al modelo sus atajos, así que razona más, y el ajuste recorta el desbocamiento pero no devuelve los atajos.

De ahí su veredicto, que debería acompañar a la cifra siempre que se cite: «ThinkingCap is runaway insurance, not a universal shrinker», un seguro contra el desbocamiento y no un reductor universal. El reductor grande es la ablación; el ajuste es la barandilla que se pone encima para el caso raro. Sigue siendo útil, porque la cola de peticiones interminables es la que arruina una latencia media, pero es otro producto.

El 45,8 % que circula es otro modelo y otra medición

Hay una segunda cifra dando vueltas y no es esta. Bottle Cap AI, autora de la familia original de ajustes ThinkingCap, la publica sobre Qwen3.6-27B, en su propio material y no en ninguna de las fuentes de esta pieza: un 45,8 % de reducción media de tokens de razonamiento con unos 0,7 puntos de variación de acierto en doce bancos de pruebas fuera de dominio. Otro modelo base, otra suite, otra medición. Lo mismo vale para los truncamientos, que bajan del 2,9 % al 0,4 %: son también de la versión sobre Qwen3.6-27B. Que dos ajustes compartan nombre no hace transferibles sus resultados.

Conclusión

Lo sólido aquí es la memoria: 27.000 millones de parámetros y un millón de tokens de contexto en 24,6 GiB cambian lo que cabe en un equipo de sobremesa, a condición de tener una Blackwell y de servirlo con vLLM. Lo del 40 % es más matizado, y lo matiza quien lo midió: en prompts fáciles no recorta nada, el reductor grande es la ablación y la media se la lleva un problema en el que el modelo base se desbocaba hasta 4.868 caracteres. Que el autor publique la tabla completa en lugar del porcentaje que le favorece es el dato más interesante de la ficha.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog