Codi obert

Qwen3.8-27B en NVFP4: 27.000 milions de paràmetres en 24,6 GiB

Qwen3.8-27B, el model dens de 27.000 milions de paràmetres de l'equip Qwen, cap comprimit a quatre bits en 24,6 GiB amb un milió de tokens de context. A sobre porta un ajust, ThinkingCap, que retalla un 40 % els tokens de raonament en els problemes difícils. La xifra la mesura i la publica el mateix autor de l'ajust, i la seva pròpia taula explica que la retallada ni és universal ni és mèrit seu del tot.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Qwen3.8-27B en NVFP4: 27.000 millones de parámetros en 24,6 GiB
📷 Imatge generada amb IA

En resum

  • Qwen3.8-27B es va publicar l'agost de 2026 i la seva quantització NVFP4 aquella mateixa tarda: els pesos ocupen 24,6 GiB. El context va a part, i a un milió de tokens la memòria cau suma 6,6 milions de tokens de KV.
  • Exigeix una GPU de la generació Blackwell de NVIDIA i se serveix amb vLLM o amb SGLang.
  • La versió amb ThinkingCap la va publicar el compte «hotdogs» a Hugging Face el 24 d'agost de 2026; les mesures del 40 % són del 15 de setembre.
  • A la suite difícil els tres models comparats encerten el mateix, un 70,0 %, i l'ajust baixa la mitjana de 235 a 141 tokens de raonament.
  • A la suite fàcil la retallada desapareix: 87, 101 i 101 tokens, dins del seu propi soroll.

27.000 milions de paràmetres en 24,6 GiB

Qwen3.8-27B és el model dens que l'equip Qwen, del grup xinès de comerç electrònic i núvol Alibaba, va publicar l'agost de 2026: atenció híbrida —lineal en 48 de les seves 64 capes—, torre de visió i capçal d'esborrany MTP incorporat. El seu context natiu és de 262.000 tokens i s'estira fins a un milió amb YaRN, una tècnica d'extensió; la fitxa mateixa de NVIDIA serveix el model amb 262.144.

La compressió no ho tracta tot igual: NVFP4 a les capes MLP i al capçal del model de llenguatge, FP8 a les d'autoatenció i atenció lineal. Unsloth —projecte que publica quantitzacions i eines per ajustar models oberts— la construeix amb Unsloth Dynamic V3.0, encara preliminar. En surten 24,6 GiB de fitxer —els pesos, no la memòria cau— i una velocitat al voltant d'1,5 vegades la dels punts de control en BF16. A un milió de tokens de context, la memòria cau KV hi afegeix 6,6 milions de tokens per sobre d'aquesta xifra. La compressió costa una mica d'encert: Unsloth xifra en un 92-97 % la precisió conservada, un 96,68 % en codi i un 92,15 % en conversa.

La lletra petita és el maquinari: NVFP4 exigeix una GPU de la generació Blackwell de NVIDIA i se serveix amb vLLM, el motor de codi obert per desplegar models de llenguatge, i també amb SGLang, que la fitxa de NVIDIA documenta amb la seva pròpia ordre. A Hugging Face, la plataforma estatunidenca on es publiquen els models oberts, ja hi ha versions d'aquesta quantització de tres procedències: nvidia, unsloth i RadixArk. Sense una Blackwell, Qwen3.8 s'executa en altres formats amb llama.cpp o amb Unsloth Desktop.

Llegir-ne més: Hugging Face — nvidia/Qwen3.8-27B-NVFP4 ↗

ThinkingCap és un ajust perquè el model pensi menys

ThinkingCap és un ajust fi —SFT amb LoRA— perquè un model de raonament pensi menys sense perdre encert. La família original la publica Bottle Cap AI sobre Qwen3.6-27B. La d'avui és una altra: l'aplicada sobre Qwen3.8-27B pel compte «hotdogs» a Hugging Face el 24 d'agost de 2026, amb llicència Apache-2.0.

La fitxa dona un detall poc habitual: LoRA fusionada amb r=32 i alpha=64 sobre totes les capes lineals i les in_proj de GDN, 339 files de SFT, una època, set RTX 3090 i una pèrdua d'avaluació de 0,2143. El conjunt de dades porta 369 parells SFT i 244 DPO, verificats per oracle en un 84,2 %.

Convé fixar el calendari, perquè res d'això no és d'ahir: el model és d'agost, l'ajust és del 24 d'agost i el que és del 15 de setembre són les mesures. I convé fixar qui mesura: el 40 % no el publica ningú com a tal. L'autor de l'ajust penja a la seva fitxa les dues mitjanes de la seva comparació A/B, 235 i 141 tokens; el percentatge és el compte que en surt. La seva fitxa sí que en dona dos més: un 63 % per a l'ablació i un 62 % per a l'ítem que es desboca. El que la salva no és un segell extern, sinó que ve amb la taula sencera.

Llegir-ne més: Hugging Face — hotdogs/Qwen3.8-27B-thinkingcap-abliterated ↗

A la suite difícil, el mateix encert amb menys tokens

Tokens de raonament a la suite difícil
Qwen3.8-27B base: 235tokens Qwen3.8-27B base 235tokens Només ablat: 99tokens Només ablat 99tokens Ablat + ThinkingCap: 141tokens Ablat + ThinkingCap 141tokens
Ver los datos en tabla
Qwen3.8-27B baseNomés ablatAblat + ThinkingCap
Tokens 235tokens99tokens141tokens
Mitjanes comunicades per l'autor de l'ajust. L'encert és idèntic en tots tres: 70,0 %.
Suite difícil: 10 problemes d'àlgebra de diversos passos, mitjana de 3 execucions
Mètrica Qwen3.8-27B base Només ablat Ablat + ThinkingCap
Encert 70,0 % 70,0 % 70,0 %
Tokens de raonament (mitjana) 235 99 141
Caràcters de raonament (mitjana) 636 235 358
Caràcters de raonament (mediana) 170 170 159
Mesura feta i publicada pel mateix autor de l'ajust a la fitxa del seu model, amb el mateix arnès i temperatura 0. La retallada del 40 % de la columna de la dreta es mesura contra el model base i va gairebé tota en un sol problema, en què el base es desboca fins a 4.868 caràcters.

El banc de proves té dues suites i compara tres models a temperatura 0, amb el mateix arnès. La difícil són 10 problemes d'àlgebra de diversos passos promitjats en 3 execucions, 30 ítems per model. Els tres són el «normal» —Qwen3.8-27B amb MTP, sense tocar—, l'«abliterated» i l'«ablit+cap», que suma ThinkingCap a l'anterior.

L'encert és idèntic en tots tres: 70,0 %, 21 de 30. El que canvia és l'esborrany, i de 235 a 141 tokens de mitjana hi ha un 40 %. Però la fila següent ja avisa: la mediana de caràcters amb prou feines es mou —170, 170 i 159—, i quan la mitjana cau i la mediana no, la mitjana se l'endú un cas, no el conjunt.

A la suite fàcil no hi ha res a retallar

Suite fàcil: 52 ítems d'una passada, mitjana de 5 execucions
Mètrica Qwen3.8-27B base Només ablat Ablat + ThinkingCap
Encert general 94,2 % 93,8 % 94,6 %
Tokens de raonament (mitjana) 87 101 101
Taxa de rebuig més del 80 % 0 % 0 %
En prompts curts no hi ha res a retallar: els tres models cauen dins de la seva pròpia banda de soroll. La mateixa font i el mateix arnès que la taula anterior.

L'altra suite són 52 ítems d'una sola passada —opció múltiple, matemàtiques curtes, endevinalles— promitjats en 5 execucions, 260 ítems per model. Aquí l'efecte no és petit: és inexistent. Tots tres gasten pràcticament els mateixos tokens de raonament, i les dues versions retocades fan servir fins i tot una mica més d'esborrany que el model base.

El que sí que canvia de manera radical en aquesta suite és una altra cosa, i no és obra de ThinkingCap: la taxa de rebuig passa de més del 80 % en el model base a un 0 % net en els altres dos. Aquest salt el signa l'ablació.

El 40 % se l'endú gairebé sencer un sol problema

Els tres ítems que descol·loquen la mitjana (caràcters de raonament)
Ítem de la suite difícil Qwen3.8-27B base Només ablat Ablat + ThinkingCap
Treballador que guanya 750 dòlars 4.868 852 1.843
Sylvia 169 168 349
Rectangle 157 163 392
Xifres de la fitxa del model, publicades per l'autor de l'ajust, que dona els deu ítems per als tres models. El base i l'ablat es mouen a la mateixa forquilla; el que es dispara és la versió amb ThinkingCap.

L'ítem que ho explica tot és un problema sobre un treballador que guanya 750 dòlars. Davant d'aquest enunciat el model base es desboca fins a 4.868 caràcters de raonament; ThinkingCap el deixa en 1.843, un 62 % menys, i l'ablació sola, en 852. Aquest cas aïllat és el que estira la mitjana de tota la suite i el que fabrica el 40 %.

En direcció contrària hi ha dos ítems en què ThinkingCap raona més que la versió només ablada: Sylvia i el rectangle, amb 349 i 392 caràcters davant de 168 i 163. L'autor ho explica sense adorns: l'ablació va treure al model les seves dreceres, així que raona més, i l'ajust retalla el desbocament però no retorna les dreceres.

D'aquí el seu veredicte, que hauria d'acompanyar la xifra sempre que se citi: «ThinkingCap is runaway insurance, not a universal shrinker», una assegurança contra el desbocament i no un reductor universal. El reductor gran és l'ablació; l'ajust és la barana que s'hi posa a sobre per al cas rar. Continua sent útil, perquè la cua de peticions interminables és la que arruïna una latència mitjana, però és un altre producte.

El 45,8 % que circula és un altre model i una altra mesura

Hi ha una segona xifra que dona voltes i no és aquesta. Bottle Cap AI, autora de la família original d'ajustos ThinkingCap, la publica sobre Qwen3.6-27B, en el seu propi material i no en cap de les fonts d'aquesta peça: un 45,8 % de reducció mitjana de tokens de raonament amb uns 0,7 punts de variació d'encert en dotze bancs de proves fora de domini. Un altre model base, una altra suite, una altra mesura. El mateix val per als truncaments, que baixen del 2,9 % al 0,4 %: també són de la versió sobre Qwen3.6-27B. Que dos ajustos comparteixin nom no fa transferibles els seus resultats.

Conclusió

El que és sòlid aquí és la memòria: 27.000 milions de paràmetres i un milió de tokens de context en 24,6 GiB canvien el que cap en un equip de sobretaula, a condició de tenir una Blackwell i de servir-lo amb vLLM. El del 40 % és més matisat, i ho matisa qui ho va mesurar: en prompts fàcils no retalla res, el reductor gran és l'ablació i la mitjana se l'endú un problema en què el model base es desbocava fins a 4.868 caràcters. Que l'autor publiqui la taula sencera en lloc del percentatge que l'afavoreix és la dada més interessant de la fitxa.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog