Codi obert
Qwen3.8-27B en NVFP4: 27.000 milions de paràmetres en 24,6 GiB
Qwen3.8-27B, el model dens de 27.000 milions de paràmetres de l'equip Qwen, cap comprimit a quatre bits en 24,6 GiB amb un milió de tokens de context. A sobre porta un ajust, ThinkingCap, que retalla un 40 % els tokens de raonament en els problemes difícils. La xifra la mesura i la publica el mateix autor de l'ajust, i la seva pròpia taula explica que la retallada ni és universal ni és mèrit seu del tot.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Qwen3.8-27B es va publicar l'agost de 2026 i la seva quantització NVFP4 aquella mateixa tarda: els pesos ocupen 24,6 GiB. El context va a part, i a un milió de tokens la memòria cau suma 6,6 milions de tokens de KV.
- Exigeix una GPU de la generació Blackwell de NVIDIA i se serveix amb vLLM o amb SGLang.
- La versió amb ThinkingCap la va publicar el compte «hotdogs» a Hugging Face el 24 d'agost de 2026; les mesures del 40 % són del 15 de setembre.
- A la suite difícil els tres models comparats encerten el mateix, un 70,0 %, i l'ajust baixa la mitjana de 235 a 141 tokens de raonament.
- A la suite fàcil la retallada desapareix: 87, 101 i 101 tokens, dins del seu propi soroll.
27.000 milions de paràmetres en 24,6 GiB
Qwen3.8-27B és el model dens que l'equip Qwen, del grup xinès de comerç electrònic i núvol Alibaba, va publicar l'agost de 2026: atenció híbrida —lineal en 48 de les seves 64 capes—, torre de visió i capçal d'esborrany MTP incorporat. El seu context natiu és de 262.000 tokens i s'estira fins a un milió amb YaRN, una tècnica d'extensió; la fitxa mateixa de NVIDIA serveix el model amb 262.144.
La compressió no ho tracta tot igual: NVFP4 a les capes MLP i al capçal del model de llenguatge, FP8 a les d'autoatenció i atenció lineal. Unsloth —projecte que publica quantitzacions i eines per ajustar models oberts— la construeix amb Unsloth Dynamic V3.0, encara preliminar. En surten 24,6 GiB de fitxer —els pesos, no la memòria cau— i una velocitat al voltant d'1,5 vegades la dels punts de control en BF16. A un milió de tokens de context, la memòria cau KV hi afegeix 6,6 milions de tokens per sobre d'aquesta xifra. La compressió costa una mica d'encert: Unsloth xifra en un 92-97 % la precisió conservada, un 96,68 % en codi i un 92,15 % en conversa.
La lletra petita és el maquinari: NVFP4 exigeix una GPU de la generació Blackwell de NVIDIA i se serveix amb vLLM, el motor de codi obert per desplegar models de llenguatge, i també amb SGLang, que la fitxa de NVIDIA documenta amb la seva pròpia ordre. A Hugging Face, la plataforma estatunidenca on es publiquen els models oberts, ja hi ha versions d'aquesta quantització de tres procedències: nvidia, unsloth i RadixArk. Sense una Blackwell, Qwen3.8 s'executa en altres formats amb llama.cpp o amb Unsloth Desktop.
ThinkingCap és un ajust perquè el model pensi menys
ThinkingCap és un ajust fi —SFT amb LoRA— perquè un model de raonament pensi menys sense perdre encert. La família original la publica Bottle Cap AI sobre Qwen3.6-27B. La d'avui és una altra: l'aplicada sobre Qwen3.8-27B pel compte «hotdogs» a Hugging Face el 24 d'agost de 2026, amb llicència Apache-2.0.
La fitxa dona un detall poc habitual: LoRA fusionada amb r=32 i alpha=64 sobre totes les capes lineals i les in_proj de GDN, 339 files de SFT, una època, set RTX 3090 i una pèrdua d'avaluació de 0,2143. El conjunt de dades porta 369 parells SFT i 244 DPO, verificats per oracle en un 84,2 %.
Convé fixar el calendari, perquè res d'això no és d'ahir: el model és d'agost, l'ajust és del 24 d'agost i el que és del 15 de setembre són les mesures. I convé fixar qui mesura: el 40 % no el publica ningú com a tal. L'autor de l'ajust penja a la seva fitxa les dues mitjanes de la seva comparació A/B, 235 i 141 tokens; el percentatge és el compte que en surt. La seva fitxa sí que en dona dos més: un 63 % per a l'ablació i un 62 % per a l'ítem que es desboca. El que la salva no és un segell extern, sinó que ve amb la taula sencera.
Llegir-ne més: Hugging Face — hotdogs/Qwen3.8-27B-thinkingcap-abliterated ↗
A la suite difícil, el mateix encert amb menys tokens
Ver los datos en tabla
| Qwen3.8-27B base | Només ablat | Ablat + ThinkingCap | |
|---|---|---|---|
| Tokens | 235tokens | 99tokens | 141tokens |
| Mètrica | Qwen3.8-27B base | Només ablat | Ablat + ThinkingCap |
|---|---|---|---|
| Encert | 70,0 % | 70,0 % | 70,0 % |
| Tokens de raonament (mitjana) | 235 | 99 | 141 |
| Caràcters de raonament (mitjana) | 636 | 235 | 358 |
| Caràcters de raonament (mediana) | 170 | 170 | 159 |
El banc de proves té dues suites i compara tres models a temperatura 0, amb el mateix arnès. La difícil són 10 problemes d'àlgebra de diversos passos promitjats en 3 execucions, 30 ítems per model. Els tres són el «normal» —Qwen3.8-27B amb MTP, sense tocar—, l'«abliterated» i l'«ablit+cap», que suma ThinkingCap a l'anterior.
L'encert és idèntic en tots tres: 70,0 %, 21 de 30. El que canvia és l'esborrany, i de 235 a 141 tokens de mitjana hi ha un 40 %. Però la fila següent ja avisa: la mediana de caràcters amb prou feines es mou —170, 170 i 159—, i quan la mitjana cau i la mediana no, la mitjana se l'endú un cas, no el conjunt.
A la suite fàcil no hi ha res a retallar
| Mètrica | Qwen3.8-27B base | Només ablat | Ablat + ThinkingCap |
|---|---|---|---|
| Encert general | 94,2 % | 93,8 % | 94,6 % |
| Tokens de raonament (mitjana) | 87 | 101 | 101 |
| Taxa de rebuig | més del 80 % | 0 % | 0 % |
L'altra suite són 52 ítems d'una sola passada —opció múltiple, matemàtiques curtes, endevinalles— promitjats en 5 execucions, 260 ítems per model. Aquí l'efecte no és petit: és inexistent. Tots tres gasten pràcticament els mateixos tokens de raonament, i les dues versions retocades fan servir fins i tot una mica més d'esborrany que el model base.
El que sí que canvia de manera radical en aquesta suite és una altra cosa, i no és obra de ThinkingCap: la taxa de rebuig passa de més del 80 % en el model base a un 0 % net en els altres dos. Aquest salt el signa l'ablació.
El 40 % se l'endú gairebé sencer un sol problema
| Ítem de la suite difícil | Qwen3.8-27B base | Només ablat | Ablat + ThinkingCap |
|---|---|---|---|
| Treballador que guanya 750 dòlars | 4.868 | 852 | 1.843 |
| Sylvia | 169 | 168 | 349 |
| Rectangle | 157 | 163 | 392 |
L'ítem que ho explica tot és un problema sobre un treballador que guanya 750 dòlars. Davant d'aquest enunciat el model base es desboca fins a 4.868 caràcters de raonament; ThinkingCap el deixa en 1.843, un 62 % menys, i l'ablació sola, en 852. Aquest cas aïllat és el que estira la mitjana de tota la suite i el que fabrica el 40 %.
En direcció contrària hi ha dos ítems en què ThinkingCap raona més que la versió només ablada: Sylvia i el rectangle, amb 349 i 392 caràcters davant de 168 i 163. L'autor ho explica sense adorns: l'ablació va treure al model les seves dreceres, així que raona més, i l'ajust retalla el desbocament però no retorna les dreceres.
D'aquí el seu veredicte, que hauria d'acompanyar la xifra sempre que se citi: «ThinkingCap is runaway insurance, not a universal shrinker», una assegurança contra el desbocament i no un reductor universal. El reductor gran és l'ablació; l'ajust és la barana que s'hi posa a sobre per al cas rar. Continua sent útil, perquè la cua de peticions interminables és la que arruïna una latència mitjana, però és un altre producte.
El 45,8 % que circula és un altre model i una altra mesura
Hi ha una segona xifra que dona voltes i no és aquesta. Bottle Cap AI, autora de la família original d'ajustos ThinkingCap, la publica sobre Qwen3.6-27B, en el seu propi material i no en cap de les fonts d'aquesta peça: un 45,8 % de reducció mitjana de tokens de raonament amb uns 0,7 punts de variació d'encert en dotze bancs de proves fora de domini. Un altre model base, una altra suite, una altra mesura. El mateix val per als truncaments, que baixen del 2,9 % al 0,4 %: també són de la versió sobre Qwen3.6-27B. Que dos ajustos comparteixin nom no fa transferibles els seus resultats.
Conclusió
El que és sòlid aquí és la memòria: 27.000 milions de paràmetres i un milió de tokens de context en 24,6 GiB canvien el que cap en un equip de sobretaula, a condició de tenir una Blackwell i de servir-lo amb vLLM. El del 40 % és més matisat, i ho matisa qui ho va mesurar: en prompts fàcils no retalla res, el reductor gran és l'ablació i la mitjana se l'endú un problema en què el model base es desbocava fins a 4.868 caràcters. Que l'autor publiqui la taula sencera en lloc del percentatge que l'afavoreix és la dada més interessant de la fitxa.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios