Aprenent IA

Mai no donis puntuació parcial: la frase que trenca el jutge LLM

El 24 de setembre de 2026 un equip de KAUST va publicar un preprint —sense revisió per parells— que prova 171 configuracions de correcció automàtica en un examen i 162 en un altre, tots dos d'aquesta mateixa universitat. La millor màquina se separa 1,64 punts sobre 35 de la nota humana i dos professors se separen 2,61: corregeix millor que dues persones. I es trenca amb un preàmbul de tres frases que qualsevol professor escriuria sense pensar. Aquest curs breu ensenya a mesurar-ho en el teu propi corrector i acaba a la sortida oposada: un model que no escriu la nota, la tria, amb xifres que dona el seu fabricant, Fastino.

Caricatura: una columnata aguanta un arquitrau amb només tres columnes dretes, totes de la mateixa pedra, i la resta convertida en runa amb els capitells de cara amunt; sota els fonaments, un professor acaba de ficar una planxa de ferro.
📷 Imatge generada amb IA

En resum

  • El preprint arXiv:2609.29333, del 24 de setembre de 2026 i signat per un equip de KAUST Academy, corregeix amb models de llenguatge els quaderns de codi de dos exàmens: 570 alumnes de visió per computador i 1.038 d'aprenentatge automàtic.
  • La millor configuració, gemini-3-flash-preview amb preàmbul neutral, es queda en 1,64 punts d'error sobre 35; dos correctors humans del mateix examen se separen 2,61.
  • El preàmbul de «corrector dur», que són tres frases, treu de la banda utilitzable 14 dels 17 models de pesos oberts, i tres d'aquests 14 deixen de corregir.
  • La frase «mai no donis puntuació parcial» es va provar sola sobre tres models, i en dos —Llama-3.1-8B i Mistral-Small-24B— va ser prou perquè deixessin de posar nota.
  • El paper anuncia dues vegades que allibera dades, graella d'ablacions i pipelines en un repositori de GitHub que, a 25 de setembre de 2026, retorna 404.

Un jutge LLM pot corregir millor que dos professors

Corregir exàmens a màquina ja és una pràctica amb proveïdors i amb pressa, i el que gairebé ningú no mesura és de què depèn el resultat. El treball que va publicar el 24 de setembre de 2026 un equip de KAUST ho mesura canviant una sola cosa alhora.

La tasca no són preguntes de test: són quaderns de codi de pràctiques, amb rúbrica i puntuació parcial. El prompt porta enunciat, rúbrica, solució de referència, quadern de l'alumne i el desglossament de cada ítem puntuable, i arriba a uns 22.000 caràcters a l'examen de visió per computador. I la correcció és estàtica, no s'executa res: quan el model diu «això no funciona», ningú no ho ha comprovat.

Sis configuracions corregeixen igual o millor que dues persones

Qui s'equivoca menys corregint l'examen de visió per computador
Corrector MAE sobre 35 IC 95 % Biaix Veredicte davant un corrector humà
Dos correctors humans entre ells (el terra) 2,61 2,37 – 2,85 — Referència · Pearson r = 0,868
gemini-3-flash-preview, prompt neutral 1,64 1,51 – 1,79 +0,01 Millor (d̄ = −0,54)
gemini-3.1-pro-preview amb prompt indulgent 1,79 1,62 – 1,95 +0,82 Millor (d̄ = −0,37)
gemini-3.1-pro-preview, prompt neutral 1,86 1,70 – 2,02 −0,82 Millor (d̄ = −0,37)
gemini-flash-lite amb raonament 2,05 1,89 – 2,21 −0,15 Igual que un corrector
gpt-5.5, prompt neutral 2,43 2,28 – 2,59 −1,65 Igual que un corrector
GLM-4-32B (el millor de pesos oberts) 2,68 — — Pitjor que un corrector
claude-opus-5, prompt neutral 3,54 3,31 – 3,77 −3,24 Pitjor que un corrector (d̄ = +1,13)
Examen de visió per computador, 570 alumnes corregits per dues persones, sobre 35 punts. MAE és l'error mitjà absolut contra la mitjana dels dos correctors: com més baix, més acord. El «veredicte» és el test aparellat del tercer corrector, que els autors fan servir precisament perquè la comparació amb el terra humà afavoreix la màquina: fer la mitjana de dos correctors cancel·la part del seu soroll. Biaix positiu és regalar punts; negatiu, treure'n. Preprint sense revisió per parells.

A 570 alumnes de l'examen de visió per computador els van corregir dues persones per separat, i la distància entre aquestes dues correccions —2,61 punts sobre 35— és el terra contra el qual es mesura qualsevol màquina. La millor configuració, gemini-3-flash-preview amb preàmbul neutral, es queda en 1,64.

Sis configuracions igualen o baixen aquest terra, però els autors avisen que la comparació afavoreix la màquina —fer la mitjana de dos correctors cancel·la part del seu soroll—, així que la repeteixen contra un tercer corrector: tres queden per sota d'un humà, tres al seu nivell i claude-opus-5 surt significativament pitjor, amb 3,54. Aquesta dada cal llegir-la amb l'escala al davant: és el que fa amb quaderns de codi i aquesta rúbrica, no una mesura general de la seva qualitat.

El terra humà amaga una loteria de correctors

Aquest 2,61 és una mitjana de deu parelles fixes, vint correctors repartint-se uns 57 alumnes cada dos, i per parella el desacord varia més de quatre vegades. La vara de mesurar no és «la nota veritable», que no existeix, sinó quant s'assemblen dues correccions humanes.

Un preàmbul de tres frases treu de la banda 14 dels 17 models de pesos oberts

El mateix model, el mateix examen, el mateix prompt: només canvia el preàmbul
  • Preàmbul neutral
  • Preàmbul de corrector dur
Preàmbul neutral · Mistral-Small-24B: 3,7MAE (punts sobre 35) Preàmbul de corrector dur · Mistral-Small-24B: 26MAE (punts sobre 35) Mistral-Small-24B Preàmbul neutral · Qwen2.5-Coder-14B: 3,5MAE (punts sobre 35) Preàmbul de corrector dur · Qwen2.5-Coder-14B: 24,5MAE (punts sobre 35) Qwen2.5-Coder-14B Preàmbul neutral · GLM-4-9B: 4,3MAE (punts sobre 35) Preàmbul de corrector dur · GLM-4-9B: 25,5MAE (punts sobre 35) GLM-4-9B Preàmbul neutral · Llama-3.1-8B: 7,3MAE (punts sobre 35) Preàmbul de corrector dur · Llama-3.1-8B: 26MAE (punts sobre 35) Llama-3.1-8B Preàmbul neutral · Gemma-3-27B: 4,3MAE (punts sobre 35) Preàmbul de corrector dur · Gemma-3-27B: 11,6MAE (punts sobre 35) Gemma-3-27B Preàmbul neutral · DeepSeek-Coder-V2-Lite: 6MAE (punts sobre 35) Preàmbul de corrector dur · DeepSeek-Coder-V2-Lite: 12,1MAE (punts sobre 35) DeepSeek-Coder-V2-Lite Preàmbul neutral · gemini-3.1-pro-preview: 1,9MAE (punts sobre 35) Preàmbul de corrector dur · gemini-3.1-pro-preview: 2,8MAE (punts sobre 35) gemini-3.1-pro-preview
Ver los datos en tabla
Mistral-Small-24BQwen2.5-Coder-14BGLM-4-9BLlama-3.1-8BGemma-3-27BDeepSeek-Coder-V2-Litegemini-3.1-pro-preview
Preàmbul neutral 3,7MAE (punts sobre 35)3,5MAE (punts sobre 35)4,3MAE (punts sobre 35)7,3MAE (punts sobre 35)4,3MAE (punts sobre 35)6MAE (punts sobre 35)1,9MAE (punts sobre 35)
Preàmbul de corrector dur 26MAE (punts sobre 35)24,5MAE (punts sobre 35)25,5MAE (punts sobre 35)26MAE (punts sobre 35)11,6MAE (punts sobre 35)12,1MAE (punts sobre 35)2,8MAE (punts sobre 35)
Un model per família de pesos oberts —el del salt més gran de cadascuna— i gemini-3.1-pro-preview com a referència tancada; els 17 models són al paper. Per damunt de 8 punts el model surt de la banda utilitzable, que els autors fixen en 3,07 vegades el desacord entre dos humans (2,61). Avís dels autors: en Mistral-Small-24B, Llama-3.1-8B i GLM-4-9B la barra de la dreta NO mesura gravetat, perquè aquests tres van deixar de corregir i el seu error és el sostre, la distància a la nota mitjana. Preprint sense revisió per parells.

El preàmbul per defecte és neutral: «ets un ajudant de professor estricte però just». El dur diu tres coses: que ets un ajudant de professor dur, que posis la nota mínima defensable a qualsevol tasca incompleta, amb errors o que es desviï de la rúbrica, i que mai no donis puntuació parcial si la tasca no funciona correctament. Res més del prompt canvia.

Amb aquest canvi, i només aquest, 14 dels 17 models de pesos oberts se surten de la banda utilitzable a l'examen de visió, amb les sis famílies representades, i l'error es multiplica per entre 1,69 i 7,11. La banda no és un llindar inventat: els autors la fixen en 3,07 vegades el desacord entre dos humans, que aquí són 8 punts sobre 35.

Tres d'aquests 14 deixen de corregir: Llama-3.1-8B i Mistral-Small-24B atorguen 0,00 punts de mitjana als 570 alumnes i GLM-4-9B es queda en 0,56. La seva xifra d'error no mesura gravetat, sinó el sostre, la distància a la nota mitjana, perquè no corregeixen. I el dany no està ordenat per mida: els tres que aguanten són de la mateixa família, i els autors avisen que allà mida i família no es poden separar.

No és el to: són dues frases que prohibeixen donar punts

L'explicació fàcil seria el to, i no ho és: canviar només l'adjectiu —estricte, rigorós, just— mou l'error entre 0,94 i 2,15 punts en cinc models i sense direcció constant; amb «just» i la mateixa política dura, Mistral-Small-24B continuava sense corregir.

El que fa el dany són les dues ordres de política, i un 2 × 2 sobre tres models les separa. El marc només mou menys de dos punts; les dues juntes porten aquests models a entre 20,26 i 26,04; i la frase «mai no donis puntuació parcial», sola, és prou perquè dos dels tres —Llama-3.1-8B i Mistral-Small-24B— deixin de posar nota.

L'altra ordre tampoc no és innòcua: sola porta Llama-3.1-8B a 23,45 i en Qwen2.5-Coder-32B fa més dany que ella, així que quina domina depèn de la família. I el vocabulari no compta: altres preàmbuls durs sense aquestes dues ordres treuen de la banda dos models, no catorze.

El mateix error amaga tres avaries diferents

Dos models amb el mateix error poden estar fent coses diferents, i l'error no les distingeix. La pregunta que sí: dels alumnes amb zero a la primera pregunta, quina fracció va treure alguna cosa diferent de zero a la segona? Amb això les 19 execucions dures es parteixen en tres grups —cinc de zero general, cinc de col·lapse selectiu i nou de severitat uniforme—: Gemma-3-27B arriba a un error alt sense posar ni un sol zero a la primera pregunta, i GLM-4-32B, amb un error menor, en posa 273.

En el grup selectiu els dos canals de sortida es contradiuen a la mateixa resposta: en les dues execucions anotades a mà, el 20 % i el 43 % dels treballs amb zero porten una justificació que detalla puntuació parcial mentre el camp de la nota posa 0. Però això no explica els altres dos grups, i la predicció més clara d'aquesta hipòtesi falla: treure el desglossament de la rúbrica empitjora el col·lapse en cinc de cinc famílies. Els autors deixen l'avaria classificada, no explicada.

En el segon examen l'efecte canvia de signe

L'experiment es repeteix a l'examen d'aprenentatge automàtic: 1.038 alumnes corregits per dues persones, uns 65 punts d'escala, 162 configuracions i un terra humà de 5,13. El preàmbul dur empitjora deu models, en treu tres de la banda i un el porta a la negativa absoluta —una altra vegada Llama-3.1-8B— i en millora set.

Millora, i no és bona notícia: aquests set puntuen de més amb el prompt neutral i la duresa els cancel·la part del regal. Un efecte que canvia de signe entre exàmens no és un comandament de calibratge, resumeixen els autors. Aquí hi ha el límit del treball: cobreix dos cursos, dues rúbriques i dues escales, però una sola institució, no dues universitats. I entre els 17 models provats en els dos exàmens l'error neutral no correlaciona.

El paper promet un repositori que no obre

El treball diu dues vegades, amb l'adreça posada, que allibera el conjunt de dades anonimitzat, la graella completa d'ablacions i els pipelines de correcció, afinament i anàlisi en un repositori de GitHub de KAUST Academy. A 25 de setembre de 2026 no obre: retorna 404, també amb petició autenticada. L'organització existeix i té 41 repositoris públics, i cap no és aquest; tampoc no hi ha res d'aquest autor a Hugging Face, la plataforma on es distribueixen els models oberts.

Així que només es pot escriure d'una manera: el paper anuncia que l'allibera i avui l'enllaç no obre, de manera que ningú no pot refer els seus números. És, en si mateixa, la primera lliçó del dia. I l'exercici que de debò ensenya alguna cosa no necessita el repositori de ningú.

L'exercici: trenca el teu propi corrector, pas a pas

Cal poc: entre 10 i 20 treballs ja corregits a mà, millor per dues persones diferents; la seva rúbrica; i un model al qual puguis cridar dues vegades amb el mateix text.

Pas 1. Munta el prompt complet —enunciat, rúbrica, solució de referència, directrius, desglossament de cada ítem puntuable i el treball de l'alumne—, amb una crida per pregunta i que retorni nota i justificació. Un prompt de correcció és un document llarg, no una frase.

Pas 2. Fixa el teu terra: la mitjana de les diferències absolutes entre les dues correccions humanes. Aquest nombre és la teva vara de mesurar i sol ser més gran del que esperaves.

Pas 3. Corregeix amb preàmbul neutral —«ets un ajudant de professor estricte però just»— i calcula, contra la mitjana de les dues notes humanes, l'error absolut mitjà i el biaix, que és el mateix error amb signe. El biaix diu si estàs regalant punts o traient-los.

Pas 4. Canvia només el preàmbul, enganxant al davant les tres frases del corrector dur sense tocar la resta, i apunta l'error nou i el quocient entre dur i neutral. Si canvien dues coses alhora, el nombre no serveix.

Classificar l'avaria i aïllar la frase culpable

Pas 5. No mesuris només, classifica. A quin percentatge de treballs ha posat zero i amb quina desviació típica? I dels que tenen zero a la primera pregunta, quants tenen alguna cosa diferent de zero a la segona? Amb això distingeixes una negativa —almenys el 90 % a zero i desviació per sota de 0,5—, un col·lapse —error per damunt de tres vegades el teu terra, però que continua distingint alumnes— i una severitat uniforme.

Pas 6. Aïlla la frase culpable amb quatre execucions: només el marc, marc més l'ordre de nota mínima, marc més la prohibició de puntuació parcial, i les tres juntes.

Pas 7. Llegeix les justificacions dels zeros i busca treballs amb nota 0 la justificació dels quals enumeri punts parcials: allà tens el col·lapse selectiu, amb la nota obeint la prohibició i la prosa obeint la rúbrica.

La regla que s'emporta el lector: mai no ordenis a un corrector automàtic retenir punts, i verifica el model contra el teu prompt i el teu examen, perquè la mateixa frase que destrossa un pot millorar-ne un altre per cancel·lació de biaix. I dona sempre el biaix al costat de l'error: dos preàmbuls poden tenir un error semblant i fer dany en direccions oposades.

Amb exàmens corregits a casa, afinar guanya a remenar el prompt

L'arranjament que proposa el paper no és un prompt millor. Cinc models petits de tres famílies, de 4.000 a 30.000 milions de paràmetres, s'afinen amb LoRA sobre les notes que ja hi havia a casa —les dels dos correctors humans, promitjades—, uns 3.900 exemples, sense que cap adaptador vegi un alumne reservat.

Els cinc acaben en paritat o millor que un corrector humà en els dos exàmens, inclòs el que començava pitjor, i la recepta que guanya és la simple, la que només fa servir notes humanes. El que importa aquí: l'escombratge de preàmbuls que costa fins a 20 punts d'error als models base mou els adaptadors com a màxim 0,32.

L'altra sortida: que no hi hagi nota per retenir

El mateix 24 de setembre de 2026, Fastino Labs va publicar GLiNER2.5-Decide, un model de decisió de 340 milions de paràmetres que no escriu la nota: la tria. Està construït sobre el codificador DeBERTa-v3-large i no és generatiu, així que no produeix un text del qual després calgui treure un nombre amb pinces.

Les seves xifres les mesura i les publica Fastino, que ven el model: el seu banc de proves «Fast Decisions» és intern, amb 5.100 exemples en 17 conjunts, i allà el model treu un 60,1 % d'encert exacte de mitjana. No hi ha avaluació independent, i l'empresa mateixa adverteix que aquest banc no és un de referència.

Llegir-ne més: Fastino Labs — GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making ↗

Un esquema de preguntes tipades en lloc d'un prompt

L'entrada d'aquest model no és una instrucció en prosa: és un text més un esquema. Cada pregunta declara quines respostes es permeten i quantes n'espera —una, diverses o un valor ordenat—, i pot portar exemples, descripcions de cada resposta i regles que connecten les respostes d'unes preguntes amb les d'unes altres.

Aquí hi ha la diferència amb la fallada del paper, i és d'arquitectura, no de redacció: un jutge LLM ha de produir un nombre i una ordre el pot convèncer de retenir-lo; en un esquema tancat no hi ha puntuació per retenir, només respostes permeses entre les quals triar.

Descodificar totes les preguntes alhora

El codificador processa el text i l'esquema junts i puntua la compatibilitat de cada resposta permesa; després, un descodificador restringit busca l'assignació conjunta de puntuació més alta que deixen passar les regles declarades, en una sola passada cap endavant. Les regles expressables són implicacions, exclusions, límits de cardinalitat i cotes ordinals.

L'exemple de l'empresa ho explica millor que qualsevol definició: preguntat alhora si un prompt és segur i de quin tipus de dany és, per separat detecta la injecció amb 0,82 de confiança mentre qualifica de segur aquest mateix prompt amb 0,52. En conjunt, sota la regla que qualsevol dany obliga a un veredicte d'insegur, retorna la combinació coherent. Això ho descriu el blog de l'empresa, no la targeta del model.

Cap en una xarxa tancada i corre al processador

Per mida, es desplega on no entra un model de llenguatge gran: Fastino mesura 167,3 ms de mediana per a un document de 64 tokens en un processador Xeon de 48 nuclis virtuals, i diu que en desplegaments de poc volum la inferència només en CPU continua essent pràctica. Per a un centre educatiu l'interessant no és la velocitat: és que els exàmens no han de sortir de la seva xarxa.

El mateix fabricant proposa el seu model com a jutge LLM

El cercle el tanca la mateixa empresa a la seva llista de casos d'ús, on apareix «LLM-as-a-judge»: expressar els criteris de la rúbrica com a preguntes categòriques o ordinals i retornar els valors triats amb les seves distribucions de probabilitat. És la tasca que una frase trenca al paper de KAUST, plantejada de manera que no hi hagi nota per retenir. Els pesos van sota Apache 2.0 i la biblioteca que els executa, a part i amb la mateixa llicència; admet afinament complet o amb LoRA, l'altre arranjament del paper.

I cal dir el que no hi ha: ningú no ha mesurat aquest model corregint els exàmens de KAUST. El paper documenta la fallada i l'empresa ofereix una arquitectura que per disseny no la té; no és un resultat comparat, és una proposta de mecanisme.

Conclusió

El resultat que més titular dona —una màquina que corregeix exàmens millor que dos professors— se sosté sobre tres frases de cortesia al començament del prompt, i una d'elles és la que qualsevol escriuria sense pensar: mai no donis puntuació parcial. La lliçó pràctica no depèn del repositori que el paper promet i no obre; amb vint treballs ja corregits, dues crides i set passos, qualsevol pot mesurar si aquesta frase apaga el seu corrector i classificar l'avaria en lloc de conformar-se amb un nombre. I hi ha dues sortides per quan l'apagui: afinar amb les notes que ja estan corregides a casa, o treure del sistema la nota que es pot retenir.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuació natural

    Aprèn IA al teu ritme amb els nostres cursos gratuïts.

    A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.

    APRENDRE AMB TAKU

    ← Torna al blog