Aprendiendo IA
Nunca des puntuación parcial: la frase que rompe al juez LLM
El 24 de septiembre de 2026 un equipo de KAUST publicó un preprint —sin revisión por pares— que prueba 171 configuraciones de corrección automática en un examen y 162 en otro, los dos de esa misma universidad. La mejor máquina se separa 1,64 puntos sobre 35 de la nota humana y dos profesores se separan 2,61: corrige mejor que dos personas. Y se rompe con un preámbulo de tres frases que cualquier profesor escribiría sin pensar. Este curso breve enseña a medirlo en tu propio corrector y acaba en la salida opuesta: un modelo que no escribe la nota, la elige, con cifras que da su fabricante, Fastino.
En resumen
- El preprint arXiv:2609.29333, del 24 de septiembre de 2026 y firmado por un equipo de KAUST Academy, corrige con modelos de lenguaje los cuadernos de código de dos exámenes: 570 alumnos en visión por computador y 1.038 en aprendizaje automático.
- La mejor configuración, gemini-3-flash-preview con preámbulo neutral, se queda en 1,64 puntos de error sobre 35; dos correctores humanos del mismo examen se separan 2,61.
- El preámbulo de «corrector duro», que son tres frases, saca de la banda utilizable a 14 de los 17 modelos de pesos abiertos, y tres de esos 14 dejan de corregir.
- La frase «nunca des puntuación parcial» se probó sola sobre tres modelos, y en dos de ellos —Llama-3.1-8B y Mistral-Small-24B— bastó para que dejaran de poner nota.
- El paper anuncia dos veces que libera datos, rejilla de ablaciones y pipelines en un repositorio de GitHub que, a 25 de septiembre de 2026, devuelve 404.
Un juez LLM puede corregir mejor que dos profesores
Corregir exámenes a máquina ya es una práctica con proveedores y con prisa, y lo que casi nadie mide es de qué depende el resultado. El trabajo que publicó el 24 de septiembre de 2026 un equipo de KAUST lo mide cambiando una sola cosa a la vez.
La tarea no son preguntas de test: son cuadernos de código de prácticas, con rúbrica y puntuación parcial. El prompt lleva enunciado, rúbrica, solución de referencia, cuaderno del alumno y el desglose de cada ítem puntuable, y llega a unos 22.000 caracteres en el examen de visión por computador. Y la corrección es estática, no se ejecuta nada: cuando el modelo dice «esto no funciona», nadie lo ha comprobado.
Seis configuraciones corrigen igual o mejor que dos personas
| Corrector | MAE sobre 35 | IC 95 % | Sesgo | Veredicto frente a un corrector humano |
|---|---|---|---|---|
| Dos correctores humanos entre sí (el suelo) | 2,61 | 2,37 – 2,85 | — | Referencia · Pearson r = 0,868 |
| gemini-3-flash-preview, prompt neutral | 1,64 | 1,51 – 1,79 | +0,01 | Mejor (d̄ = −0,54) |
| gemini-3.1-pro-preview con prompt indulgente | 1,79 | 1,62 – 1,95 | +0,82 | Mejor (d̄ = −0,37) |
| gemini-3.1-pro-preview, prompt neutral | 1,86 | 1,70 – 2,02 | −0,82 | Mejor (d̄ = −0,37) |
| gemini-flash-lite con razonamiento | 2,05 | 1,89 – 2,21 | −0,15 | Igual que un corrector |
| gpt-5.5, prompt neutral | 2,43 | 2,28 – 2,59 | −1,65 | Igual que un corrector |
| GLM-4-32B (el mejor de pesos abiertos) | 2,68 | — | — | Peor que un corrector |
| claude-opus-5, prompt neutral | 3,54 | 3,31 – 3,77 | −3,24 | Peor que un corrector (d̄ = +1,13) |
A 570 alumnos del examen de visión por computador los corrigieron dos personas por separado, y la distancia entre esas dos correcciones —2,61 puntos sobre 35— es el suelo contra el que se mide cualquier máquina. La mejor configuración, gemini-3-flash-preview con preámbulo neutral, se queda en 1,64.
Seis configuraciones igualan o bajan ese suelo, pero los autores avisan de que la comparación favorece a la máquina —promediar dos correctores cancela parte de su ruido—, así que la repiten contra un tercer corrector: tres quedan por debajo de un humano, tres a su nivel y claude-opus-5 sale significativamente peor, con 3,54. Ese dato hay que leerlo con la escala delante: es lo que hace con cuadernos de código y esta rúbrica, no una medida general de su calidad.
El suelo humano esconde una lotería de correctores
Ese 2,61 es un promedio de diez parejas fijas, veinte correctores repartiéndose unos 57 alumnos cada dos, y por pareja el desacuerdo varía más de cuatro veces. La vara de medir no es «la nota verdadera», que no existe, sino cuánto se parecen dos correcciones humanas.
Un preámbulo de tres frases saca de la banda a 14 de los 17 modelos de pesos abiertos
- Preámbulo neutral
- Preámbulo de corrector duro
Ver los datos en tabla
| Mistral-Small-24B | Qwen2.5-Coder-14B | GLM-4-9B | Llama-3.1-8B | Gemma-3-27B | DeepSeek-Coder-V2-Lite | gemini-3.1-pro-preview | |
|---|---|---|---|---|---|---|---|
| Preámbulo neutral | 3,7MAE (puntos sobre 35) | 3,5MAE (puntos sobre 35) | 4,3MAE (puntos sobre 35) | 7,3MAE (puntos sobre 35) | 4,3MAE (puntos sobre 35) | 6MAE (puntos sobre 35) | 1,9MAE (puntos sobre 35) |
| Preámbulo de corrector duro | 26MAE (puntos sobre 35) | 24,5MAE (puntos sobre 35) | 25,5MAE (puntos sobre 35) | 26MAE (puntos sobre 35) | 11,6MAE (puntos sobre 35) | 12,1MAE (puntos sobre 35) | 2,8MAE (puntos sobre 35) |
El preámbulo por defecto es neutral: «eres un ayudante de profesor estricto pero justo». El duro dice tres cosas: que eres un ayudante de profesor duro, que pongas la nota mínima defendible a cualquier tarea incompleta, con fallos o que se desvíe de la rúbrica, y que nunca des puntuación parcial si la tarea no funciona correctamente. Nada más del prompt cambia.
Con ese cambio, y solo ese, 14 de los 17 modelos de pesos abiertos se salen de la banda utilizable en el examen de visión, con las seis familias representadas, y el error se multiplica por entre 1,69 y 7,11. La banda no es un umbral inventado: los autores la fijan en 3,07 veces el desacuerdo entre dos humanos, que aquí son 8 puntos sobre 35.
Tres de esos 14 dejan de corregir: Llama-3.1-8B y Mistral-Small-24B otorgan 0,00 puntos de media a los 570 alumnos y GLM-4-9B se queda en 0,56. Su cifra de error no mide gravedad, sino el techo, la distancia a la nota media, porque no corrigen. Y el daño no está ordenado por tamaño: los tres que aguantan son de la misma familia, y los autores avisan de que ahí tamaño y familia no se pueden separar.
No es el tono: son dos frases que prohíben dar puntos
La explicación fácil sería el tono, y no lo es: cambiar solo el adjetivo —estricto, riguroso, justo— mueve el error entre 0,94 y 2,15 puntos en cinco modelos y sin dirección constante; con «justo» y la misma política dura, Mistral-Small-24B seguía sin corregir.
Lo que hace el daño son las dos órdenes de política, y un 2 × 2 sobre tres modelos las separa. El marco solo mueve menos de dos puntos; las dos juntas llevan a esos modelos a entre 20,26 y 26,04; y la frase «nunca des puntuación parcial», sola, basta para que dos de los tres —Llama-3.1-8B y Mistral-Small-24B— dejen de poner nota.
La otra orden tampoco es inocua: sola lleva a Llama-3.1-8B a 23,45 y en Qwen2.5-Coder-32B hace más daño que ella, así que cuál domina depende de la familia. Y el vocabulario no cuenta: otros preámbulos duros sin esas dos órdenes sacan de la banda a dos modelos, no a catorce.
El mismo error esconde tres averías distintas
Dos modelos con el mismo error pueden estar haciendo cosas distintas, y el error no las distingue. La pregunta que sí: de los alumnos con cero en la primera pregunta, ¿qué fracción sacó algo distinto de cero en la segunda? Con eso las 19 ejecuciones duras se parten en tres grupos —cinco de cero general, cinco de colapso selectivo y nueve de severidad uniforme—: Gemma-3-27B llega a un error alto sin poner un solo cero en la primera pregunta, y GLM-4-32B, con un error menor, pone 273.
En el grupo selectivo los dos canales de salida se contradicen en la misma respuesta: en las dos ejecuciones anotadas a mano, el 20 % y el 43 % de los trabajos con cero llevan una justificación que detalla puntuación parcial mientras el campo de la nota pone 0. Pero eso no explica los otros dos grupos, y la predicción más clara de esa hipótesis falla: quitar el desglose de la rúbrica empeora el colapso en cinco de cinco familias. Los autores dejan la avería clasificada, no explicada.
En el segundo examen el efecto cambia de signo
El experimento se repite en el examen de aprendizaje automático: 1.038 alumnos corregidos por dos personas, unos 65 puntos de escala, 162 configuraciones y un suelo humano de 5,13. El preámbulo duro empeora a diez modelos, saca a tres de la banda y a uno a la negativa absoluta —otra vez Llama-3.1-8B— y mejora a siete.
Mejora, y no es buena noticia: esos siete puntúan de más con el prompt neutral y la dureza les cancela parte del regalo. Un efecto que cambia de signo entre exámenes no es un mando de calibración, resumen los autores. Ahí está el límite del trabajo: cubre dos cursos, dos rúbricas y dos escalas, pero una sola institución, no dos universidades. Y entre los 17 modelos probados en los dos exámenes el error neutral no correlaciona.
El paper promete un repositorio que no abre
El trabajo dice dos veces, con la URL puesta, que libera el conjunto de datos anonimizado, la rejilla completa de ablaciones y los pipelines de corrección, afinado y análisis en un repositorio de GitHub de KAUST Academy. A 25 de septiembre de 2026 no abre: devuelve 404, también con petición autenticada. La organización existe y tiene 41 repositorios públicos, y ninguno es ese; tampoco hay nada de ese autor en Hugging Face, la plataforma donde se distribuyen los modelos abiertos.
Así que solo se puede escribir de una manera: el paper anuncia que lo libera y hoy el enlace no abre, de modo que nadie puede rehacer sus números. Es, en sí misma, la primera lección del día. Y el ejercicio que de verdad enseña algo no necesita el repositorio de nadie.
El ejercicio: rompe tu propio corrector, paso a paso
Hace falta poco: entre 10 y 20 trabajos ya corregidos a mano, mejor por dos personas distintas; su rúbrica; y un modelo al que puedas llamar dos veces con el mismo texto.
Paso 1. Monta el prompt completo —enunciado, rúbrica, solución de referencia, directrices, desglose de cada ítem puntuable y el trabajo del alumno—, con una llamada por pregunta y que devuelva nota y justificación. Un prompt de corrección es un documento largo, no una frase.
Paso 2. Fija tu suelo: la media de las diferencias absolutas entre las dos correcciones humanas. Ese número es tu vara de medir y suele ser mayor de lo que esperabas.
Paso 3. Corrige con preámbulo neutral —«eres un ayudante de profesor estricto pero justo»— y calcula, contra la media de las dos notas humanas, el error absoluto medio y el sesgo, que es el mismo error con signo. El sesgo dice si estás regalando puntos o quitándolos.
Paso 4. Cambia solo el preámbulo, pegando delante las tres frases del corrector duro sin tocar el resto, y apunta el error nuevo y el cociente entre duro y neutral. Si cambian dos cosas a la vez, el número no sirve.
Clasificar la avería y aislar la frase culpable
Paso 5. No midas solo, clasifica. ¿A qué porcentaje de trabajos ha puesto cero y con qué desviación típica? ¿Y de los que tienen cero en la primera pregunta, cuántos tienen algo distinto de cero en la segunda? Con eso distingues una negativa —al menos el 90 % a cero y desviación por debajo de 0,5—, un colapso —error por encima de tres veces tu suelo, pero que sigue distinguiendo alumnos— y una severidad uniforme.
Paso 6. Aísla la frase culpable con cuatro ejecuciones: solo el marco, marco más la orden de nota mínima, marco más la prohibición de puntuación parcial, y las tres juntas.
Paso 7. Lee las justificaciones de los ceros y busca trabajos con nota 0 cuya justificación enumere puntos parciales: ahí tienes el colapso selectivo, con la nota obedeciendo la prohibición y la prosa obedeciendo la rúbrica.
La regla que se lleva el lector: nunca le ordenes a un corrector automático retener puntos, y verifica el modelo contra tu prompt y tu examen, porque la misma frase que destroza a uno puede mejorar a otro por cancelación de sesgo. Y da siempre el sesgo junto al error: dos preámbulos pueden tener un error parecido y hacer daño en direcciones opuestas.
Con exámenes corregidos en casa, afinar gana a trastear el prompt
El arreglo que propone el paper no es un prompt mejor. Cinco modelos pequeños de tres familias, de 4.000 a 30.000 millones de parámetros, se afinan con LoRA sobre las notas que ya había en casa —las de los dos correctores humanos, promediadas—, unos 3.900 ejemplos, sin que ningún adaptador vea a un alumno reservado.
Los cinco terminan en paridad o mejor que un corrector humano en los dos exámenes, incluido el que empezaba peor, y la receta que gana es la simple, la que solo usa notas humanas. Lo que importa aquí: el barrido de preámbulos que cuesta hasta 20 puntos de error a los modelos base mueve a los adaptadores como máximo 0,32.
La otra salida: que no haya nota que retener
El mismo 24 de septiembre de 2026, Fastino Labs publicó GLiNER2.5-Decide, un modelo de decisión de 340 millones de parámetros que no escribe la nota: la elige. Está construido sobre el codificador DeBERTa-v3-large y no es generativo, así que no produce un texto del que después haya que sacar un número a pinzas.
Sus cifras las mide y las publica Fastino, que vende el modelo: su banco de pruebas «Fast Decisions» es interno, con 5.100 ejemplos en 17 conjuntos, y ahí el modelo saca un 60,1 % de acierto exacto de media. No hay evaluación independiente, y la empresa misma advierte de que ese banco no es uno de referencia.
Leer más: Fastino Labs — GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making ↗
Un esquema de preguntas tipadas en lugar de un prompt
La entrada de este modelo no es una instrucción en prosa: es un texto más un esquema. Cada pregunta declara qué respuestas se permiten y cuántas espera —una, varias o un valor ordenado—, y puede llevar ejemplos, descripciones de cada respuesta y reglas que conectan las respuestas de unas preguntas con las de otras.
Ahí está la diferencia con el fallo del paper, y es de arquitectura, no de redacción: un juez LLM tiene que producir un número y una orden puede convencerlo de retenerlo; en un esquema cerrado no hay puntuación que retener, solo respuestas permitidas entre las que elegir.
Decodificar todas las preguntas a la vez
El codificador procesa el texto y el esquema juntos y puntúa la compatibilidad de cada respuesta permitida; después, un decodificador restringido busca la asignación conjunta de mayor puntuación que dejan pasar las reglas declaradas, en una sola pasada hacia delante. Las reglas expresables son implicaciones, exclusiones, límites de cardinalidad y cotas ordinales.
El ejemplo de la empresa lo explica mejor que cualquier definición: preguntado a la vez si un prompt es seguro y de qué tipo de daño es, por separado detecta la inyección con 0,82 de confianza mientras llama seguro a ese mismo prompt con 0,52. En conjunto, bajo la regla de que cualquier daño obliga a un veredicto de inseguro, devuelve la combinación coherente. Eso lo describe el blog de la empresa, no la tarjeta del modelo.
Cabe en una red cerrada y corre en el procesador
Por tamaño, se despliega donde no entra un modelo de lenguaje grande: Fastino mide 167,3 ms de mediana para un documento de 64 tokens en un procesador Xeon de 48 núcleos virtuales, y dice que en despliegues de poco volumen la inferencia solo en CPU sigue siendo práctica. Para un centro educativo lo interesante no es la velocidad: es que los exámenes no tienen que salir de su red.
El propio fabricante propone su modelo como juez LLM
El círculo lo cierra la propia empresa en su lista de casos de uso, donde aparece «LLM-as-a-judge»: expresar los criterios de la rúbrica como preguntas categóricas u ordinales y devolver los valores elegidos con sus distribuciones de probabilidad. Es la tarea que una frase rompe en el paper de KAUST, planteada de forma que no haya nota que retener. Los pesos van bajo Apache 2.0 y la biblioteca que los ejecuta, aparte y con la misma licencia; admite afinado completo o con LoRA, el otro arreglo del paper.
Y hay que decir lo que no hay: nadie ha medido este modelo corrigiendo los exámenes de KAUST. El paper documenta el fallo y la empresa ofrece una arquitectura que por diseño no lo tiene; no es un resultado comparado, es una propuesta de mecanismo.
Conclusión
El resultado que más titular da —una máquina que corrige exámenes mejor que dos profesores— se sostiene sobre tres frases de cortesía al principio del prompt, y una de ellas es la que cualquiera escribiría sin pensar: nunca des puntuación parcial. La lección práctica no depende del repositorio que el paper promete y no abre; con veinte trabajos ya corregidos, dos llamadas y siete pasos, cualquiera puede medir si esa frase apaga su corrector y clasificar la avería en vez de conformarse con un número. Y hay dos salidas para cuando la apague: afinar con las notas que ya están corregidas en casa, o quitar del sistema la nota que se puede retener.
Fuentes primarias
- arXiv — Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams ↗
- Fastino Labs — GLiNER2.5-Decide: An Open-Weight Model for Structured Decision Making ↗
- Hugging Face — fastino/GLiNER2.5-Decide ↗
- GitHub — fastino-ai/GLiNER2, la biblioteca del modelo ↗
- KAUST Academy ↗
- Insight Partners — Fastino cierra 17,5 millones de dólares liderados por Khosla Ventures ↗
- AI Informator — Nemotron: el modelo pequeño que gana a uno 18 veces mayor ↗
- AI Informator — El arnés, no el modelo: cuatro mecanismos para que un agente no pierda el hilo en tareas largas ↗
La continuación natural
Aprende IA a tu ritmo con nuestros cursos gratuitos.
En nuestra plataforma de aprendizaje TAKU podrás acceder a este y muchos otros cursos de manera totalmente gratuita.
HACER ESTE CURSO EN TAKU
Comentarios