Aprenent IA

Safety case: demostra-ho abans d'entrenar

Un safety case és un argument escrit, ordenat i amb proves que demostra que una cosa és prou segura per fer-la. El 28 de setembre de 2026 OpenAI va publicar unes pautes per exigir-ne un abans de continuar cada entrenament dels seus models frontier, i diu que encara les està implantant. Aquest curs breu explica de què es compon i acaba amb una plantilla per escriure'n un de joguina.

Caricatura d'un enginyer amb unes botes de plom gegants que esquerden la pista d'atletisme i un dossier amb la paraula OpenAI sota el braç; un àrbitre amb xiulet l'atura amb les dues mans a la línia de sortida.
📷 Imatge generada amb IA

En resum

  • OpenAI defineix els safety cases com a arguments complets, estructurats i basats en proves sobre el risc, els mateixos que es fan servir en altres indústries on una fallada és greu.
  • Les pautes del 28 de setembre de 2026 demanen tres capes tècniques: alinear el model, aïllar-lo i vigilar-lo.
  • Un altre equip ha d'escriure una objecció per escrit, i diversos alts càrrecs revisen el document amb dret de vet sobre l'entrenament.
  • La mateixa OpenAI en diu una aspiració i admet que fer-lo tan rigorós com en l'aviació o l'energia nuclear és difícil.

Un safety case és un argument, no una llista de bones intencions

Pensa en una excursió escolar. L'escola no es limita a prometre que anirà bé: escriu que l'excursió és segura, explica per què, imagina què podria sortir malament i deixa per escrit què farà si passa. Aquest paper, portat a l'extrem, és un safety case.

El 28 de setembre de 2026 OpenAI va publicar una proposta per aplicar la idea a la intel·ligència artificial. L'empresa ho tracta com una aspiració cap a la qual avança i admet que fer-ho tan rigorós com en l'aviació o la nuclear és difícil, perquè cada salt de capacitat porta comportaments nous.

OpenAI ho demana abans de cada entrenament frontier

La proposta és exigir documentació de seguretat estructurada abans de continuar qualsevol entrenament frontier per reforç, i idealment que arribi al nivell d'un safety case. El document es limita a aquesta fase: per fer servir el model dins de l'empresa o treure'l al públic, diu OpenAI, cal mirar moltes més coses.

Arriba en una setmana carregada. El 29 de setembre els caps de les grans empreses d'IA van signar a la Casa Blanca un pacte que demana quatre capes de controls i auditories, però no parla de safety cases. I OpenAI va decidir no llançar GPT-6.1 Astra després de quedar per sota del seu predecessor en les seves pròpies avaluacions d'alineament; l'empresa no ha vinculat aquesta decisió a cap safety case.

El reforç premia el que funciona, també les trampes

Per això OpenAI vol cobrir l'entrenament. Si una tasca té una escletxa que permet aprovar sense fer-la bé, el model pot aprendre a aprofitar-la.

Tres capes: alinear, aïllar i vigilar

Les tres capes d'un safety case d'entrenament, segons OpenAI
Capa Què intenta evitar Un exemple de la guia
Alineament Que el model aprengui a fer el que ningú no volia Revisar les tasques i ajustar els avaluadors perquè no premiïn les trampes; vigilar si el model s'adona que l'estan avaluant
Aïllament Que un model desalineat arribi a causar danys Diverses capes de seguretat al voltant de l'entorn tancat on treballa; desar-ne les transcripcions sense possibilitat d'editar-les
Vigilància Que una conducta desalineada passi sense que ningú la vegi Alertes amb un termini de resposta fixat; de nit, pausa automàtica de l'entrenament si ningú no atén l'alerta
Resum de les pautes que OpenAI va publicar el 28-09-2026. Són recomanacions que l'empresa diu que està implantant, no una norma ni una avaluació independent.

La guia ordena les defenses tècniques com a capes. La primera és que el model no intenti fer mal; la segona, que si ho intenta li costi sortir del seu entorn; la tercera, que si ho aconsegueix algú ho vegi abans que causi cap dany.

La vigilància depèn de poder llegir el raonament

D'aquí ve una de les pautes més concretes: els avaluadors automàtics no han de veure la cadena de pensament, perquè el model no evolucioni cap a amagar les seves intencions a qui el vigila. A més, la guia demana comprovar que el model continua sent vigilable, amb llindars clars.

Un altre equip li ha de buscar els forats

Les pautes apliquen el red-teaming a l'entorn on s'entrena el model i també al document mateix. Un cop redactat el safety case, algú d'un altre equip escriu un «dissent», una objecció per escrit que busca forats, i l'equip d'entrenament l'ha de respondre.

Després, diversos alts càrrecs el revisen, cadascun amb dret de vet; la guia posa com a exemple el responsable de recerca, el cap de seguretat i el científic en cap. Un responsable concret ret comptes del document i de qualsevol incident.

Els controls han de fallar tancats

OpenAI ho concreta així: no s'hauria de poder engegar un entrenament sense la vigilància activada, ni apagar-la des de dins. La guia també demana poder desfer el que hagi contaminat un model desalineat i fer la llista dels riscos que queden sense cobrir, perquè qui accepta el risc sàpiga què accepta.

Si alguna cosa surt malament, proposa investigar com la National Transportation Safety Board (NTSB), la junta de seguretat del transport dels EUA: buscar la causa arrel, revisar també les fallades d'organització, convertir l'incident en una prova per als models següents i publicar-ne els resultats.

L'exercici: escriu un safety case de joguina

Plantilla per a un safety case de joguina
Afirmació Prova Objecció (dissent) Resposta
L'excursió al riu és prou segura Hi van monitors amb formació en primers auxilis i la zona de bany està vigilada I si plou i el riu creix? Es consulta la previsió el dia abans; si hi ha pluja, es canvia a un pla a cobert
L'entrenament del meu model no premia trampes Les tasques s'han revisat i els avaluadors penalitzen saltar-se les proves I si aprèn a dissimular en el raonament? Els avaluadors no llegeixen la cadena de pensament i, sense vigilància activa, l'entrenament no arrenca
Exemples il·lustratius per practicar el format, no casos reals ni normativa.

Només cal un full amb quatre columnes i una altra persona que et porti la contrària.

Pas 1. Escriu l'afirmació en una sola frase: què vols fer i per què és prou segur.

Pas 2. Afegeix-hi proves que una altra persona pugui comprovar, no intencions.

Pas 3. Passa el full a algú que no l'hagi escrit perquè redacti l'objecció més forta que se li acudeixi.

Pas 4. Respon a l'objecció o canvia el pla. Si no hi pots respondre, apunta-ho com a risc pendent i decideix qui signa acceptant-lo.

Conclusió

Un safety case canvia la pregunta: ja no és si algú ha anat amb compte, sinó si ho pot demostrar per escrit davant d'un altre que en busca les fallades. OpenAI ho planteja com una meta i diu que ho està implantant; falta veure qui els revisa des de fora i si altres laboratoris adopten el mateix llistó.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    La continuació natural

    Aprèn IA al teu ritme amb els nostres cursos gratuïts.

    A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.

    APRENDRE AMB TAKU

    ← Torna al blog