Aprenent IA
Safety case: demostra-ho abans d'entrenar
Un safety case és un argument escrit, ordenat i amb proves que demostra que una cosa és prou segura per fer-la. El 28 de setembre de 2026 OpenAI va publicar unes pautes per exigir-ne un abans de continuar cada entrenament dels seus models frontier, i diu que encara les està implantant. Aquest curs breu explica de què es compon i acaba amb una plantilla per escriure'n un de joguina.
En resum
- OpenAI defineix els safety cases com a arguments complets, estructurats i basats en proves sobre el risc, els mateixos que es fan servir en altres indústries on una fallada és greu.
- Les pautes del 28 de setembre de 2026 demanen tres capes tècniques: alinear el model, aïllar-lo i vigilar-lo.
- Un altre equip ha d'escriure una objecció per escrit, i diversos alts càrrecs revisen el document amb dret de vet sobre l'entrenament.
- La mateixa OpenAI en diu una aspiració i admet que fer-lo tan rigorós com en l'aviació o l'energia nuclear és difícil.
Un safety case és un argument, no una llista de bones intencions
Pensa en una excursió escolar. L'escola no es limita a prometre que anirà bé: escriu que l'excursió és segura, explica per què, imagina què podria sortir malament i deixa per escrit què farà si passa. Aquest paper, portat a l'extrem, és un safety case.
El 28 de setembre de 2026 OpenAI va publicar una proposta per aplicar la idea a la intel·ligència artificial. L'empresa ho tracta com una aspiració cap a la qual avança i admet que fer-ho tan rigorós com en l'aviació o la nuclear és difícil, perquè cada salt de capacitat porta comportaments nous.
OpenAI ho demana abans de cada entrenament frontier
La proposta és exigir documentació de seguretat estructurada abans de continuar qualsevol entrenament frontier per reforç, i idealment que arribi al nivell d'un safety case. El document es limita a aquesta fase: per fer servir el model dins de l'empresa o treure'l al públic, diu OpenAI, cal mirar moltes més coses.
Arriba en una setmana carregada. El 29 de setembre els caps de les grans empreses d'IA van signar a la Casa Blanca un pacte que demana quatre capes de controls i auditories, però no parla de safety cases. I OpenAI va decidir no llançar GPT-6.1 Astra després de quedar per sota del seu predecessor en les seves pròpies avaluacions d'alineament; l'empresa no ha vinculat aquesta decisió a cap safety case.
El reforç premia el que funciona, també les trampes
Per això OpenAI vol cobrir l'entrenament. Si una tasca té una escletxa que permet aprovar sense fer-la bé, el model pot aprendre a aprofitar-la.
Tres capes: alinear, aïllar i vigilar
| Capa | Què intenta evitar | Un exemple de la guia |
|---|---|---|
| Alineament | Que el model aprengui a fer el que ningú no volia | Revisar les tasques i ajustar els avaluadors perquè no premiïn les trampes; vigilar si el model s'adona que l'estan avaluant |
| Aïllament | Que un model desalineat arribi a causar danys | Diverses capes de seguretat al voltant de l'entorn tancat on treballa; desar-ne les transcripcions sense possibilitat d'editar-les |
| Vigilància | Que una conducta desalineada passi sense que ningú la vegi | Alertes amb un termini de resposta fixat; de nit, pausa automàtica de l'entrenament si ningú no atén l'alerta |
La guia ordena les defenses tècniques com a capes. La primera és que el model no intenti fer mal; la segona, que si ho intenta li costi sortir del seu entorn; la tercera, que si ho aconsegueix algú ho vegi abans que causi cap dany.
La vigilància depèn de poder llegir el raonament
D'aquí ve una de les pautes més concretes: els avaluadors automàtics no han de veure la cadena de pensament, perquè el model no evolucioni cap a amagar les seves intencions a qui el vigila. A més, la guia demana comprovar que el model continua sent vigilable, amb llindars clars.
Un altre equip li ha de buscar els forats
Les pautes apliquen el red-teaming a l'entorn on s'entrena el model i també al document mateix. Un cop redactat el safety case, algú d'un altre equip escriu un «dissent», una objecció per escrit que busca forats, i l'equip d'entrenament l'ha de respondre.
Després, diversos alts càrrecs el revisen, cadascun amb dret de vet; la guia posa com a exemple el responsable de recerca, el cap de seguretat i el científic en cap. Un responsable concret ret comptes del document i de qualsevol incident.
Els controls han de fallar tancats
OpenAI ho concreta així: no s'hauria de poder engegar un entrenament sense la vigilància activada, ni apagar-la des de dins. La guia també demana poder desfer el que hagi contaminat un model desalineat i fer la llista dels riscos que queden sense cobrir, perquè qui accepta el risc sàpiga què accepta.
Si alguna cosa surt malament, proposa investigar com la National Transportation Safety Board (NTSB), la junta de seguretat del transport dels EUA: buscar la causa arrel, revisar també les fallades d'organització, convertir l'incident en una prova per als models següents i publicar-ne els resultats.
L'exercici: escriu un safety case de joguina
| Afirmació | Prova | Objecció (dissent) | Resposta |
|---|---|---|---|
| L'excursió al riu és prou segura | Hi van monitors amb formació en primers auxilis i la zona de bany està vigilada | I si plou i el riu creix? | Es consulta la previsió el dia abans; si hi ha pluja, es canvia a un pla a cobert |
| L'entrenament del meu model no premia trampes | Les tasques s'han revisat i els avaluadors penalitzen saltar-se les proves | I si aprèn a dissimular en el raonament? | Els avaluadors no llegeixen la cadena de pensament i, sense vigilància activa, l'entrenament no arrenca |
Només cal un full amb quatre columnes i una altra persona que et porti la contrària.
Pas 1. Escriu l'afirmació en una sola frase: què vols fer i per què és prou segur.
Pas 2. Afegeix-hi proves que una altra persona pugui comprovar, no intencions.
Pas 3. Passa el full a algú que no l'hagi escrit perquè redacti l'objecció més forta que se li acudeixi.
Pas 4. Respon a l'objecció o canvia el pla. Si no hi pots respondre, apunta-ho com a risc pendent i decideix qui signa acceptant-lo.
Conclusió
Un safety case canvia la pregunta: ja no és si algú ha anat amb compte, sinó si ho pot demostrar per escrit davant d'un altre que en busca les fallades. OpenAI ho planteja com una meta i diu que ho està implantant; falta veure qui els revisa des de fora i si altres laboratoris adopten el mateix llistó.
Fonts primàries
La continuació natural
Aprèn IA al teu ritme amb els nostres cursos gratuïts.
A la nostra plataforma d'aprenentatge TAKU podràs accedir a aquest i a molts altres cursos de manera totalment gratuïta.
APRENDRE AMB TAKU
Comentaris