Bloggartiklarna publiceras på spanska och katalanska.

Aprendiendo IA

Safety case: demuéstralo antes de entrenar

Un safety case es un argumento por escrito, ordenado y con pruebas, de que algo es lo bastante seguro para hacerse. OpenAI publicó el 28 de septiembre de 2026 unas pautas para exigir uno antes de continuar cada entrenamiento de sus modelos frontier, y dice que aún las está implantando. Este curso breve explica de qué se compone y acaba con una plantilla para escribir uno de juguete.

Caricatura de un ingeniero con unas botas de plomo gigantes que agrietan la pista de atletismo y un dosier con la palabra OpenAI bajo el brazo; un árbitro con silbato lo frena con las dos manos en la línea de salida.
📷 Imagen generada con IA

En resumen

  • OpenAI define los safety cases como argumentos completos, estructurados y basados en pruebas sobre el riesgo, los mismos que se usan en otras industrias donde un fallo es grave.
  • Las pautas del 28 de septiembre de 2026 piden tres capas técnicas: alinear el modelo, aislarlo y vigilarlo.
  • Otro equipo debe escribir una objeción por escrito, y varios altos cargos revisan el documento con derecho de veto sobre el entrenamiento.
  • La propia OpenAI lo llama una aspiración y admite que hacerlo tan riguroso como en aviación o en energía nuclear es difícil.

Un safety case es un argumento, no una lista de buenas intenciones

Piensa en una excursión escolar. El colegio no se limita a prometer que irá bien: escribe que la excursión es segura, explica por qué, imagina qué podría salir mal y deja por escrito qué hará si pasa. Ese papel, llevado al extremo, es un safety case.

OpenAI publicó el 28 de septiembre de 2026 una propuesta para aplicar la idea a la inteligencia artificial. La empresa lo trata como una aspiración hacia la que avanza y admite que hacerlo tan riguroso como en aviación o nuclear es difícil, porque cada salto de capacidad trae comportamientos nuevos.

OpenAI lo pide antes de cada entrenamiento frontier

La propuesta es exigir documentación de seguridad estructurada antes de continuar cualquier entrenamiento frontier por refuerzo, e idealmente que llegue al nivel de un safety case. El documento se limita a esa fase: para usar el modelo dentro de la empresa o sacarlo al público, dice OpenAI, hay que mirar muchas más cosas.

Llega en una semana cargada. El 29 de septiembre los jefes de las grandes empresas de IA firmaron en la Casa Blanca un pacto que pide cuatro capas de controles y auditorías, pero no habla de safety cases. Y OpenAI decidió no lanzar GPT-6.1 Astra tras quedar por debajo de su predecesor en sus propias evaluaciones de alineamiento; la empresa no ha vinculado esa decisión a ningún safety case.

El refuerzo premia lo que funciona, también las trampas

Por eso OpenAI quiere cubrir el entrenamiento. Si una tarea tiene un fallo que permite aprobar sin hacerla bien, el modelo puede aprender a explotarlo.

Tres capas: alinear, aislar y vigilar

Las tres capas de un safety case de entrenamiento, según OpenAI
Capa Qué intenta evitar Un ejemplo de la guía
Alineamiento Que el modelo aprenda a hacer lo que nadie quería Revisar las tareas y ajustar los evaluadores para que no premien las trampas; vigilar si el modelo se da cuenta de que lo están evaluando
Aislamiento Que un modelo desalineado llegue a causar daño Varias capas de seguridad alrededor del entorno cerrado donde trabaja; guardar sus transcripciones sin posibilidad de editarlas
Vigilancia Que una conducta desalineada pase sin que nadie la vea Alertas con un plazo de respuesta fijado; de noche, pausa automática del entrenamiento si nadie atiende la alerta
Resumen de las pautas que OpenAI publicó el 28-09-2026. Son recomendaciones que la empresa dice estar implantando, no una norma ni una evaluación independiente.

La guía ordena las defensas técnicas como capas. La primera es que el modelo no intente hacer daño; la segunda, que si lo intenta le cueste salir de su entorno; la tercera, que si lo consigue alguien lo vea antes de que cause daño.

La vigilancia depende de poder leer el razonamiento

De ahí una de las pautas más concretas: los evaluadores automáticos no deben ver la cadena de pensamiento, para que el modelo no evolucione hacia esconder sus intenciones a quien lo vigila. La guía pide además comprobar que el modelo sigue siendo vigilable, con umbrales claros.

Otro equipo tiene que buscarle los agujeros

Las pautas aplican el red-teaming al entorno donde se entrena el modelo y también al propio documento. Una vez redactado el safety case, alguien de otro equipo escribe un «dissent», una objeción por escrito que busca huecos, y el equipo de entrenamiento tiene que responderla.

Después, varios altos cargos lo revisan, cada uno con derecho de veto; la guía pone como ejemplo al responsable de investigación, al jefe de seguridad y al científico jefe. Un responsable concreto rinde cuentas del documento y de cualquier incidente.

Los controles tienen que fallar cerrados

OpenAI lo concreta así: no debería poder arrancarse un entrenamiento sin la vigilancia activada, ni apagarla desde dentro. La guía pide también poder deshacer lo que haya contaminado un modelo desalineado y listar los riesgos que quedan sin cubrir, para que quien acepta el riesgo sepa qué acepta.

Si algo sale mal, propone investigar como la National Transportation Safety Board (NTSB), la junta de seguridad del transporte de EE. UU.: buscar la causa raíz, revisar también los fallos de organización, convertir el incidente en una prueba para los modelos siguientes y publicar los resultados.

El ejercicio: escribe un safety case de juguete

Plantilla para un safety case de juguete
Afirmación Prueba Objeción (dissent) Respuesta
La excursión al río es lo bastante segura Van monitores con formación en primeros auxilios y la zona de baño está vigilada ¿Y si llueve y el río crece? Se consulta la previsión la víspera; si hay lluvia, se cambia a un plan bajo techo
El entrenamiento de mi modelo no premia trampas Las tareas se revisaron y los evaluadores penalizan saltarse las pruebas ¿Y si aprende a disimular en su razonamiento? Los evaluadores no leen la cadena de pensamiento y, sin vigilancia activa, el entrenamiento no arranca
Ejemplos ilustrativos para practicar el formato, no casos reales ni normativa.

Solo hace falta una hoja con cuatro columnas y otra persona que te lleve la contraria.

Paso 1. Escribe la afirmación en una sola frase: qué quieres hacer y por qué es lo bastante seguro.

Paso 2. Añade pruebas que otra persona pueda comprobar, no intenciones.

Paso 3. Pasa la hoja a alguien que no la haya escrito para que redacte la objeción más fuerte que se le ocurra.

Paso 4. Responde a la objeción o cambia el plan. Si no puedes responder, apúntalo como riesgo pendiente y decide quién firma aceptándolo.

Conclusión

Un safety case cambia la pregunta: ya no es si alguien ha tenido cuidado, sino si puede demostrarlo por escrito ante otro que busca los fallos. OpenAI lo plantea como meta y dice estar implantándolo; falta ver quién los revisa desde fuera y si otros laboratorios adoptan el mismo listón.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    La continuación natural

    Aprende IA a tu ritmo con nuestros cursos gratuitos.

    En nuestra plataforma de aprendizaje TAKU podrás acceder a este y muchos otros cursos de manera totalmente gratuita.

    APRENDER CON TAKU

    ← Volver al blog