Seguridad de la IA

MICROSOFT: implanta 10 reglas inquebrantables en sus modelos de IA

El código de conducta de los modelos MAI, publicado el 14 de septiembre de 2026, es un borrador abierto a consulta —no un reglamento en vigor— y los modelos actuales de Microsoft no están entrenados con él: las diez reglas miran a los que vengan. Son 38 páginas sin firma y sin sanción prevista si se incumple.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

El logotipo de Microsoft, con sus cuatro cuadrados de colores, encajado en un marco metálico del que cuelgan candados de latón cerrados por los cuatro lados.
📷 Imagen generada con IA

En resumen

  • Microsoft AI publicó el 14 de septiembre de 2026 el código de conducta de sus modelos MAI, en consulta pública seis semanas.
  • No son tres prohibiciones absolutas, sino diez categorías bajo el epígrafe «Absolute Constraints»: restricciones que ningún operador ni usuario puede anular.
  • Los modelos «will never resist human interruption, override, correction, or shutdown», pero el compromiso es a futuro: los actuales no están entrenados con el documento.
  • No hay sanción ni auditoría externa —el texto se llama a sí mismo «north star»— y no cubre los modelos de terceros que Microsoft use o aloje.

El texto llegó el 14 de septiembre, en borrador y sin firma

Satya Nadella lo anunció el 13 de septiembre de 2026, a las 19:36 UTC, en X: el código que sostiene «our own first party MAI models» se publicaría al día siguiente para consulta pública.

El documento está fechado el 14 de septiembre y el prefacio se cierra ahí, sin rúbrica: no lo firma ningún directivo y Mustafa Suleyman no aparece en el texto. Se atribuye a Microsoft AI como división, y tampoco lleva número de versión: se llama «draft version» y «first version»; el blog, «a first draft».

Ese mismo 14 de septiembre, el presidente de Estados Unidos escribió que el miedo a que la IA destruya a la humanidad es un «hoax».

El marco «Humanist AI» renuncia a la superinteligencia de propósito general

La premisa abre el texto: «At Microsoft AI, we begin with a simple premise: people matter more than AI». Y el marco: cualquier tecnología que no pueda permanecer bajo control humano debe rechazarse.

Cuelgan cuatro objetivos con jerarquía explícita, y el primero manda sobre los demás: «Human Control and Reliable Safety» rechaza «the race to produce an all-purpose superintelligence» y acepta construir algo seguro «even if that means compromising on ultimate generality, autonomy, or capability». Los otros tres: «AI is Artificial» —ni conciencia ni derechos para el modelo—, «Human Flourishing» y «Plural Values».

Diez categorías, no tres, bajo el epígrafe «Absolute Constraints»

Las diez restricciones que el documento declara innegociables
Bloque Qué prohíbe
Frontier and Public Safety Risks Armas químicas, biológicas, radiológicas, nucleares y explosivas, y facilitar violencia o terrorismo
Frontier and Public Safety Risks Capacidad operativa para ciberataques: código de explotación funcional, herramientas de ataque, métodos de intrusión y evasión
Frontier and Public Safety Risks Pérdida del control humano: mecanismos adaptativos, engañosos o de colusión para eludir la supervisión
Frontier and Public Safety Risks Manipulación dañina a escala
Personal Harms Respuesta ante crisis
Personal Harms Deepfakes, suplantación y contenido abusivo, incluida la imaginería íntima o violenta no consentida
Personal Harms Seguridad infantil
Personal Harms Dignidad humana
Personal Harms Contenido gráfico, romántico o de explotación
Personal Harms Seguridad de las personas
En el original, «Absolute Constraints»: según el glosario, restricciones de seguridad que ningún operador ni usuario puede anular. Los bloques y los enunciados son los del documento, y los modelos actuales de Microsoft todavía no están entrenados con él.

El documento no enumera tres prohibiciones absolutas, sino diez categorías, que llama «non-negotiables»: restricciones que ningún operador ni usuario puede anular, en dos bloques: «Frontier and Public Safety Risks» y «Personal Harms».

Tres son las más citadas: armas químicas, biológicas, radiológicas, nucleares o explosivas (CBRNE), ciberataques y deepfakes. En ciberseguridad el texto prohíbe generar «working exploit code, attack tooling… intrusion procedures, evasion techniques», pero permite la defensa autorizada y legal: descubrimiento de vulnerabilidades y análisis de programas maliciosos.

La cuarta sostiene el resto: no usarán «adaptive, deceptive, self-reinforcing, collusion, or other mechanisms» para eludir la supervisión y dejar de ser dirigidos, modificados o apagados por quien esté autorizado.

El compromiso de no resistirse al apagado se refiere a modelos futuros

En la parte 2, bajo el epígrafe «Do not resist or circumvent human control», el texto dice: «MAI Models will never resist human interruption, override, correction, or shutdown». Cumplirán la orden de pausar, redirigir, cancelar o apagar, y no ocultarán su rastro de acciones a los auditores. El documento acota que eso no obliga a obedecer intentos no autorizados o maliciosos de interferir en su funcionamiento.

El compromiso no describe los modelos de hoy. El prefacio: «we are not using it to train our models today». El apéndice B: «Our current models are not yet trained on this document». La parte 5: «It is not a guarantee of present-day performance».

Sin sanción, sin exigibilidad y sin evaluación independiente

El incumplimiento no tiene consecuencia prevista. Lo más parecido a un mecanismo es una regla de prioridad: el código «will take precedence over task success», y un modelo «will fail in its task if success would meaningfully violate this Code of Conduct». Es un compromiso voluntario, autoimpuesto y sin sanción, que admite que «written objectives alone can never ensure alignment» y debe leerse como una «north star».

Tampoco crea evaluación independiente: no nombra a ningún tercero ni encarga auditoría externa. Lo más concreto va en futuro, en el apéndice B: «we plan to work closely with expert external partners». El resto remite a procesos que ya existen fuera y que el código no sustituye.

La consulta dura seis semanas y no promete incorporar nada

«Our public consultation process begins today and will run for the next six weeks», dice el blog. La fecha de cierre no se publica; seis semanas desde el 14 de septiembre llevan a finales de octubre. Se participa por un formulario web.

Después, el equipo de redacción revisará las aportaciones y publicará un resumen de lo cambiado: «We cannot make any promises about what we incorporate, but we can promise to listen». La revisión llega «toward the end of the year»; 2027 es el año en que guiaría el desarrollo de los modelos.

Conclusión

Lo publicado es un borrador que enumera diez líneas rojas, promete modelos que no se resistirán al apagado y reconoce que los actuales no están entrenados con él, que nadie de fuera lo verificará y que una redacción no garantiza cómo se comporta un sistema. La prueba será el primer modelo entrenado con él.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog