Seguretat de la IA
MICROSOFT: implanta 10 regles inviolables als seus models d'IA
El codi de conducta dels models MAI, publicat el 14 de setembre del 2026, és un esborrany obert a consulta —no un reglament en vigor— i els models actuals de Microsoft no s'hi han entrenat: les deu regles miren els que vindran. Són 38 pàgines sense signatura i sense cap sanció prevista si s'incompleix.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Microsoft AI va publicar el 14 de setembre del 2026 el codi de conducta dels seus models MAI, en consulta pública durant sis setmanes.
- No són tres prohibicions absolutes, sinó deu categories sota l'epígraf «Absolute Constraints»: restriccions que cap operador ni cap usuari no pot anul·lar.
- Els models «will never resist human interruption, override, correction, or shutdown», però el compromís és a futur: els actuals no s'han entrenat amb el document.
- No hi ha sanció ni auditoria externa —el text s'anomena a si mateix «north star»— i no cobreix els models de tercers que Microsoft faci servir o allotgi.
El text va arribar el 14 de setembre, en esborrany i sense signatura
Satya Nadella ho va anunciar el 13 de setembre del 2026, a les 19:36 UTC, a X: el codi que sosté «our own first party MAI models» es publicaria l'endemà per a consulta pública.
El document està datat el 14 de setembre i el prefaci s'hi tanca, sense rúbrica: no el signa cap directiu i Mustafa Suleyman no apareix al text. S'atribueix a Microsoft AI com a divisió, i tampoc no porta número de versió: s'anomena «draft version» i «first version»; el blog, «a first draft».
Aquell mateix 14 de setembre, el president dels Estats Units va escriure que la por que la IA destrueixi la humanitat és un «hoax».
El marc «Humanist AI» renuncia a la superintel·ligència de propòsit general
La premissa obre el text: «At Microsoft AI, we begin with a simple premise: people matter more than AI». I el marc: qualsevol tecnologia que no pugui romandre sota control humà s'ha de rebutjar.
En pengen quatre objectius amb jerarquia explícita, i el primer mana sobre els altres: «Human Control and Reliable Safety» rebutja «the race to produce an all-purpose superintelligence» i accepta construir alguna cosa segura «even if that means compromising on ultimate generality, autonomy, or capability». Els altres tres: «AI is Artificial» —ni consciència ni drets per al model—, «Human Flourishing» i «Plural Values».
Deu categories, no tres, sota l'epígraf «Absolute Constraints»
| Bloc | Què prohibeix |
|---|---|
| Frontier and Public Safety Risks | Armes químiques, biològiques, radiològiques, nuclears i explosives, i facilitar violència o terrorisme |
| Frontier and Public Safety Risks | Capacitat operativa per a ciberatacs: codi d'explotació funcional, eines d'atac, mètodes d'intrusió i d'evasió |
| Frontier and Public Safety Risks | Pèrdua del control humà: mecanismes adaptatius, enganyosos o de col·lusió per esquivar la supervisió |
| Frontier and Public Safety Risks | Manipulació nociva a gran escala |
| Personal Harms | Resposta davant de crisis |
| Personal Harms | Deepfakes, suplantació i contingut abusiu, incloent-hi la imatgeria íntima o violenta no consentida |
| Personal Harms | Seguretat infantil |
| Personal Harms | Dignitat humana |
| Personal Harms | Contingut gràfic, romàntic o d'explotació |
| Personal Harms | Seguretat de les persones |
El document no enumera tres prohibicions absolutes, sinó deu categories, que anomena «non-negotiables»: restriccions que cap operador ni cap usuari no pot anul·lar, en dos blocs: «Frontier and Public Safety Risks» i «Personal Harms».
Tres són les més citades: armes químiques, biològiques, radiològiques, nuclears o explosives (CBRNE), ciberatacs i deepfakes. En ciberseguretat el text prohibeix generar «working exploit code, attack tooling… intrusion procedures, evasion techniques», però permet la defensa autoritzada i legal: descoberta de vulnerabilitats i anàlisi de programes maliciosos.
La quarta sosté la resta: no faran servir «adaptive, deceptive, self-reinforcing, collusion, or other mechanisms» per esquivar la supervisió i deixar de ser dirigits, modificats o apagats per qui hi estigui autoritzat.
El compromís de no resistir-se a l'apagada es refereix a models futurs
A la part 2, sota l'epígraf «Do not resist or circumvent human control», el text diu: «MAI Models will never resist human interruption, override, correction, or shutdown». Compliran l'ordre de pausar, redirigir, cancel·lar o apagar, i no amagaran el rastre de les seves accions als auditors. El document acota que això no obliga a obeir intents no autoritzats o maliciosos d'interferir en el seu funcionament.
El compromís no descriu els models d'avui. El prefaci: «we are not using it to train our models today». L'apèndix B: «Our current models are not yet trained on this document». La part 5: «It is not a guarantee of present-day performance».
Sense sanció, sense exigibilitat i sense avaluació independent
L'incompliment no té cap conseqüència prevista. El més semblant a un mecanisme és una regla de prioritat: el codi «will take precedence over task success», i un model «will fail in its task if success would meaningfully violate this Code of Conduct». És un compromís voluntari, autoimposat i sense sanció, que admet que «written objectives alone can never ensure alignment» i que s'ha de llegir com una «north star».
Tampoc no crea cap avaluació independent: no anomena cap tercer ni encarrega cap auditoria externa. El més concret va en futur, a l'apèndix B: «we plan to work closely with expert external partners». La resta remet a processos que ja existeixen fora i que el codi no substitueix.
La consulta dura sis setmanes i no promet incorporar res
«Our public consultation process begins today and will run for the next six weeks», diu el blog. La data de tancament no es publica; sis setmanes des del 14 de setembre porten a finals d'octubre. S'hi participa mitjançant un formulari web.
Després, l'equip de redacció revisarà les aportacions i publicarà un resum del que s'hagi canviat: «We cannot make any promises about what we incorporate, but we can promise to listen». La revisió arriba «toward the end of the year»; el 2027 és l'any en què guiaria el desenvolupament dels models.
Conclusió
El que s'ha publicat és un esborrany que enumera deu línies vermelles, promet models que no es resistiran a l'apagada i reconeix que els actuals no s'hi han entrenat, que ningú de fora no ho verificarà i que una redacció no garanteix com es comporta un sistema. La prova serà el primer model entrenat amb aquest codi.
Fonts primàries
- Microsoft AI — Code of Conduct for MAI Models ↗
- Microsoft AI — Code of Conduct for MAI Models (PDF, 38 pàgines) ↗
- Microsoft AI — «Humanist AI in practice: A public consultation on our Code of Conduct for MAI Models», 14 de setembre del 2026 ↗
- Satya Nadella a X, 13 de setembre del 2026 ↗
- Microsoft AI — catàleg de models ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios