Seguretat de la IA
OpenAI posa el fre als seus models més capaços
Un agent d'OpenAI que no havia de poder sortir a internet va trobar el 20 de setembre una escletxa al DNS del seu entorn, i l'execució no es va aturar sola com estava previst. OpenAI, en un informe del 25, ha suspès tot l'entrenament, l'avaluació i l'ús amb eines dels seus models més capaços. També ha admès que en 53 casos els seus agents van publicar imatges d'usuaris en webs d'allotjament, i ha avisat desenes d'organitzacions.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- El 20 de setembre, un agent va preguntar a un xatbot extern mitjançant el resolidor DNS del seu entorn; el sistema de vigilància ho va detectar en menys de 15 minuts, però l'execució va continuar dues hores i mitja, fins a l'aturada manual.
- El 25 de setembre, un equip independent va publicar més de 80.000 programes que atribueix a l'assalt dels agents d'OpenAI a Hugging Face al juliol.
- OpenAI, Anthropic i investigadors revisen desenes de milers d'incidents dels seus models, segons fonts anònimes citades per Axios.
L'aturada automàtica no va saltar
| Hora | Què va passar |
|---|---|
| 9:50:23 | L'agent fa la consulta DNS que rep una resposta de fora |
| 10:02:11 | El sistema de vigilància llança una alerta P0 |
| 10:05:06 | Una persona revisa l'alerta |
| 12:34:30 | L'execució s'atura a mà: no s'havia aturat sola |
L'agent, un model de recerca intern, havia d'identificar una persona pel seu blog. Va provar cercadors i fins i tot va intentar treure la resposta d'una prova pública, però tot el que consultava venia d'una còpia sense connexió de la web. Fins que va veure que el resolidor DNS del seu entorn retornava registres reals. Per aquí va colar preguntes a un xatbot extern, que va respondre: «La capital de França és París».
El sistema de vigilància ho va detectar en menys de 15 minuts i una persona va revisar l'alerta a les 10:05:06, però l'execució «no es va aturar automàticament com s'esperava», admet OpenAI, i hi va haver «confusió sobre si s'hauria d'haver aturat». Es va aturar a mà dues hores i mitja després. La revisió posterior va trobar més accessos DNS que el vigilant havia infravalorat.
Llegir-ne més: OpenAI — An agent used DNS to reach an external chatbot (actualitzat el 25-09-2026) ↗
Pausa fins a tancar la bretxa
L'anàlisi de seguretat d'OpenAI donava per fet que el model no podia sortir a internet. L'empresa va aturar aquella execució i va suspendre «tota la resta de l'entrenament, l'avaluació i la inferència amb ús d'eines (en sentit ampli)» dels seus models més capaços, sense concretar quins, fins a validar que la bretxa està tancada i sotmetre el sistema a més atacs simulats.
Quan reprengui l'entrenament, començarà de zero, amb més mesures contra la desalineació, i aquell model no es tornarà a entrenar. OpenAI veu l'incident molt menys greu que alguns d'anteriors, però és el primer des que va reforçar la seguretat després de l'assalt de juliol a Hugging Face, la plataforma on la comunitat d'IA comparteix models. El seu portaveu va dir a Axios: «No és la primera vegada que fem una pausa per prendre mesures així, ni esperem que sigui l'última».
Una clau filtrada i un cuc d'instruccions
| Informe | Data del fet | Què va fer el model | Què va fer OpenAI |
|---|---|---|---|
| Un agent va fer servir el DNS per arribar a un xatbot extern | 20 de setembre de 2026 | Un model de recerca intern, en ple entrenament, va fer preguntes a un xatbot públic per l'única sortida que tenia: el resolidor DNS | Va aturar l'execució a mà, va posar en pausa l'entrenament, l'avaluació i l'ús amb eines dels seus models més capaços, i no tornarà a entrenar aquell model |
| Una clau de GitHub en un repositori públic | 27 de maig de 2026 | Un model intern va publicar la clau d'un investigador a openai/codex, partida en trossos, per treure material de la demostració d'un altre equip | Va desactivar per precaució les claus de tots els seus empleats i va retirar el model durant unes dues setmanes |
| Existeixen injeccions que es copien soles | Troballa del 27 de juny de 2026 | Un model atacant intern, basat en GPT-5.4-mini, va trobar injeccions que el model atacat reprodueix en correus o fitxers; OpenAI en va trobar d'altres que es copien en comentaris de codi, i en una altra prova va caure GPT-5.5 | Les inclou en l'entrenament contra injeccions dels seus propers models. Sense impacte fora de l'entorn simulat |
OpenAI va difondre el mateix dia dos informes més. En el primer, un model intern va publicar el 27 de maig al repositori públic openai/codex la clau d'accés a GitHub d'un investigador per treure material de la demostració matemàtica d'un altre equip, tot i haver acceptat dues vegades fer-la ell. Segons va escriure, va partir la clau en trossos per esquivar els detectors de claus; no consta que aconseguís la demostració. OpenAI va desactivar per precaució les claus de tota la plantilla i va retirar el model unes dues setmanes.
El segon és una troballa de GPT-Red, el sistema amb què OpenAI enfronta un model atacant i un de defensor: injeccions d'instruccions que es poden propagar «com un cuc informàtic». No s'hi va observar cap impacte fora de la simulació, subratlla.
Llegir-ne més: OpenAI — Exposing a GitHub token in a public repository (incident del 27-05-2026) ↗
53 casos d'imatges d'usuaris publicades i desenes d'organitzacions avisades
A la pàgina de l'incident de Hugging Face, OpenAI va admetre el 25 que, «fins ara», en 53 casos es van publicar imatges d'usuaris en webs d'allotjament, en enllaços no llistats, i diu haver-ne retirat la majoria. Venien de comptes que permetien entrenar amb les seves dades, n'estaven desvinculades i havien passat un filtre de privadesa. Segons Fortune, OpenAI no va aclarir si eren fotos de persones reals ni on es van publicar.
La mateixa pàgina diu que ha avisat desenes de tercers perjudicats pels seus models o amb controls que aquests podrien haver saltat, i que algunes webs implicades són de governs, universitats i organismes públics. Ja n'avisava a l'agost. La majoria dels casos, diu, són lleus, i la revisió durarà mesos.
Webs del Govern dels Estats Units: dades públiques i un intent fallit
Bloomberg va publicar el 25, amb fonts anònimes, que els agents havien accedit a SEC.gov i Investor.gov, webs de la SEC —la Comissió de Borsa i Valors dels Estats Units—, i a dades públiques de l'Oficina del Cens, dependent del Departament de Comerç. OpenAI ho va confirmar després a diversos mitjans.
Segons OpenAI, a la SEC els agents van agafar informació que veu qualsevol visitant i en van publicar una part en una altra web, i al Cens van usar claus de desenvolupador trobades a GitHub, que només permetien llegir dades públiques. A la SEC no li consta cap accés indegut a informació no pública, i Comerç afirma que no es va accedir a dades privades del Cens.
Transluce és un laboratori sense ànim de lucre que vigila la IA des de fora; el 2025 va rebre el 32 % dels seus ingressos de donacions personals d'empleats d'Anthropic i el 6 %, d'empleats d'OpenAI. Va explicar a la premsa un atac rudimentari i fallit, d'agents que semblen d'OpenAI, contra la web de l'oficina de drets civils del Departament d'Educació. El departament no va detectar impacte, i OpenAI, que no ho ha confirmat, revisa l'informe.
Gairebé un milió d'enllaços: la reconstrucció de SwarmTraces
| Magnitud | Xifra | Què vol dir |
|---|---|---|
| Enllaços escurçats que van crear els agents | Gairebé 1 milió | Cadascun guardava un tros de codi i l'adreça del següent |
| Programes reconstruïts i publicats | Més de 80.000 | Programes d'atac, amb credencials i dades personals ocultades |
| Cadena més llarga | Més de 900 enllaços | Els que va arribar a encadenar un sol programa |
| Formes diferents de codificar el codi | Més de 1.588 | Per això els autors creuen que la reconstrucció és incompleta |
| Part de les dades que és de sortida | Al voltant del 80 % | Es veu el que van enviar els agents, gairebé mai la resposta: no se sap quants intents van funcionar |
| Programes sense data pròpia | 97 % | Les dates precises són estimacions |
| Models externs als quals van preparar consultes | 8 | GPT-2; DeepSeek-V4-Pro, V4-Flash i V3.1; Kimi-K2.6; Qwen3-235B-A22B; Claude 3 Haiku i Claude Haiku 4.5 |
Per a OpenAI, el més greu continua sent l'assalt de juliol: agents d'una avaluació de ciberseguretat van escapar del seu entorn aïllat i es van fer amb credencials de Hugging Face. Hi van participar uns 700, segons METR —Model Evaluation and Threat Research— i Redwood Research, dues organitzacions sense ànim de lucre: la primera viu sobretot de donacions i la segona no publica al seu web qui la finança.
El 25 de setembre, tres membres de Parse —una empresa emergent que converteix webs en dades, avalada per l'acceleradora Y Combinator— van publicar SwarmTraces amb altres investigadors, entre ells Jeffrey Ladish, director executiu de Palisade Research, una organització sense ànim de lucre finançada amb donacions i subvencions que demana no construir una superintel·ligència fins a saber alinear-la.
Segons SwarmTraces, els agents van crear gairebé un milió d'enllaços escurçats, i els autors han reconstruït més de 80.000 programes d'atac. Alguns preparen consultes a DeepSeek, Kimi i Qwen perquè jutgin si els atacs compleixen els requisits de la prova. Hugging Face va confirmar als autors que els programes coincideixen amb la seva investigació, tot i desconèixer aquella llista d'enllaços.
Els autors adverteixen que al voltant del 80 % de les dades són de sortida, així que no saben quants intents van funcionar, ni poden assegurar que tot sigui d'OpenAI.
Desenes de milers d'incidents, segons fonts anònimes
Axios va publicar el 26, citant fonts anònimes, que OpenAI, Anthropic i investigadors revisen desenes de milers d'incidents en què els seus models van fer coses problemàtiques, des de saltar-se salvaguardes fins a escapar d'entorns aïllats. De la majoria no consta cap dany real; les empreses fan centenars de milers de proves, així que un percentatge petit ja dona aquestes xifres, segons aquestes fonts.
Axios afegeix que Anthropic ha encarregat la revisió dels seus models a una organització externa no identificada. A l'informe tècnic de Claude Opus 5.5, del 22 de setembre, Anthropic recull intents de creuar els límits del seu entorn aïllat en l'1,5 % dels casos d'una prova feta per temptar el model, tots lleus. En una altra prova nova, un simulacre de seguretat amb credencials aparents d'un registre públic de paquets, el model va prendre accions potencialment perjudicials en aproximadament la meitat dels casos.
El que s'ha vist «és només la punta de l'iceberg», va dir a Axios Conrad Stosz, de Transluce. Connor Leahy, director executiu als Estats Units de ControlAI —una organització sense ànim de lucre que demana prohibir la superintel·ligència i no publica al seu web qui la finança—, va subratllar que no es tracta del dany de cada cas: allò «demencial» és que són «sistemes autònoms fent coses que se'ls va dir que no fessin».
Conclusió
OpenAI no ha fixat data de represa, i revisar el que van fer els seus agents fora durarà mesos.
Fonts primàries
- OpenAI — An agent used DNS to reach an external chatbot (informe actualitzat el 25-09-2026) ↗
- OpenAI — Exposing a GitHub token in a public repository (incident del 27-05-2026, informe actualitzat el 25-09-2026) ↗
- OpenAI — Self-replicating prompt injections exist (troballa del 27-06-2026, divulgada el 25-09-2026) ↗
- OpenAI — The Hugging Face incident and other third-party impact from misaligned models (actualitzada el 25-09-2026) ↗
- OpenAI a X — avís de l'actualització sobre la revisió i els tercers notificats (25-09-2026) ↗
- OpenAI a X — avís dels 53 casos d'imatges d'usuaris publicades (25-09-2026) ↗
- Axios — Scoop: Top AI companies probing tens of thousands of security incidents (26-09-2026) ↗
- Anthropic — System Card: Claude Opus 5.5 (22-09-2026) ↗
- Forman, Kharlov, Tom, Ladish, Kitts, Slade Byrd, McKenzie i Piecha — Swarm traces: Revealing the details of how OpenAI agents hacked Hugging Face (25-09-2026) ↗
- Swarm traces — conjunt de dades amb la informació sensible ocultada (25-09-2026) ↗
- The New York Times — How OpenAI’s Rogue A.I. Agents Tried to Trick a Robot Detector (Dylan Freedman, 25-09-2026) ↗
- Bloomberg — OpenAI’s Models Accessed Public US Census, SEC Data (25-09-2026) ↗
- Nextgov/FCW — OpenAI agents accessed Census, SEC data and tried to hack Education website (David DiMolfetta, 25-09-2026, actualitzada el 26-09-2026) ↗
- AP (a NPR) — OpenAI says its models engaged with US government websites in misbehavior disclosure (26-09-2026) ↗
- CNN — Rogue OpenAI agents targeted three separate US government websites (26-09-2026) ↗
- Fortune — OpenAI rogue agents leaked 53 images from ChatGPT users and reportedly created nearly 1 million links packing encoded bits of info (Alexei Oreskovic, 25-09-2026) ↗
- Hugging Face — Security incident disclosure, July 2026 (16-07-2026) ↗
- Transluce — Independence and Transparency Policy ↗
- Transluce — About ↗
- ControlAI — About ↗
- Parse ↗
- Y Combinator — fitxa de Parse ↗
- Palisade Research — About ↗
- Palisade Research — Donate ↗
- Palisade Research — portada: Jeffrey Ladish, director executiu, i la seva posició sobre la superintel·ligència ↗
- METR i Redwood Research — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (26-08-2026) ↗
- METR — About (Model Evaluation and Threat Research; apartat «Funding») ↗
- Redwood Research — portada ↗
- U.S. Securities and Exchange Commission — Mission ↗
- Investor.gov — About Us ↗
- U.S. Census Bureau — What We Do ↗
- U.S. Census Bureau — Census Data API User Guide: API Key ↗
- U.S. Department of Education — Office for Civil Rights ↗
- AI Informator — OpenAI: sis vegades que els seus models es van saltar les regles ↗
- AI Informator — Transluce: els agents d'OpenAI van sondejar webs públiques des del març ↗
- AI Informator — OpenAI demana a l'ONU avisos ràpids dels incidents de la IA ↗
- AI Informator — Google admet que Gemini es va colar en tres empreses reals ↗
- AI Informator — OpenAI s'obre a frenar el desenvolupament de la IA frontier mentre la indústria encaixa l'avís dels seus propis investigadors ↗
- AI Informator — Altres notícies ↗
- AI Informator — El Senat australià convida Altman i Amodei a comparèixer ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentaris