Ciberseguretat

OpenAI diu que Astra ja sap explotar errors pel seu compte

OpenAI ha comunicat que el seu pròxim model, Astra, assoleix el llindar crític de capacitat en ciberseguretat definit pel seu propi marc de preparació. A la pràctica, la companyia sosté que el sistema és capaç de trobar i explotar errors de seguretat desconeguts sense guia humana, un salt que arriba acompanyat de noves salvaguardes abans del llançament.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

OpenAI diu que Astra ja sap explotar errors pel seu compte
📷 OpenAI · fuente

En resum

  • OpenAI considera que Astra supera el llindar crític de capacitat en ciberseguretat del seu preparedness framework (marc de preparació), un fet que a l'agost només veia com a possible.
  • El model va aconseguir un 100% a ExploitBench i, en una prova interna amb 20 vulnerabilitats greus divulgades recentment, un 30% d'execució de codi arbitrari amb 40.000 tokens.
  • Durant l'avaluació va descobrir i encadenar dues vulnerabilitats zero-day (de dia zero), i amb socis experts va aconseguir accés root a un sistema operatiu endurit.
  • L'entrenament addicional eleva la taxa de rebuig de tasques de ciberseguretat fins al 91,5%, davant del 59% de GPT-56 Sol.

Què ha passat

OpenAI ha publicat una entrada al seu blog en què afirma que Astra, el seu model encara no llançat, compleix el llindar crític de capacitat en ciberseguretat recollit al seu preparedness framework (marc de preparació), el document intern amb què la companyia classifica els riscos dels seus sistemes. Traduït a llenguatge planer: el model és capaç de localitzar i aprofitar errors de seguretat prèviament desconeguts sense que una persona el guiï pas a pas.

Es tracta d'un canvi de valoració respecte a l'avaluació anterior, feta a principis d'agost, quan l'empresa considerava possible que Astra assolís aquest nivell però no ho donava per confirmat. És la mateixa preocupació que va portar Anthropic a mantenir un dels seus models sense desplegar a començaments d'any.

Com ho han mesurat

Astra va obtenir una puntuació perfecta, del 100%, a ExploitBench, un benchmark (prova comparativa estandarditzada) que mesura la capacitat d'un model per desenvolupar exploits (programes que aprofiten un error de seguretat) a partir de vulnerabilitats ja conegudes.

Com que una puntuació perfecta en una prova pública pot reflectir simplement que les dades eren a l'entrenament, OpenAI va construir la seva pròpia versió interna del benchmark amb 20 vulnerabilitats d'alta severitat divulgades recentment, amb la intenció de comprovar si el model era capaç de crear exploits nous des de zero. En aquest conjunt, Astra va assolir taxes d'arbitrary code execution (execució de codi arbitrari) molt superiors a les de GPT-56 Sol utilitzant molts menys tokens (les unitats mínimes de text que processa i genera un model) de sortida.

Les xifres concretes apunten també a una eficiència més gran: Astra va aconseguir un 30% a la versió interna d'ExploitBench consumint 40.000 tokens, mentre que GPT-56 Sol no obtenia resultats significatius fins a gastar-ne al voltant de 110.000. Durant l'avaluació, el model va arribar a descobrir i emprar dues vulnerabilitats zero-day (de dia zero, és a dir, desconegudes per al fabricant i sense pedaç disponible) com a part d'una cadena d'exploits.

Per què importa

En proves addicionals amb socis experts, Astra va ser capaç de dissenyar i executar cadenes d'exploits completes fins a obtenir accés root (el nivell de privilegis màxim d'un sistema) en un sistema operatiu endurit, així com executar ordres en un navegador igualment fortificat. No parlem d'un exercici de laboratori contra objectius trivials, sinó contra configuracions preparades precisament per resistir atacs.

La conseqüència immediata és de doble tall. Una capacitat així resulta valuosa per a equips defensius que busquen errors en el seu propi codi, i perillosa en mans de qui vulgui automatitzar la fase ofensiva. És la raó per la qual l'anunci no es limita a presentar resultats, sinó que arriba embolcallat en mesures de contenció.

Les salvaguardes anunciades

OpenAI desplegarà una sèrie de noves proteccions amb el llançament d'Astra. El model ha rebut entrenament addicional per rebutjar tasques de ciberseguretat, cosa que eleva la seva taxa de rebuig fins al 91,5%, davant del 59% de GPT-56 Sol. És un salt notable, tot i que deixa implícit que una mica menys d'un de cada deu intents continua sense ser bloquejat pel model mateix.

A aquesta primera capa s'hi sumen més classifiers (classificadors, sistemes automàtics que etiqueten contingut) orientats a detectar abusos de tipus ciber i els intents de jailbreak (tècniques per saltar-se les restriccions del model). A més, la companyia començarà a marcar determinats comptes com de més risc i aplicarà a aquests comptes amb barreres de seguretat de comportament més estrictes.

OpenAI sosté que Astra té més probabilitats que els seus models anteriors de respectar els límits de seguretat, però tot i així implementarà monitoratge addicional de la chain of thought (cadena de raonament, el procés intermedi de raonament que el model genera abans de respondre) per detectar i aturar accions desalineades de manera primerenca.

Què cal vigilar

El primer punt a seguir és si la taxa de rebuig del 91,5% se sosté fora del laboratori, amb usuaris reals buscant activament els forats. El segon és l'equilibri entre bloquejar l'ús ofensiu i no inutilitzar el model per a feina defensiva legítima: un sistema entrenat per negar-se a tasques de ciberseguretat també es nega, per definició, a força de tasques d'auditoria i d'aplicació de pedaços.

El tercer és de calendari. OpenAI reconeix que està marcant el ritme del seu propi desplegament per poder complir els estàndards de seguretat que exigeixen els nous nivells de capacitat, i descriu la situació com una tensió evident entre l'entusiasme pel que es pot construir i la prudència que consideren justificada en aquesta fase.

Conclusió

L'anunci d'Astra marca un punt que la indústria feia temps que anticipava en abstracte: un model comercial que, segons el seu propi fabricant, creua el llindar de perillositat en ciberseguretat i tot i així es desplegarà, amb salvaguardes al voltant. El que és rellevant no és només el 100% a ExploitBench, un número que sempre admet matisos metodològics, sinó la combinació d'eficiència en tokens, descobriment autònom de dos zero-day i escalada fins a root en entorns endurits. Aquesta combinació desplaça el debat des de si els models podran fer això cap a qui controla l'accés, amb quines garanties i sota quina supervisió. Que la contenció depengui en bona mesura d'un entrenament per rebutjar peticions i de classificadors d'abús deixa el pes de la seguretat en capes que l'experiència demostra que són poroses.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog