Ciberseguretat
Un model gairebé frontera sense guardrails: Obliteration.ai llança "obliterated model large v2" i reobre el debat sobre la censura en IA
Obliteration.ai ha publicat un model derivat de GLM 5.3 al qual assegura haver eliminat els rebutjos a escala de pesos, i la comunitat ja l'anomena "crime LLM".
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Obliteration.ai ha llançat "obliterated model large v2", un model basat en GLM 5.3 al qual diu haver eliminat els guardrails directament als pesos.
- L'empresa afirma que conserva intactes les capacitats de codi, ciberseguretat i agents, amb el doble de rendiment en explotació cibernètica que la seva versió 5.2.
- El model ofereix una finestra de context d'un milió de tokens, allotjament als Estats Units i absència de retenció de prompts.
- Acadèmics i experts qüestionen la utilitat dels guardrails de laboratoris com Anthropic o OpenAI si un model gairebé frontera es pot desplegar sense censura poc després.
- L'atac a Hugging Face del juliol del 2026 va il·lustrar el dilema: els guardrails que frenen els atacants també van frenar els defensors.
Què ha publicat Obliteration.ai
Obliteration.ai ha presentat "obliterated model large v2", un model de llenguatge construït a partir de GLM 5.3, un dels sistemes més capaços del moment. Segons la mateixa companyia, el model base ocupa el tercer lloc al benchmark (prova comparativa de rendiment) Terminal Bench 4.0, només per darrere d'Opus 5 i Fable. La diferència respecte a l'original és que aquesta versió arriba, segons el seu anunci oficial, sense cap de les barreres de seguretat que fan que els models comercials es neguin a respondre determinades peticions.
L'empresa descriu el procediment com a "obliteració": afirma haver localitzat en el model les direccions d'activació (els patrons interns que disparen la conducta de rebuig) i haver-les retirat directament dels pesos. No es tracta, per tant, d'un jailbreak (tècnica per saltar-se les restriccions mitjançant instruccions), que actua des de fora i pot fallar, sinó d'una modificació permanent del model mateix. El resultat que anuncien és un sistema que senzillament no té la capacitat de negar-se.
Les xifres que presenta la companyia
En el seu anunci, Obliteration.ai sosté que la intervenció no ha degradat el rendiment del model en les tasques que més importen al seu públic objectiu: programació, ciberseguretat i funcionament com a agent autònom. L'afirmació més cridanera és que "obliterated model large v2" duplica la capacitat d'explotació cibernètica de la versió 5.2 anterior, un salt considerable en un terreny especialment sensible.
La resta d'especificacions apunta a un producte pensat per a un ús professional continuat: una finestra de context d'un milió de tokens, que permet processar volums molt grans de codi o documentació d'un sol cop; allotjament de la infraestructura als Estats Units; i una política explícita de no retenció de prompts (les instruccions enviades al model), pensada per a clients que treballen amb material confidencial i no volen que les seves consultes quedin emmagatzemades en servidors aliens.
Ciberdefensa, red teaming i proves d'agents
La companyia no presenta el model com una eina per delinquir, sinó com un instrument professional per a tres usos concrets: ciberdefensa, red teaming (proves de seguretat ofensives, en què un equip simula ser l'atacant per trobar errors abans que els delinqüents) i agent testing (proves de sistemes autònoms). L'argument és conegut a la indústria de la seguretat informàtica: per defensar bé un sistema cal ser capaç d'atacar-lo primer.
El problema és que aquesta mateixa capacitat no distingeix qui la fa servir. Un model entrenat per redactar exploits sense objeccions és igual d'eficaç en mans d'un equip de seguretat corporatiu que en les d'un atacant. La diferència recau enterament en el client i en els controls que la mateixa empresa apliqui a l'accés, no del model, que per disseny ja no pot oposar cap resistència.
Reacció immediata: "crime LLM"
La publicació ha generat controvèrsia gairebé a l'instant. Acadèmics i experts del sector s'han referit al sistema com un "crime LLM" (model de llenguatge per al crim) i han qüestionat obertament que sigui raonable oferir capacitats ofensives d'aquest nivell sense cap restricció. El focus de les crítiques no és tant l'existència tècnica de l'obliteració, un procediment conegut, com el fet que es comercialitzi obertament sobre un model situat tan a prop de la frontera de capacitat.
El debat ha derivat cap a una pregunta més incòmoda per als grans laboratoris: de què serveixen els guardrails (barreres de seguretat) que Anthropic o OpenAI incorporen als seus models si, poc després, un sistema de capacitat comparable es pot desplegar sense cap? Part de la comunitat sosté que l'alineament a escala de pesos és una defensa fràgil i que la seguretat s'hauria de traslladar a altres capes: al harness (la infraestructura que executa el model i controla les seves eines i permisos) o directament al terreny legal i regulatori.
El dilema que va deixar l'atac a Hugging Face
El context ajuda a entendre per què el debat no és senzill. Després de l'atac informàtic que va patir Hugging Face el juliol del 2026, la plataforma va haver de recórrer a models oberts per defensar-se, perquè els guardrails dels models tancats li impedien fer la feina d'anàlisi i resposta que necessitava en aquell moment. Els mateixos filtres dissenyats per frenar un atacant estaven frenant la víctima.
Aquell episodi va deixar al descobert una tensió que la indústria encara no ha resolt: les restriccions incorporades als models no distingeixen intencions, només formes. Bloquegen per igual l'actor maliciós que redacta un atac i l'equip legítim que intenta entendre'n un en curs. L'existència de productes com el d'Obliteration.ai és, en bona mesura, la resposta comercial a aquesta frustració acumulada entre els professionals de la seguretat.
Què hi ha realment en joc
El llançament posa a prova una de les hipòtesis centrals sobre les quals s'ha construït la política de seguretat de la IA els darrers anys: que entrenar el rebuig dins del model és una barrera significativa. Si aquesta barrera es pot retirar quirúrgicament dels pesos i el model conserva les seves capacitats, l'alineament intern funciona com una mesura d'higiene per a l'ús general, però no com un obstacle real davant de qui té mitjans i intenció d'eliminar-lo.
L'alternativa que comença a discutir-se desplaça la seguretat fora del model. Controlar el harness, limitar quines eines pot invocar un agent, auditar l'accés i establir responsabilitat legal sobre qui desplega el sistema són mesures que no depenen del que el model estigui disposat a dir. Anthropic ha anat documentant riscos d'aquest tipus als seus informes públics de seguretat, i aquest cas ofereix un exemple concret de per què la discussió ha deixat de ser teòrica.
Conclusió
"Obliterated model large v2" no introdueix una tècnica nova, però sí que en normalitza l'ús comercial sobre un model de capacitat gairebé frontera, i això canvia els termes del debat. La pregunta ja no és si els guardrails es poden eliminar (es poden), sinó què queda dempeus quan desapareixen. La resposta que s'obri pas els pròxims mesos (controls al harness, obligacions legals per a qui desplega, o alguna combinació de totes dues) definirà bona part de la política de seguretat en IA dels pròxims anys. Mentrestant, el dilema que va revelar l'atac a Hugging Face continua sense resoldre's: encara no existeix cap manera de bloquejar l'atacant sense bloquejar també el defensor.
Fonts primàries
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentarios