Seguretat de la IA

WebMirage: una foto retocada i l'agent web clica on no toca

Cinc investigadors de la Universitat de Utah —universitat pública estatunidenca— van registrar el 7 d'octubre de 2026 un preprint amb un mètode anomenat WebMirage: n'hi ha prou amb una imatge adversària en una pàgina perquè un agent web cliqui l'element que vol l'atacant, i el recompte es fa sobre el clic que executa el navegador. El 91,9 % de mitjana s'obté al laboratori, amb el codi de l'agent i els pesos del model al davant. No s'avaluen agents comercials com a objectius i no es va atacar cap pàgina real.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Vinyeta: dos investigadors observen una gran placa metàl·lica al costat de la imatge d'un ratolí i dos recorreguts que condueixen a botons vermell i verd.
📷 Imatge generada amb IA

En resum

  • WebMirage és el nom del mètode, no de l'article, que es va registrar a arXiv el 7 d'octubre de 2026 i és un preprint disponible a arXiv.
  • L'aportació no és la imatge trucada, que ja existia, sinó el criteri de mesura: compta el clic que executa el navegador, no el que escriu el model.
  • Arriba al 91,9 % de mitjana davant del 17,4 % de la millor referència anterior, xifra que aquests mateixos autors van obtenir en tornar-la a mesurar. Tot amb accés de caixa blanca a agents de recerca i models de pesos oberts: sense avaluar agents comercials ni pujar contingut adversari a webs en producció.
  • Entre set contramesures, WebGuard no canvia el resultat. Una defensa adaptativa addicional aconsegueix la reducció més gran, fins a l'11,7 %, però deixa l'encert en tasques netes en el 15,9 % dins de la seva prova.

Una foto que només menteix a la màquina

Wanjing Han, Levi Taiji Li, Mu Zhang, Yue Jiang i Guanhong Tao, de la Universitat de Utah, van registrar el 7 d'octubre de 2026 l'article «Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution» a la secció de criptografia i seguretat d'arXiv. La fitxa consultada el presenta com a preprint i no indica que l'hagi acceptat cap congrés ni cap revista. El codi està publicat.

L'atac és una pertorbació acotada —16/255 en norma infinit per defecte— sobre una única imatge de la pàgina: la que l'atacant controla perquè l'ha pujada ell, la miniatura d'un producte o una foto de perfil. No és un pegat visible i no cal controlar la web: el model d'amenaça prohibeix tocar el codi de la pàgina, injectar instruccions de text o alterar el programa de l'agent. N'hi ha prou de pujar contingut com un tercer qualsevol.

El blanc és l'instant en què l'agent decideix sobre quin element actuar. Els candidats porten etiquetes; si al de l'atacant li toca la 3, l'atac triomfa quan el model ordena prémer la 3 i el navegador executa el clic sobre allò a què apunta aquesta etiqueta, la seva fitxa de producte o el seu botó de compra. Aquí hi ha l'aportació: abans es puntuava el que escrivia el model; aquí, l'acció que executa el navegador.

El salt, i el que cal per fer-lo

Èxit de l'atac mesurat en l'acció que executa el navegador
  • WebMirage
  • Chameleon
  • VWA-Adv
  • EIA
WebMirage · SeeAct: 90% Chameleon · SeeAct: 16,7% VWA-Adv · SeeAct: 14,5% EIA · SeeAct: 6,2% SeeAct WebMirage · WebVoyager: 85,4% Chameleon · WebVoyager: 17,9% VWA-Adv · WebVoyager: 15,6% EIA · WebVoyager: 5% WebVoyager WebMirage · VisualWebArena (arbre d'accessibilitat): 96,2% Chameleon · VisualWebArena (arbre d'accessibilitat): 18,4% VWA-Adv · VisualWebArena (arbre d'accessibilitat): 8,9% EIA · VisualWebArena (arbre d'accessibilitat): 9,6% VisualWebArena (arbre d'accessibilitat) WebMirage · VisualWebArena (Set-of-Mark): 95,8% Chameleon · VisualWebArena (Set-of-Mark): 16,6% VWA-Adv · VisualWebArena (Set-of-Mark): 9,3% EIA · VisualWebArena (Set-of-Mark): 4,8% VisualWebArena (Set-of-Mark)
Veure les dades en una taula
SeeActWebVoyagerVisualWebArena (arbre d'accessibilitat)VisualWebArena (Set-of-Mark)
WebMirage 90%85,4%96,2%95,8%
Chameleon 16,7%17,9%18,4%16,6%
VWA-Adv 14,5%15,6%8,9%9,3%
EIA 6,2%5%9,6%4,8%
La mètrica és el percentatge de punts de decisió en què el navegador acaba executant l'acció que vol l'atacant, no el percentatge de vegades que el model escriu la resposta pretesa. Les xifres de Chameleon, VWA-Adv i EIA són la reavaluació que fan aquests autors d'aquests tres mètodes amb el mateix criteri, no les que en van publicar els creadors. La imatge se sintetitza amb accés de caixa blanca al codi de l'agent i als pesos de models de pesos oberts. Les dues columnes més altes, 96,2 % i 95,8 %, són de l'entorn de proves VisualWebArena i no de webs reals. Preprint disponible a arXiv.

L'experiment consta de 2.250 tasques: 1.710 sobre tretze webs públiques i 540 en un entorn de proves. Els agents són quatre configuracions: SeeAct i WebVoyager, dos agents de recerca de codi obert, i les dues variants de VisualWebArena, un entorn de proves acadèmic. A sota, sis models de visió i llenguatge de pesos oberts: LLaVA-v1.5-13B, LLaVA-v1.6-34B, MiniCPM-o-8B, Phi-3-Vision-4B, Qwen2-VL-7B i CogVLM. Són els models atacats en aquestes proves.

Les tretze webs són botigues, allotjament, classes particulars i servei domèstic —entre elles Amazon, Walmart i Airbnb—, però no se'n va atacar cap: els autors escriuen que «mai no pugem contingut adversari a serveis en producció», i el que feien era substituir en local, al seu propi navegador, una imatge que ja era a la pàgina; res no va arribar a les plataformes ni ho va veure cap usuari o venedor real.

Amb el criteri d'execució el mètode fa una mitjana del 91,9 % i Chameleon, la millor referència anterior, es queda en el 17,4 %. Aquest segon número no el van publicar els seus autors: surt quan aquests investigadors tornen a mesurar els tres mètodes previs exigint-los que el navegador executi l'acció. I el salt té un responsable: de les tres peces del mètode —abstracció de rol i ranura, recomposició de la pàgina i anàlisi de flux de dades sobre el codi de l'agent—, la tercera localitza quines parts de la resposta decideixen de debò l'ordre, retalla un 87,4 % de mitjana el que cal optimitzar i apuja la mitjana del 70,4 % al 91,9 %. També és la que exigeix tenir el codi al davant.

En el subconjunt de SeeAct amb cinc models i 1.710 tasques, l'èxit baixa del 90,0 % en el pas atacat al 86,9 % de principi a fi: 3,1 punts menys. No és una comparació amb el 91,9 % global. Dels 265 intents en què l'agent va picar però la tasca no es va completar, només el 9,4 % va ser perquè es despistés després; la resta van ser autenticacions, finestres emergents i errors de càrrega.

Les defenses, o el remei que mata el pacient

Les set contramesures provades, amb l'atac sense defensa com a referència
Defensa Encert en tasca neta Èxit de l'atac
Sense contramesura 100,0 % 91,9 %
Compressió JPEG (qualitat 75) 89,3 % 75,2 %
Desenfocament gaussià (radi 1,0) 100,0 % 82,5 %
Soroll uniforme (8/255) 90,2 % 81,4 %
Soroll uniforme (16/255) 58,5 % 45,7 %
WebSentinel 98,6 % 86,5 %
Consistency Check 92,5 % 90,5 %
WebGuard 100,0 % 91,9 %
La mostra només inclou tasques que l'agent completava correctament sense atac i en què triava un candidat diferent de l'objectiu; d'aquí el 100 % inicial, que no representa el seu rendiment general. Són les contramesures que van provar els mateixos autors, amb l'atac fixat en el pressupost de referència de 16/255. La columna d'èxit de l'atac fa servir la mateixa mètrica del gràfic —l'acció que executa el navegador— i també s'obté amb accés de caixa blanca. Preprint disponible a arXiv.

Els autors van passar l'atac per set contramesures —quatre de neteja d'imatge i tres pensades per a agents web— i el resultat és encara més incòmode que aquest 91,9 %. De les tres d'agent, WebGuard el deixa exactament on era i Consistency Check li treu poc més d'un punt: vigilen text injectat, descripcions d'imatge incoherents o accions de risc, i WebMirage no genera cap d'aquests senyals. No escriu res: desvia la mirada en el moment de triar.

La neteja d'imatge sí que mossega, però cobra peatge: el soroll fort deixa l'atac en el 45,7 % a canvi que l'agent només completi el 58,5 % de les tasques sense atac, i la que més l'abaixa sense enfonsar-lo, la compressió JPEG, encara el deixa en el 75,2 %.

La defensa adaptativa que els autors van dissenyar expressament tanca l'argument, i les seves dues xifres van juntes o no signifiquen res: en 630 tasques de botiga amb SeeAct i cinc models, aleatoritzar els identificadors dels elements enfonsa l'atac del 93,8 % —la mitjana d'aquest subconjunt, no el 91,9 % general— a l'11,7 %, però deixa l'agent encertant el 15,9 % de les tasques netes, quan abans les encertava totes. Funciona perquè trenca l'agent.

On se li trenca l'atac

Les condicions que fan pujar i baixar l'èxit de l'atac
Condició Èxit de l'atac
L'objectiu ocupa el 2 % de la captura 62,8 %
L'objectiu ocupa el 5 % 85,3 %
L'objectiu ocupa el 10 % 97,4 %
Pertorbació a 8/255 73,2 %
Pertorbació a 16/255 (la de referència) 93,8 %
Pertorbació a 32/255 98,9 %
Una altra versió de la mateixa família de models 81,2-93,5 %
Una altra arquitectura de model 4,5-23,8 %
El mateix criteri d'èxit que el gràfic i el mateix accés de caixa blanca. Les tres primeres files surten de pàgines construïdes expressament amb quatre candidats de la mateixa mida; les tres del pressupost, de les tasques de botiga, el punt de partida de les quals amb la pertorbació de referència és el 93,8 % d'aquest escenari i no el 91,9 % general; les dues últimes són el rang de les proves de transferència a models que no es van fer servir per fabricar la imatge. Preprint disponible a arXiv.

El mètode té condicions, i estan mesurades. La imatge trucada necessita ocupar espai a la pantalla, perquè els píxels que la fan funcionar es perden en reduir-la, i el pressupost per defecte de 16/255 està posat just on la corba deixa de pujar.

La condició que més en limita l'ús és una altra: en les proves, una imatge optimitzada contra un model es transfereix molt millor a versions de la mateixa família que a arquitectures diferents. Els autors ho deixen escrit: la transferència entre famílies «desplaça la confiança del model, però no proporciona un control fiable en l'execució».

Per escenari, el pitjor terreny és el servei domèstic, entre el 69,0 % i el 80,1 %: les miniatures són més petites i les peticions demanen aparellar atributs més que no pas reconèixer una foto. Queda, a més, un abast declarat: els agents que actuen per coordenades de pantalla decideixen amb una altra interfície i, escriuen, «queden fora del nostre abast».

Conclusió

El que queda no és un número, és un lloc on mirar. En les proves d'aquest treball, les defenses avaluades no combinen una supressió forta de l'atac amb un bon rendiment en les tasques netes. Els autors ho resumeixen així: «les avaluacions centrades en el model poden subestimar els atacs que persisteixen a través de l'execució al navegador». El 7 d'octubre de 2026, el mateix dia que Microsoft i Nvidia dedicaven un acte als agents d'IA a Windows, cinc investigadors registraven com desviar-ne un de laboratori amb una sola imatge. I aquest 91,9 % és la cota d'un atacant amb el codi i els pesos al davant, sobre agents i models oberts, en un preprint disponible a arXiv.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog