Seguretat de la IA
WebMirage: una foto retocada i l'agent web clica on no toca
Cinc investigadors de la Universitat de Utah —universitat pública estatunidenca— van registrar el 7 d'octubre de 2026 un preprint amb un mètode anomenat WebMirage: n'hi ha prou amb una imatge adversària en una pàgina perquè un agent web cliqui l'element que vol l'atacant, i el recompte es fa sobre el clic que executa el navegador. El 91,9 % de mitjana s'obté al laboratori, amb el codi de l'agent i els pesos del model al davant. No s'avaluen agents comercials com a objectius i no es va atacar cap pàgina real.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- WebMirage és el nom del mètode, no de l'article, que es va registrar a arXiv el 7 d'octubre de 2026 i és un preprint disponible a arXiv.
- L'aportació no és la imatge trucada, que ja existia, sinó el criteri de mesura: compta el clic que executa el navegador, no el que escriu el model.
- Arriba al 91,9 % de mitjana davant del 17,4 % de la millor referència anterior, xifra que aquests mateixos autors van obtenir en tornar-la a mesurar. Tot amb accés de caixa blanca a agents de recerca i models de pesos oberts: sense avaluar agents comercials ni pujar contingut adversari a webs en producció.
- Entre set contramesures, WebGuard no canvia el resultat. Una defensa adaptativa addicional aconsegueix la reducció més gran, fins a l'11,7 %, però deixa l'encert en tasques netes en el 15,9 % dins de la seva prova.
Una foto que només menteix a la màquina
Wanjing Han, Levi Taiji Li, Mu Zhang, Yue Jiang i Guanhong Tao, de la Universitat de Utah, van registrar el 7 d'octubre de 2026 l'article «Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution» a la secció de criptografia i seguretat d'arXiv. La fitxa consultada el presenta com a preprint i no indica que l'hagi acceptat cap congrés ni cap revista. El codi està publicat.
L'atac és una pertorbació acotada —16/255 en norma infinit per defecte— sobre una única imatge de la pàgina: la que l'atacant controla perquè l'ha pujada ell, la miniatura d'un producte o una foto de perfil. No és un pegat visible i no cal controlar la web: el model d'amenaça prohibeix tocar el codi de la pàgina, injectar instruccions de text o alterar el programa de l'agent. N'hi ha prou de pujar contingut com un tercer qualsevol.
El blanc és l'instant en què l'agent decideix sobre quin element actuar. Els candidats porten etiquetes; si al de l'atacant li toca la 3, l'atac triomfa quan el model ordena prémer la 3 i el navegador executa el clic sobre allò a què apunta aquesta etiqueta, la seva fitxa de producte o el seu botó de compra. Aquí hi ha l'aportació: abans es puntuava el que escrivia el model; aquí, l'acció que executa el navegador.
El salt, i el que cal per fer-lo
- WebMirage
- Chameleon
- VWA-Adv
- EIA
Veure les dades en una taula
| SeeAct | WebVoyager | VisualWebArena (arbre d'accessibilitat) | VisualWebArena (Set-of-Mark) | |
|---|---|---|---|---|
| WebMirage | 90% | 85,4% | 96,2% | 95,8% |
| Chameleon | 16,7% | 17,9% | 18,4% | 16,6% |
| VWA-Adv | 14,5% | 15,6% | 8,9% | 9,3% |
| EIA | 6,2% | 5% | 9,6% | 4,8% |
L'experiment consta de 2.250 tasques: 1.710 sobre tretze webs públiques i 540 en un entorn de proves. Els agents són quatre configuracions: SeeAct i WebVoyager, dos agents de recerca de codi obert, i les dues variants de VisualWebArena, un entorn de proves acadèmic. A sota, sis models de visió i llenguatge de pesos oberts: LLaVA-v1.5-13B, LLaVA-v1.6-34B, MiniCPM-o-8B, Phi-3-Vision-4B, Qwen2-VL-7B i CogVLM. Són els models atacats en aquestes proves.
Les tretze webs són botigues, allotjament, classes particulars i servei domèstic —entre elles Amazon, Walmart i Airbnb—, però no se'n va atacar cap: els autors escriuen que «mai no pugem contingut adversari a serveis en producció», i el que feien era substituir en local, al seu propi navegador, una imatge que ja era a la pàgina; res no va arribar a les plataformes ni ho va veure cap usuari o venedor real.
Amb el criteri d'execució el mètode fa una mitjana del 91,9 % i Chameleon, la millor referència anterior, es queda en el 17,4 %. Aquest segon número no el van publicar els seus autors: surt quan aquests investigadors tornen a mesurar els tres mètodes previs exigint-los que el navegador executi l'acció. I el salt té un responsable: de les tres peces del mètode —abstracció de rol i ranura, recomposició de la pàgina i anàlisi de flux de dades sobre el codi de l'agent—, la tercera localitza quines parts de la resposta decideixen de debò l'ordre, retalla un 87,4 % de mitjana el que cal optimitzar i apuja la mitjana del 70,4 % al 91,9 %. També és la que exigeix tenir el codi al davant.
En el subconjunt de SeeAct amb cinc models i 1.710 tasques, l'èxit baixa del 90,0 % en el pas atacat al 86,9 % de principi a fi: 3,1 punts menys. No és una comparació amb el 91,9 % global. Dels 265 intents en què l'agent va picar però la tasca no es va completar, només el 9,4 % va ser perquè es despistés després; la resta van ser autenticacions, finestres emergents i errors de càrrega.
Les defenses, o el remei que mata el pacient
| Defensa | Encert en tasca neta | Èxit de l'atac |
|---|---|---|
| Sense contramesura | 100,0 % | 91,9 % |
| Compressió JPEG (qualitat 75) | 89,3 % | 75,2 % |
| Desenfocament gaussià (radi 1,0) | 100,0 % | 82,5 % |
| Soroll uniforme (8/255) | 90,2 % | 81,4 % |
| Soroll uniforme (16/255) | 58,5 % | 45,7 % |
| WebSentinel | 98,6 % | 86,5 % |
| Consistency Check | 92,5 % | 90,5 % |
| WebGuard | 100,0 % | 91,9 % |
Els autors van passar l'atac per set contramesures —quatre de neteja d'imatge i tres pensades per a agents web— i el resultat és encara més incòmode que aquest 91,9 %. De les tres d'agent, WebGuard el deixa exactament on era i Consistency Check li treu poc més d'un punt: vigilen text injectat, descripcions d'imatge incoherents o accions de risc, i WebMirage no genera cap d'aquests senyals. No escriu res: desvia la mirada en el moment de triar.
La neteja d'imatge sí que mossega, però cobra peatge: el soroll fort deixa l'atac en el 45,7 % a canvi que l'agent només completi el 58,5 % de les tasques sense atac, i la que més l'abaixa sense enfonsar-lo, la compressió JPEG, encara el deixa en el 75,2 %.
La defensa adaptativa que els autors van dissenyar expressament tanca l'argument, i les seves dues xifres van juntes o no signifiquen res: en 630 tasques de botiga amb SeeAct i cinc models, aleatoritzar els identificadors dels elements enfonsa l'atac del 93,8 % —la mitjana d'aquest subconjunt, no el 91,9 % general— a l'11,7 %, però deixa l'agent encertant el 15,9 % de les tasques netes, quan abans les encertava totes. Funciona perquè trenca l'agent.
On se li trenca l'atac
| Condició | Èxit de l'atac |
|---|---|
| L'objectiu ocupa el 2 % de la captura | 62,8 % |
| L'objectiu ocupa el 5 % | 85,3 % |
| L'objectiu ocupa el 10 % | 97,4 % |
| Pertorbació a 8/255 | 73,2 % |
| Pertorbació a 16/255 (la de referència) | 93,8 % |
| Pertorbació a 32/255 | 98,9 % |
| Una altra versió de la mateixa família de models | 81,2-93,5 % |
| Una altra arquitectura de model | 4,5-23,8 % |
El mètode té condicions, i estan mesurades. La imatge trucada necessita ocupar espai a la pantalla, perquè els píxels que la fan funcionar es perden en reduir-la, i el pressupost per defecte de 16/255 està posat just on la corba deixa de pujar.
La condició que més en limita l'ús és una altra: en les proves, una imatge optimitzada contra un model es transfereix molt millor a versions de la mateixa família que a arquitectures diferents. Els autors ho deixen escrit: la transferència entre famílies «desplaça la confiança del model, però no proporciona un control fiable en l'execució».
Per escenari, el pitjor terreny és el servei domèstic, entre el 69,0 % i el 80,1 %: les miniatures són més petites i les peticions demanen aparellar atributs més que no pas reconèixer una foto. Queda, a més, un abast declarat: els agents que actuen per coordenades de pantalla decideixen amb una altra interfície i, escriuen, «queden fora del nostre abast».
Conclusió
El que queda no és un número, és un lloc on mirar. En les proves d'aquest treball, les defenses avaluades no combinen una supressió forta de l'atac amb un bon rendiment en les tasques netes. Els autors ho resumeixen així: «les avaluacions centrades en el model poden subestimar els atacs que persisteixen a través de l'execució al navegador». El 7 d'octubre de 2026, el mateix dia que Microsoft i Nvidia dedicaven un acte als agents d'IA a Windows, cinc investigadors registraven com desviar-ne un de laboratori amb una sola imatge. I aquest 91,9 % és la cota d'un atacant amb el codi i els pesos al davant, sobre agents i models oberts, en un preprint disponible a arXiv.
Fonts primàries
- arXiv — Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution, Han et al., Universitat de Utah (7 d'octubre de 2026) ↗
- AI Informator — Wikimedia enxampa els agents d'OpenAI als seus wikis ↗
- AI Informator — Transluce: els agents d'OpenAI van sondejar webs públiques des del març ↗
- AI Informator — Sis de vuit agents trien el model per tu ↗
- AI Informator — Nvidia i Microsoft baixen el superordinador a la teva taula ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentaris