Seguridad de la IA

WebMirage: una foto retocada y el agente web pulsa donde no debe

Cinco investigadores de la Universidad de Utah —universidad pública estadounidense— registraron el 7 de octubre de 2026 un preprint con un método llamado WebMirage: una imagen adversaria en una página basta para que un agente web pulse el elemento que quiere el atacante, y la cuenta se lleva sobre el clic que ejecuta el navegador. El 91,9 % de media sale en el laboratorio, con el código del agente y los pesos del modelo delante. No se evalúan agentes comerciales como objetivos y no se atacó ninguna página real.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Viñeta: dos investigadores observan una gran placa metálica junto a la imagen de un ratón y dos recorridos que conducen a botones rojo y verde.
📷 Imagen generada con IA

En resumen

  • WebMirage es el nombre del método, no del artículo, que se registró en arXiv el 7 de octubre de 2026 y es un preprint disponible en arXiv.
  • La aportación no es la imagen trucada, que ya existía, sino la vara de medir: cuenta el clic que ejecuta el navegador, no lo que escribe el modelo.
  • Llega al 91,9 % de media frente al 17,4 % de la mejor referencia anterior, cifra que estos mismos autores obtuvieron al remedirla. Todo con acceso de caja blanca a agentes de investigación y modelos de pesos abiertos: sin evaluar agentes comerciales ni subir contenido adversario a webs en producción.
  • Entre siete contramedidas, WebGuard no cambia el resultado. Una defensa adaptativa adicional logra la mayor reducción, hasta el 11,7 %, pero deja el acierto en tareas limpias en el 15,9 % dentro de su prueba.

Una foto que solo le miente a la máquina

Wanjing Han, Levi Taiji Li, Mu Zhang, Yue Jiang y Guanhong Tao, de la Universidad de Utah, registraron el 7 de octubre de 2026 el artículo «Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution», en la sección de criptografía y seguridad de arXiv. La ficha consultada lo presenta como un preprint y no indica aceptación en un congreso o una revista. El código está publicado.

El ataque es una perturbación acotada —16/255 en norma infinito por defecto— sobre una única imagen de la página: la que el atacante controla porque la ha subido él, la miniatura de un producto o una foto de perfil. No es un parche visible y no hace falta controlar la web: el modelo de amenaza prohíbe tocar el código de la página, inyectar instrucciones de texto o alterar el programa del agente. Basta con subir contenido como un tercero cualquiera.

El blanco es el instante en que el agente decide sobre qué elemento actuar. Los candidatos llevan etiquetas; si al del atacante le toca la 3, el ataque triunfa cuando el modelo ordena pulsar la 3 y el navegador ejecuta el clic sobre lo que esa etiqueta apunta, su ficha de producto o su botón de compra. Ahí está la aportación: antes se puntuaba lo que el modelo escribía; aquí, la acción que el navegador ejecuta.

El salto, y lo que hace falta para darlo

Éxito del ataque medido en la acción que ejecuta el navegador
  • WebMirage
  • Chameleon
  • VWA-Adv
  • EIA
WebMirage · SeeAct: 90% Chameleon · SeeAct: 16,7% VWA-Adv · SeeAct: 14,5% EIA · SeeAct: 6,2% SeeAct WebMirage · WebVoyager: 85,4% Chameleon · WebVoyager: 17,9% VWA-Adv · WebVoyager: 15,6% EIA · WebVoyager: 5% WebVoyager WebMirage · VisualWebArena (árbol de accesibilidad): 96,2% Chameleon · VisualWebArena (árbol de accesibilidad): 18,4% VWA-Adv · VisualWebArena (árbol de accesibilidad): 8,9% EIA · VisualWebArena (árbol de accesibilidad): 9,6% VisualWebArena (árbol de accesibilidad) WebMirage · VisualWebArena (Set-of-Mark): 95,8% Chameleon · VisualWebArena (Set-of-Mark): 16,6% VWA-Adv · VisualWebArena (Set-of-Mark): 9,3% EIA · VisualWebArena (Set-of-Mark): 4,8% VisualWebArena (Set-of-Mark)
Ver los datos en tabla
SeeActWebVoyagerVisualWebArena (árbol de accesibilidad)VisualWebArena (Set-of-Mark)
WebMirage 90%85,4%96,2%95,8%
Chameleon 16,7%17,9%18,4%16,6%
VWA-Adv 14,5%15,6%8,9%9,3%
EIA 6,2%5%9,6%4,8%
La métrica es el porcentaje de puntos de decisión en los que el navegador acaba ejecutando la acción que quiere el atacante, no el porcentaje de veces que el modelo escribe la respuesta pretendida. Las cifras de Chameleon, VWA-Adv y EIA son la reevaluación que hacen estos autores de esos tres métodos con ese mismo criterio, no las que publicaron sus creadores. La imagen se sintetiza con acceso de caja blanca al código del agente y a los pesos de modelos de pesos abiertos. Las dos columnas más altas, 96,2 % y 95,8 %, son del entorno de pruebas VisualWebArena y no de webs reales. Preprint disponible en arXiv.

El experimento son 2.250 tareas: 1.710 sobre trece webs públicas y 540 en un entorno de pruebas. Los agentes son cuatro configuraciones: SeeAct y WebVoyager, dos agentes de investigación de código abierto, y las dos variantes de VisualWebArena, un entorno de pruebas académico. Debajo, seis modelos de visión y lenguaje de pesos abiertos: LLaVA-v1.5-13B, LLaVA-v1.6-34B, MiniCPM-o-8B, Phi-3-Vision-4B, Qwen2-VL-7B y CogVLM. Son los modelos atacados en estas pruebas.

Las trece webs son tiendas, alojamiento, clases particulares y servicio doméstico —entre ellas Amazon, Walmart y Airbnb—, pero ninguna fue atacada: los autores escriben que «nunca subimos contenido adversario a servicios en producción» y lo que hacían era sustituir en local, en su propio navegador, una imagen que ya estaba en la página; nada llegó a las plataformas ni lo vio ningún usuario o vendedor real.

Con el criterio de ejecución el método promedia 91,9 % y Chameleon, la mejor referencia anterior, se queda en 17,4 %. Ese segundo número no lo publicaron sus autores: sale cuando estos investigadores remiden los tres métodos previos exigiéndoles que el navegador ejecute la acción. Y el salto tiene un responsable: de las tres piezas del método —abstracción de rol y ranura, recomposición de la página y análisis de flujo de datos sobre el código del agente—, la tercera localiza qué partes de la respuesta deciden de verdad el comando, recorta un 87,4 % de media lo que hay que optimizar y sube la media del 70,4 % al 91,9 %. También es la que exige tener el código delante.

En el subconjunto de SeeAct con cinco modelos y 1.710 tareas, el éxito baja del 90,0 % en el paso atacado al 86,9 % de principio a fin: 3,1 puntos menos. No es una comparación con el 91,9 % global. De los 265 intentos en que el agente picó pero la tarea no se completó, solo el 9,4 % fue porque se despistara después; el resto fueron autenticaciones, ventanas emergentes y fallos de carga.

Las defensas, o la cura que mata al paciente

Las siete contramedidas probadas, con el ataque sin defensa como referencia
Defensa Acierto en tarea limpia Éxito del ataque
Sin contramedida 100,0 % 91,9 %
Compresión JPEG (calidad 75) 89,3 % 75,2 %
Desenfoque gaussiano (radio 1,0) 100,0 % 82,5 %
Ruido uniforme (8/255) 90,2 % 81,4 %
Ruido uniforme (16/255) 58,5 % 45,7 %
WebSentinel 98,6 % 86,5 %
Consistency Check 92,5 % 90,5 %
WebGuard 100,0 % 91,9 %
La muestra solo incluye tareas que el agente completaba correctamente sin ataque y en las que elegía un candidato distinto del objetivo; de ahí el 100 % inicial, que no representa su rendimiento general. Son las contramedidas que probaron los propios autores, con el ataque fijado en el presupuesto de referencia de 16/255. La columna de éxito del ataque usa la misma métrica del gráfico —la acción que ejecuta el navegador— y se obtiene igualmente con acceso de caja blanca. Preprint disponible en arXiv.

Los autores pasaron el ataque por siete contramedidas —cuatro de limpieza de imagen y tres pensadas para agentes web— y el resultado es más incómodo todavía que ese 91,9 %. De las tres de agente, WebGuard lo deja exactamente donde estaba y Consistency Check le quita poco más de un punto: vigilan texto inyectado, descripciones de imagen incoherentes o acciones de riesgo, y WebMirage no genera ninguna de esas señales. No escribe nada: desvía la mirada en el momento de elegir.

La limpieza de imagen sí muerde, pero cobra peaje: el ruido fuerte deja el ataque en 45,7 % a cambio de que el agente solo complete el 58,5 % de las tareas sin ataque, y la que más lo baja sin hundirlo, la compresión JPEG, lo deja aún en 75,2 %.

La defensa adaptativa que los autores diseñaron a propósito cierra el argumento, y sus dos cifras van juntas o no significan nada: en 630 tareas de tienda con SeeAct y cinco modelos, aleatorizar los identificadores de los elementos hunde el ataque del 93,8 % —la media de ese subconjunto, no el 91,9 % general— al 11,7 %, pero deja al agente acertando el 15,9 % de las tareas limpias, cuando antes acertaba todas. Funciona porque rompe al agente.

Dónde se le rompe el ataque

Las condiciones que suben y bajan el éxito del ataque
Condición Éxito del ataque
El objetivo ocupa el 2 % de la captura 62,8 %
El objetivo ocupa el 5 % 85,3 %
El objetivo ocupa el 10 % 97,4 %
Perturbación a 8/255 73,2 %
Perturbación a 16/255 (la de referencia) 93,8 %
Perturbación a 32/255 98,9 %
Otra versión de la misma familia de modelos 81,2-93,5 %
Otra arquitectura de modelo 4,5-23,8 %
Mismo criterio de éxito que el gráfico y el mismo acceso de caja blanca. Las tres primeras filas salen de páginas construidas a propósito con cuatro candidatos del mismo tamaño; las tres del presupuesto, de las tareas de tienda, cuyo punto de partida con la perturbación de referencia es el 93,8 % de ese escenario y no el 91,9 % general; las dos últimas son el rango de las pruebas de transferencia a modelos que no se usaron para fabricar la imagen. Preprint disponible en arXiv.

El método tiene condiciones, y están medidas. La imagen trucada necesita ocupar sitio en la pantalla, porque los píxeles que la hacen funcionar se pierden al reducirla, y el presupuesto por defecto de 16/255 está puesto justo donde la curva deja de subir.

La condición que más limita su uso es otra: en las pruebas, una imagen optimizada contra un modelo se transfiere mucho mejor a versiones de su misma familia que a arquitecturas distintas. Los autores lo dejan escrito: la transferencia entre familias «desplaza la confianza del modelo, pero no proporciona un control fiable a nivel de ejecución».

Por escenario, el peor terreno es el servicio doméstico, entre el 69,0 % y el 80,1 %: las miniaturas son más pequeñas y las peticiones piden emparejar atributos más que reconocer una foto. Queda además un alcance declarado: los agentes que actúan por coordenadas de pantalla deciden con otra interfaz y, escriben, «quedan fuera de nuestro alcance».

Conclusión

Lo que queda no es un número, es un sitio donde mirar. En las pruebas de este trabajo, las defensas evaluadas no combinan una supresión fuerte del ataque con un buen rendimiento en las tareas limpias. Los autores lo resumen así: «las evaluaciones a nivel de modelo pueden subestimar los ataques que persisten a través de la ejecución en el navegador». El 7 de octubre de 2026, el mismo día en que Microsoft y Nvidia dedicaban un acto a los agentes de IA en Windows, cinco investigadores registraban cómo desviar a uno de laboratorio con una sola imagen. Y ese 91,9 % es la cota de un atacante con el código y los pesos delante, sobre agentes y modelos abiertos, en un preprint disponible en arXiv.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog