Modelos

DeepSeek V4.1 Flash queda segundo en OpenDesign Arena por el 1,4 % del coste de Astra

La clasificación de OpenDesign Arena, que mide cómo diseñan interfaces los modelos de lenguaje, se comunicó en torno al 9 y el 11 de septiembre de 2026. GPT-6 Astra encabeza la tabla con 82,7 puntos sobre 100 y DeepSeek V4.1 Flash queda detrás, con 81,2. La diferencia es de punto y medio; la de precio, de 1,61 dólares por diseño frente a 0,023.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

Tabla de resultados de OpenDesign Arena con la puntuación y el coste por diseño de cada modelo.
📷 OpenDesign Arena (Powerformer, Inc.) · fuente

En resumen

  • En la tabla de OpenDesign Arena, difundida en torno al 9 y el 11 de septiembre de 2026, GPT-6 Astra es primero con 82,7 puntos sobre 100 y DeepSeek V4.1 Flash es segundo con 81,2.
  • DeepSeek V4.1 Flash no adelanta a Astra: se queda a punto y medio, el 98,2 % de su puntuación, y lo hace con el 1,4 % de su coste por diseño (0,023 $ frente a 1,61 $).
  • También tarda menos de la mitad: 5,3 minutos por diseño terminado frente a los 11,1 minutos del primero.
  • De los trece modelos medidos, once puntúan menos y además cuestan más que DeepSeek V4.1 Flash; solo tres superan el umbral de 80 puntos que OpenDesign fija como «entregable».
  • La puntúan diseñadores humanos, pero la metodología es propietaria de OpenDesign y no está revisada por pares: no es una evaluación independiente.

El segundo puesto, no el primero

OpenDesign Arena: los trece modelos clasificados
# Modelo Puntos sobre 100 Coste por diseño Tiempo por diseño
1 GPT-6 Astra 82,7 1,61 $ 11,1 min
2 DeepSeek V4.1 Flash 81,2 0,023 $ 5,3 min
3 Claude Fable 5.1 80,3 3,66 $ 12,8 min
4 GPT-5.6 Sol 77,6 0,544 $ 3,2 min
5 Hunyuan H4 Preview 74,6 0,418 $ 29,2 min
6 DeepSeek V4 Pro 72,9 0,061 $ 17,7 min
7 Grok 4.6 72,4 0,599 $ 11,4 min
8 Qwen 3.8-Max 72,0 0,595 $ 26,4 min
9 DeepSeek V4 Flash 70,6 0,031 $ 11,1 min
10 GLM-5.3 Flash 69,8 0,064 $ 23,5 min
11 Gemini 3.8 Flash 68,9 0,210 $ 3,8 min
12 Muse Spark 1.3 66,6 0,267 $ 3,3 min
13 Kimi K3 65,7 0,614 $ 14,0 min
Tabla publicada y actualizada por OpenDesign, operador de la arena. No hay evaluación independiente que contraste estas cifras.

Los resultados de OpenDesign Arena se comunicaron públicamente en torno al 9 y el 11 de septiembre de 2026. En cabeza está GPT-6 Astra, con 82,7 puntos sobre 100. El segundo puesto es de DeepSeek V4.1 Flash, con 81,2. El tercero, de Claude Fable 5.1, con 80,3.

Conviene decirlo con claridad, porque estos días ha circulado lo contrario: DeepSeek V4.1 Flash no adelanta a Astra. Queda por detrás, a punto y medio, que equivale al 98,2 % de la puntuación del primero. Tampoco procede de una medición de Artificial Analysis, como se ha llegado a afirmar, sino de la tabla del propio operador de la arena.

Esa tabla no es una foto fija con fecha de publicación única: el operador la mantiene viva y la actualiza conforme añade modelos. Estos son los trece medidos.

Leer más: OpenDesign — LLM Arena for Design ↗

Cada diseño se puntúa sobre 100 y lo hacen diseñadores humanos

Cada diseño se puntúa sobre 100: treinta puntos miden el cumplimiento del requisito —si el resultado hace lo que se pedía— y setenta, la calidad del diseño en sí. OpenDesign sitúa en 80 puntos el umbral a partir del cual considera que una pieza es «entregable», es decir, utilizable sin rehacerla.

Los encargos se reparten en cinco escenarios: aplicaciones web, aplicaciones móviles, aplicaciones de escritorio, cuadros de mando y páginas de aterrizaje.

La nota no la pone un programa, sino diseñadores humanos, con los criterios de su oficio: legibilidad de la maqueta, jerarquía de la información, adecuación del estilo al encargo, contraste de color y pertinencia de la imagen. Eso capta lo que ninguna prueba automática mide bien, y a cambio introduce el juicio de quien puntúa.

La metodología, además, es propietaria y no está revisada por pares: no hay protocolo publicado que otro equipo pueda reproducir para comprobar si sale lo mismo.

El precio es lo que cambia el cuadro

Puntuación frente a coste por diseño terminado
65 70 75 80 0,03 $ 0,1 $ 0,3 $ 1 $ 3 $ umbral de «entregable» (80) Coste por diseño · escala logarítmica Puntuación sobre 100 GPT-6 Astra — Coste por diseño: 1,61 $ · Puntuación sobre 100: 82,7 pts GPT-6 Astra DeepSeek V4.1 Flash — Coste por diseño: 0,023 $ · Puntuación sobre 100: 81,2 pts DeepSeek V4.1 Flash Claude Fable 5.1 — Coste por diseño: 3,66 $ · Puntuación sobre 100: 80,3 pts Claude Fable 5.1 GPT-5.6 Sol — Coste por diseño: 0,544 $ · Puntuación sobre 100: 77,6 pts GPT-5.6 Sol Hunyuan H4 Preview — Coste por diseño: 0,418 $ · Puntuación sobre 100: 74,6 pts DeepSeek V4 Pro — Coste por diseño: 0,061 $ · Puntuación sobre 100: 72,9 pts Grok 4.6 — Coste por diseño: 0,599 $ · Puntuación sobre 100: 72,4 pts Qwen 3.8-Max — Coste por diseño: 0,595 $ · Puntuación sobre 100: 72 pts DeepSeek V4 Flash — Coste por diseño: 0,031 $ · Puntuación sobre 100: 70,6 pts GLM-5.3 Flash — Coste por diseño: 0,064 $ · Puntuación sobre 100: 69,8 pts Gemini 3.8 Flash — Coste por diseño: 0,21 $ · Puntuación sobre 100: 68,9 pts Muse Spark 1.3 — Coste por diseño: 0,267 $ · Puntuación sobre 100: 66,6 pts Kimi K3 — Coste por diseño: 0,614 $ · Puntuación sobre 100: 65,7 pts Kimi K3
Ver los datos en tabla
Coste por diseño Puntuación sobre 100
GPT-6 Astra 1,61 $ 82,7 pts
DeepSeek V4.1 Flash 0,023 $ 81,2 pts
Claude Fable 5.1 3,66 $ 80,3 pts
GPT-5.6 Sol 0,544 $ 77,6 pts
Hunyuan H4 Preview 0,418 $ 74,6 pts
DeepSeek V4 Pro 0,061 $ 72,9 pts
Grok 4.6 0,599 $ 72,4 pts
Qwen 3.8-Max 0,595 $ 72 pts
DeepSeek V4 Flash 0,031 $ 70,6 pts
GLM-5.3 Flash 0,064 $ 69,8 pts
Gemini 3.8 Flash 0,21 $ 68,9 pts
Muse Spark 1.3 0,267 $ 66,6 pts
Kimi K3 0,614 $ 65,7 pts
La escala del coste es logarítmica: los precios van de 0,023 $ a 3,66 $, más de dos órdenes de magnitud, y en escala lineal los once modelos baratos quedarían amontonados contra el eje. Datos de la tabla del propio OpenDesign.

DeepSeek V4.1 Flash cuesta 0,023 dólares por diseño terminado. Astra, 1,61. Es el 1,4 % del precio del primero por el 98,2 % de su puntuación. Y además va más rápido: 5,3 minutos por diseño frente a los 11,1 del líder, menos de la mitad.

Sobre el conjunto, la posición es más llamativa que el puesto: de los trece modelos medidos, once —los que van del tercero al decimotercero— puntúan menos y a la vez cuestan más. Solo Astra puntúa por encima, y a un precio setenta veces mayor.

El umbral de 80 puntos lo pasan tres modelos: Astra a 1,61 $, DeepSeek V4.1 Flash a 0,023 $ y Claude Fable 5.1 a 3,66 $, que es el más caro de toda la tabla y queda tercero. En el otro extremo, el más veloz es GPT-5.6 Sol, con 3,2 minutos, pero se queda en 77,6 puntos, por debajo del listón.

La arquitectura explica el precio: enciende una fracción del modelo en cada token

DeepSeek V4.1 Flash es un Mixture-of-Experts de 552.000 millones de parámetros que no los usa todos a la vez. Al leer el enunciado activa 8.000 millones por token; al generar la respuesta, 16.000 millones.

Ahí está la explicación del precio. El coste de responder no depende del tamaño total, sino de cuántos parámetros entran en juego en cada token, y aquí es un 2,9 % del total al generar. Es una decisión de arquitectura: grande en conocimiento, pequeño en factura.

La ficha del modelo se publicó el 10 de septiembre de 2026 en Hugging Face. Lo que añade la clasificación de OpenDesign es cómo rinde frente a otros doce en un encargo concreto: producir una interfaz que un diseñador acepte.

Leer más: Hugging Face — DeepSeek-V4.1-Flash ↗

Conclusión

La noticia no es un adelantamiento, porque no lo hay: en la tabla de OpenDesign Arena el primero sigue siendo GPT-6 Astra. Lo que se mueve es el precio de entrar en el rango que la propia arena considera entregable, que hasta ahora costaba entre 1,61 y 3,66 dólares por diseño y ahora tiene una opción a 0,023, en la mitad de tiempo. Si la cifra aguanta fuera de una prueba de casa —propietaria, sin revisión por pares y corregida por quien la organiza—, el argumento para pagar un modelo caro en maquetación se reduce a ese punto y medio.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog