Modelos
DeepSeek V4.1 Flash queda segundo en OpenDesign Arena por el 1,4 % del coste de Astra
La clasificación de OpenDesign Arena, que mide cómo diseñan interfaces los modelos de lenguaje, se comunicó en torno al 9 y el 11 de septiembre de 2026. GPT-6 Astra encabeza la tabla con 82,7 puntos sobre 100 y DeepSeek V4.1 Flash queda detrás, con 81,2. La diferencia es de punto y medio; la de precio, de 1,61 dólares por diseño frente a 0,023.
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
En resumen
- En la tabla de OpenDesign Arena, difundida en torno al 9 y el 11 de septiembre de 2026, GPT-6 Astra es primero con 82,7 puntos sobre 100 y DeepSeek V4.1 Flash es segundo con 81,2.
- DeepSeek V4.1 Flash no adelanta a Astra: se queda a punto y medio, el 98,2 % de su puntuación, y lo hace con el 1,4 % de su coste por diseño (0,023 $ frente a 1,61 $).
- También tarda menos de la mitad: 5,3 minutos por diseño terminado frente a los 11,1 minutos del primero.
- De los trece modelos medidos, once puntúan menos y además cuestan más que DeepSeek V4.1 Flash; solo tres superan el umbral de 80 puntos que OpenDesign fija como «entregable».
- La puntúan diseñadores humanos, pero la metodología es propietaria de OpenDesign y no está revisada por pares: no es una evaluación independiente.
El segundo puesto, no el primero
| # | Modelo | Puntos sobre 100 | Coste por diseño | Tiempo por diseño |
|---|---|---|---|---|
| 1 | GPT-6 Astra | 82,7 | 1,61 $ | 11,1 min |
| 2 | DeepSeek V4.1 Flash | 81,2 | 0,023 $ | 5,3 min |
| 3 | Claude Fable 5.1 | 80,3 | 3,66 $ | 12,8 min |
| 4 | GPT-5.6 Sol | 77,6 | 0,544 $ | 3,2 min |
| 5 | Hunyuan H4 Preview | 74,6 | 0,418 $ | 29,2 min |
| 6 | DeepSeek V4 Pro | 72,9 | 0,061 $ | 17,7 min |
| 7 | Grok 4.6 | 72,4 | 0,599 $ | 11,4 min |
| 8 | Qwen 3.8-Max | 72,0 | 0,595 $ | 26,4 min |
| 9 | DeepSeek V4 Flash | 70,6 | 0,031 $ | 11,1 min |
| 10 | GLM-5.3 Flash | 69,8 | 0,064 $ | 23,5 min |
| 11 | Gemini 3.8 Flash | 68,9 | 0,210 $ | 3,8 min |
| 12 | Muse Spark 1.3 | 66,6 | 0,267 $ | 3,3 min |
| 13 | Kimi K3 | 65,7 | 0,614 $ | 14,0 min |
Los resultados de OpenDesign Arena se comunicaron públicamente en torno al 9 y el 11 de septiembre de 2026. En cabeza está GPT-6 Astra, con 82,7 puntos sobre 100. El segundo puesto es de DeepSeek V4.1 Flash, con 81,2. El tercero, de Claude Fable 5.1, con 80,3.
Conviene decirlo con claridad, porque estos días ha circulado lo contrario: DeepSeek V4.1 Flash no adelanta a Astra. Queda por detrás, a punto y medio, que equivale al 98,2 % de la puntuación del primero. Tampoco procede de una medición de Artificial Analysis, como se ha llegado a afirmar, sino de la tabla del propio operador de la arena.
Esa tabla no es una foto fija con fecha de publicación única: el operador la mantiene viva y la actualiza conforme añade modelos. Estos son los trece medidos.
Cada diseño se puntúa sobre 100 y lo hacen diseñadores humanos
Cada diseño se puntúa sobre 100: treinta puntos miden el cumplimiento del requisito —si el resultado hace lo que se pedía— y setenta, la calidad del diseño en sí. OpenDesign sitúa en 80 puntos el umbral a partir del cual considera que una pieza es «entregable», es decir, utilizable sin rehacerla.
Los encargos se reparten en cinco escenarios: aplicaciones web, aplicaciones móviles, aplicaciones de escritorio, cuadros de mando y páginas de aterrizaje.
La nota no la pone un programa, sino diseñadores humanos, con los criterios de su oficio: legibilidad de la maqueta, jerarquía de la información, adecuación del estilo al encargo, contraste de color y pertinencia de la imagen. Eso capta lo que ninguna prueba automática mide bien, y a cambio introduce el juicio de quien puntúa.
La metodología, además, es propietaria y no está revisada por pares: no hay protocolo publicado que otro equipo pueda reproducir para comprobar si sale lo mismo.
El precio es lo que cambia el cuadro
Ver los datos en tabla
| Coste por diseño | Puntuación sobre 100 | |
|---|---|---|
| GPT-6 Astra | 1,61 $ | 82,7 pts |
| DeepSeek V4.1 Flash | 0,023 $ | 81,2 pts |
| Claude Fable 5.1 | 3,66 $ | 80,3 pts |
| GPT-5.6 Sol | 0,544 $ | 77,6 pts |
| Hunyuan H4 Preview | 0,418 $ | 74,6 pts |
| DeepSeek V4 Pro | 0,061 $ | 72,9 pts |
| Grok 4.6 | 0,599 $ | 72,4 pts |
| Qwen 3.8-Max | 0,595 $ | 72 pts |
| DeepSeek V4 Flash | 0,031 $ | 70,6 pts |
| GLM-5.3 Flash | 0,064 $ | 69,8 pts |
| Gemini 3.8 Flash | 0,21 $ | 68,9 pts |
| Muse Spark 1.3 | 0,267 $ | 66,6 pts |
| Kimi K3 | 0,614 $ | 65,7 pts |
DeepSeek V4.1 Flash cuesta 0,023 dólares por diseño terminado. Astra, 1,61. Es el 1,4 % del precio del primero por el 98,2 % de su puntuación. Y además va más rápido: 5,3 minutos por diseño frente a los 11,1 del líder, menos de la mitad.
Sobre el conjunto, la posición es más llamativa que el puesto: de los trece modelos medidos, once —los que van del tercero al decimotercero— puntúan menos y a la vez cuestan más. Solo Astra puntúa por encima, y a un precio setenta veces mayor.
El umbral de 80 puntos lo pasan tres modelos: Astra a 1,61 $, DeepSeek V4.1 Flash a 0,023 $ y Claude Fable 5.1 a 3,66 $, que es el más caro de toda la tabla y queda tercero. En el otro extremo, el más veloz es GPT-5.6 Sol, con 3,2 minutos, pero se queda en 77,6 puntos, por debajo del listón.
La arquitectura explica el precio: enciende una fracción del modelo en cada token
DeepSeek V4.1 Flash es un Mixture-of-Experts de 552.000 millones de parámetros que no los usa todos a la vez. Al leer el enunciado activa 8.000 millones por token; al generar la respuesta, 16.000 millones.
Ahí está la explicación del precio. El coste de responder no depende del tamaño total, sino de cuántos parámetros entran en juego en cada token, y aquí es un 2,9 % del total al generar. Es una decisión de arquitectura: grande en conocimiento, pequeño en factura.
La ficha del modelo se publicó el 10 de septiembre de 2026 en Hugging Face. Lo que añade la clasificación de OpenDesign es cómo rinde frente a otros doce en un encargo concreto: producir una interfaz que un diseñador acepte.
Conclusión
La noticia no es un adelantamiento, porque no lo hay: en la tabla de OpenDesign Arena el primero sigue siendo GPT-6 Astra. Lo que se mueve es el precio de entrar en el rango que la propia arena considera entregable, que hasta ahora costaba entre 1,61 y 3,66 dólares por diseño y ahora tiene una opción a 0,023, en la mitad de tiempo. Si la cifra aguanta fuera de una prueba de casa —propietaria, sin revisión por pares y corregida por quien la organiza—, el argumento para pagar un modelo caro en maquetación se reduce a ese punto y medio.
Fuentes primarias
Recibe el resumen diario de IA
Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.
Al suscribirte aceptas recibir el newsletter de AI Informator. Puedes darte de baja cuando quieras.
Comentarios