Models

DeepSeek V4.1 Flash és segon a OpenDesign Arena i costa 70 vegades menys que Astra

La taula d'OpenDesign Arena, que mesura com dissenyen interfícies els models de llenguatge, es va difondre al voltant del 9 i l'11 de setembre del 2026. GPT-6 Astra mana amb 82,7 punts sobre 100 i DeepSeek V4.1 Flash el segueix amb 81,2: punt i mig de diferència en qualitat i, en preu, 1,61 dòlars per disseny contra 0,023.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Tabla de resultados de OpenDesign Arena con la puntuación y el coste por diseño de cada modelo.
📷 OpenDesign Arena (Powerformer, Inc.) · fuente

En resum

  • A la taula d'OpenDesign Arena, difosa al voltant del 9 i l'11 de setembre del 2026, GPT-6 Astra és primer amb 82,7 punts sobre 100 i DeepSeek V4.1 Flash, segon amb 81,2.
  • DeepSeek V4.1 Flash no avança Astra: es queda a punt i mig, el 98,2 % de la seva puntuació, i ho fa amb l'1,4 % del seu cost per disseny (0,023 $ contra 1,61 $).
  • També hi dedica menys de la meitat del temps: 5,3 minuts per disseny acabat, davant dels 11,1 minuts del primer.
  • Dels tretze models mesurats, onze puntuen menys i, a sobre, costen més que DeepSeek V4.1 Flash; només tres superen el llindar de 80 punts que OpenDesign fixa com a «lliurable».
  • Qui puntua són dissenyadors humans, però la metodologia és propietat d'OpenDesign i no té revisió per parells: no és una avaluació independent.

El segon lloc, no el primer

OpenDesign Arena: els tretze models classificats
# Model Punts sobre 100 Cost per disseny Temps per disseny
1 GPT-6 Astra 82,7 1,61 $ 11,1 min
2 DeepSeek V4.1 Flash 81,2 0,023 $ 5,3 min
3 Claude Fable 5.1 80,3 3,66 $ 12,8 min
4 GPT-5.6 Sol 77,6 0,544 $ 3,2 min
5 Hunyuan H4 Preview 74,6 0,418 $ 29,2 min
6 DeepSeek V4 Pro 72,9 0,061 $ 17,7 min
7 Grok 4.6 72,4 0,599 $ 11,4 min
8 Qwen 3.8-Max 72,0 0,595 $ 26,4 min
9 DeepSeek V4 Flash 70,6 0,031 $ 11,1 min
10 GLM-5.3 Flash 69,8 0,064 $ 23,5 min
11 Gemini 3.8 Flash 68,9 0,210 $ 3,8 min
12 Muse Spark 1.3 66,6 0,267 $ 3,3 min
13 Kimi K3 65,7 0,614 $ 14,0 min
Taula publicada i actualitzada per OpenDesign, operador de l'arena. No hi ha cap avaluació independent que contrasti aquestes xifres.

Els resultats d'OpenDesign Arena es van fer públics al voltant del 9 i l'11 de setembre del 2026. Al capdavant hi ha GPT-6 Astra, amb 82,7 punts sobre 100. El segon lloc és per a DeepSeek V4.1 Flash, amb 81,2. El tercer, per a Claude Fable 5.1, amb 80,3.

Val la pena dir-ho clar, perquè aquests dies ha circulat el contrari: DeepSeek V4.1 Flash no avança Astra. Queda al darrere, a punt i mig, que equival al 98,2 % de la puntuació del primer. Tampoc no surt de cap mesurament d'Artificial Analysis, com s'ha arribat a afirmar, sinó de la taula del mateix operador de l'arena.

Aquesta taula no és una fotografia fixa amb una data de publicació única: l'operador la manté viva i l'actualitza a mesura que hi afegeix models. Aquests són els tretze mesurats.

Llegir-ne més: OpenDesign — LLM Arena for Design ↗

Cada disseny es puntua sobre 100 i ho fan dissenyadors humans

Cada disseny es puntua sobre 100: trenta punts mesuren el compliment del requisit —si el resultat fa el que es demanava— i setanta, la qualitat del disseny en si. OpenDesign situa en 80 punts el llindar a partir del qual considera que una peça és «lliurable», és a dir, que es pot fer servir sense refer-la.

Els encàrrecs es reparteixen en cinc escenaris: aplicacions web, aplicacions mòbils, aplicacions d'escriptori, quadres de comandament i pàgines d'aterratge.

La nota no la posa cap programa, sinó dissenyadors humans, amb els criteris del seu ofici: llegibilitat de la maqueta, jerarquia de la informació, adequació de l'estil a l'encàrrec, contrast de color i pertinència de la imatge. Això capta allò que cap prova automàtica no mesura bé, i a canvi hi entra el criteri de qui puntua.

La metodologia, a més, és propietària i no té revisió per parells: no hi ha cap protocol publicat que un altre equip pugui reproduir per comprovar si en surt el mateix.

El que canvia el panorama és el preu

Puntuació davant del cost per disseny acabat
65 70 75 80 0,03 $ 0,1 $ 0,3 $ 1 $ 3 $ llindar de «lliurable» (80) Cost per disseny · escala logarítmica Puntuació sobre 100 GPT-6 Astra — Cost per disseny: 1,61 $ · Puntuació sobre 100: 82,7 pts GPT-6 Astra DeepSeek V4.1 Flash — Cost per disseny: 0,023 $ · Puntuació sobre 100: 81,2 pts DeepSeek V4.1 Flash Claude Fable 5.1 — Cost per disseny: 3,66 $ · Puntuació sobre 100: 80,3 pts Claude Fable 5.1 GPT-5.6 Sol — Cost per disseny: 0,544 $ · Puntuació sobre 100: 77,6 pts GPT-5.6 Sol Hunyuan H4 Preview — Cost per disseny: 0,418 $ · Puntuació sobre 100: 74,6 pts DeepSeek V4 Pro — Cost per disseny: 0,061 $ · Puntuació sobre 100: 72,9 pts Grok 4.6 — Cost per disseny: 0,599 $ · Puntuació sobre 100: 72,4 pts Qwen 3.8-Max — Cost per disseny: 0,595 $ · Puntuació sobre 100: 72 pts DeepSeek V4 Flash — Cost per disseny: 0,031 $ · Puntuació sobre 100: 70,6 pts GLM-5.3 Flash — Cost per disseny: 0,064 $ · Puntuació sobre 100: 69,8 pts Gemini 3.8 Flash — Cost per disseny: 0,21 $ · Puntuació sobre 100: 68,9 pts Muse Spark 1.3 — Cost per disseny: 0,267 $ · Puntuació sobre 100: 66,6 pts Kimi K3 — Cost per disseny: 0,614 $ · Puntuació sobre 100: 65,7 pts Kimi K3
Ver los datos en tabla
Cost per disseny Puntuació sobre 100
GPT-6 Astra 1,61 $ 82,7 pts
DeepSeek V4.1 Flash 0,023 $ 81,2 pts
Claude Fable 5.1 3,66 $ 80,3 pts
GPT-5.6 Sol 0,544 $ 77,6 pts
Hunyuan H4 Preview 0,418 $ 74,6 pts
DeepSeek V4 Pro 0,061 $ 72,9 pts
Grok 4.6 0,599 $ 72,4 pts
Qwen 3.8-Max 0,595 $ 72 pts
DeepSeek V4 Flash 0,031 $ 70,6 pts
GLM-5.3 Flash 0,064 $ 69,8 pts
Gemini 3.8 Flash 0,21 $ 68,9 pts
Muse Spark 1.3 0,267 $ 66,6 pts
Kimi K3 0,614 $ 65,7 pts
L'escala del cost és logarítmica: els preus van de 0,023 $ a 3,66 $, més de dos ordres de magnitud, i en escala lineal els onze models barats quedarien amuntegats contra l'eix. Dades de la taula del mateix OpenDesign.

DeepSeek V4.1 Flash costa 0,023 dòlars per disseny acabat. Astra, 1,61. És l'1,4 % del preu del primer pel 98,2 % de la seva puntuació: setanta vegades més barat per gairebé el mateix resultat. I, a més, va més ràpid: 5,3 minuts per disseny davant dels 11,1 del líder, menys de la meitat.

Mirat sobre el conjunt, la posició és més cridanera que el lloc: dels tretze models mesurats, onze —els que van del tercer al tretzè— puntuen menys i alhora costen més. Només Astra puntua per damunt, i a un preu setanta vegades més alt.

El llindar de 80 punts el passen tres models: Astra a 1,61 $, DeepSeek V4.1 Flash a 0,023 $ i Claude Fable 5.1 a 3,66 $, que és el més car de tota la taula i queda tercer. A l'altre extrem, el més veloç és GPT-5.6 Sol, amb 3,2 minuts, però es queda en 77,6 punts, per sota del llistó.

L'arquitectura explica el preu: encén només una fracció del model a cada token

DeepSeek V4.1 Flash és un Mixture-of-Experts de 552.000 milions de paràmetres que no els fa servir tots alhora. Quan llegeix l'enunciat n'activa 8.000 milions per token; quan genera la resposta, 16.000 milions.

Aquí hi ha l'explicació del preu. El cost de respondre no depèn de la mida total, sinó de quants paràmetres entren en joc a cada token, i aquí és un 2,9 % del total en generar. És una decisió d'arquitectura: gran en coneixement, petit en factura.

La fitxa del model es va publicar el 10 de setembre del 2026 a Hugging Face. El que hi afegeix la classificació d'OpenDesign és com rendeix davant d'altres dotze en un encàrrec concret: fer una interfície que un dissenyador accepti.

Llegir-ne més: Hugging Face — DeepSeek-V4.1-Flash ↗

Conclusió

La notícia no és cap avançament, perquè no n'hi ha: a la taula d'OpenDesign Arena el primer continua sent GPT-6 Astra. El que es mou és el preu d'entrar a la franja que la mateixa arena considera lliurable, que fins ara costava entre 1,61 i 3,66 dòlars per disseny i ara té una opció a 0,023, i en la meitat de temps. Si la xifra aguanta fora d'una prova de collita pròpia —propietària, sense revisió per parells i corregida per qui l'organitza—, l'argument per pagar un model car per maquetar es redueix a aquest punt i mig.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog