Models

DeepSeek llança V4.1 Flash: 552B paràmetres i preus a la baixa

DeepSeek ha presentat aquest 10 de setembre el seu model V4.1 Flash, un MoE (mixture of experts, o barreja d'experts) de 552.000 milions de paràmetres amb una arquitectura Causal-Encoder-Decoder asimètrica que només n'activa 8B a l'entrada i 16B a la sortida. La companyia sosté que supera el V4 Pro en totes les mètriques clau i l'acompanya d'una tarifa que situa el milió de tokens de sortida en 0,60 dòlars en horari vall. Els pesos ja estan publicats a Hugging Face i l'API és operativa.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

En resum

  • V4.1 Flash és un MoE de 552B paràmetres amb arquitectura Causal-Encoder-Decoder asimètrica, activació de 8B a l'entrada i 16B a la sortida, i comprensió visual nativa.
  • DeepSeek publica 74,2 punts a DeepSWE i 90,6 a Terminal-Bench 2.1, tot i que reconeix que el V4 Pro continua per davant en GPQA i en el subconjunt de text de HLE.
  • La KV Cache es redueix a 1/437 respecte al model original, cosa que retalla el requisit d'HBM a una quarta part i el d'SSD a una vuitena.
  • L'API cobra 0,60 dòlars per milió de tokens de sortida en vall i 1,20 en hores punta, i la retirada del V4 Pro s'ajorna al 14 de setembre.

Què és exactament el V4.1 Flash

DeepSeek va llançar oficialment el 10 de setembre del 2026, hora de Pequín, el seu nou model DeepSeek V4.1 Flash. Es tracta d'un MoE (mixture of experts, o barreja d'experts), una arquitectura en què només una fracció dels paràmetres totals s'activa per processar cada consulta. El model suma 552.000 milions de paràmetres, però el seu disseny manté l'activació en nivells molt baixos: 8.000 milions de paràmetres a l'entrada i 16.000 milions a la sortida.

La novetat estructural és el que DeepSeek anomena una arquitectura Causal-Encoder-Decoder asimètrica, és a dir, un esquema en què les parts que processen el context d'entrada i les que generen el text de sortida no tenen la mateixa mida ni la mateixa càrrega computacional. Aquesta asimetria és la que permet mantenir un model de gran capacitat total amb un cost d'inferència contingut.

El V4.1 Flash és, a més, multimodal natiu, amb comprensió visual incorporada des del disseny i no afegida com una capa posterior. La companyia el presenta com el model més petit de la seva nova sèrie d'estructures de model, cosa que anticipa versions de mida més gran construïdes sobre els mateixos principis arquitectònics.

Darrere del salt hi ha també canvis en l'entrenament: DeepSeek descriu un nou mètode de preentrenament combinat amb aprenentatge per reforç (RL) aplicat a més escala que en generacions anteriors. Els pesos del model estan publicats a Hugging Face, de manera que el llançament no es limita a l'accés via API.

Els benchmarks: avenços clars i dues excepcions reconegudes

En el seu comunicat oficial, enviat per correu electrònic als usuaris de l'API entre el 9 i el 10 de setembre, DeepSeek afirma que el V4.1 Flash "supera integralment el V4 Pro en totes les mètriques clau: rendiment, cost, velocitat i temps total de tasca". És una declaració de la mateixa companyia sobre el seu propi model i convé llegir-la com a tal, a l'espera d'avaluacions independents.

Les xifres que acompanyen l'anunci procedeixen d'una comparativa sobre 19 benchmarks. Entre les publicades destaquen 74,2 punts a DeepSWE, una prova orientada a tasques d'enginyeria de programari, i 90,6 a Terminal-Bench 2.1, centrada en l'execució de tasques en línia d'ordres. Tots dos són terrenys directament relacionats amb l'ús del model com a agent de programació.

La mateixa DeepSeek matisa el balanç: el V4 Pro continua puntuant millor que el V4.1 Flash en GPQA, un conjunt de preguntes científiques de nivell de postgrau, i en el subconjunt de text de HLE (Humanity's Last Exam). És un reconeixement rellevant, perquè acota l'abast de l'afirmació de superioritat integral i situa l'avenç sobretot en el terreny agèntic i de cost, no en el raonament acadèmic més exigent.

La KV Cache com a palanca de cost

El canvi amb més conseqüències pràctiques és la reducció dla KV Cache, la memòria intermèdia on el model guarda les claus i els valors del context ja processat per no haver-lo de recalcular a cada nou token. Aquesta memòria cau és un dels principals consumidors de memòria d'alta velocitat durant la inferència i, per tant, un dels principals determinants del cost.

Segons DeepSeek, el V4.1 Flash redueix el requisit d'HBM (High Bandwidth Memory, la memòria d'alta amplada de banda que acompanya les GPU) a una quarta part respecte a la generació anterior, i el d'SSD a una vuitena part. Davant del model original de la família, la companyia xifra la reducció dla KV Cache en un factor de 437.

L'efecte es concentra en les tasques d'agents, aquelles en què el model encadena múltiples passos reutilitzant una vegada i una altra un context ampli. En aquests fluxos, el cache hit —la reutilització de context ja emmagatzemat— domina la factura final, de manera que abaratir la memòria cau abarateix desproporcionadament el tipus d'ús que més està creixent al mercat.

Preus, disponibilitat i transició des del V4 Pro

L'API ja està disponible amb el nom de model "deepseek-flash". Els anteriors V4 Flash i V4 Flash Vision Exp queden retirats, tot i que els seus àlies (deepseek-v4-flash i deepseek-v4-flash-vision-exp) redirigeixen temporalment al nou model per no trencar les integracions existents.

Les tarifes van entrar en vigor a les 04.00 UTC del 10 de setembre i segueixen un esquema de vall i pic, en què el preu vall equival a la meitat del preu pic. Per milió de tokens d'entrada amb cache hit es cobren 0,003 dòlars en vall i 0,006 en hores punta; amb cache miss, 0,15 i 0,30 dòlars respectivament. El milió de tokens de sortida costa 0,60 dòlars en vall i 1,20 en hores punta. Les hores punta són, en UTC, d'1.00 a 4.00 i de 6.00 a 10.00, de dilluns a divendres.

La retirada del V4 Pro, prevista inicialment abans, s'ha ajornat al 14 de setembre a les 12.00 hora de Pequín (04.00 UTC). A partir d'aquell moment i fins a la sortida del V4.1 Pro, les peticions dirigides a deepseek-v4-pro s'encaminaran cap al V4.1 Flash i es facturaran a preu Flash. Mentre el V4 Pro continuï en servei, el seu preu no canvia.

En el pla de les integracions, Tencent —a través de WorkBuddy i CodeBuddy— i OpenCode figuren com a socis oficials i ja han incorporat el V4.1 Flash als seus productes. Convé distingir els tres plans: l'anunci del model, la seva disponibilitat efectiva a l'API i a Hugging Face, i la integració en eines de tercers, que ara com ara es limita a aquests socis.

Una guerra de preus que s'accelera

El llançament no passa en el buit. Ahir mateix vam cobrir la retallada del 80% aplicada per OpenAI al preu de Luna, i la tarifa del V4.1 Flash arriba tot just unes hores després. La coincidència reforça una dinàmica que fa mesos que està instal·lada al sector: la competència es lliura cada vegada menys a les taules de benchmarks i cada vegada més en el cost per milió de tokens.

L'arquitectura del V4.1 Flash encaixa bé en aquesta lògica. Un model amb activació reduïda i un KV Cache dràsticament menor permet abaixar preus sense comprimir els marges de manera insostenible, una cosa que una retallada purament comercial no aconsegueix. És la diferència entre competir amb descomptes i competir amb eficiència estructural.

El calendari hi afegeix pressió addicional: el moviment es produeix a la vigília de la sortida a borsa d'Anthropic, un moment en què l'escrutini sobre els costos d'inferència i la sostenibilitat dels preus del sector és especialment intens. Cada rebaixa d'un competidor redefineix el llistó amb què els inversors mesuren els altres.

Conclusió

El V4.1 Flash és, sobre el paper, un exercici d'enginyeria orientat al cost: menys paràmetres actius, un KV Cache 437 vegades menor que el del model original i una tarifa que situa el milió de tokens de sortida per sota del dòlar fins i tot en hores punta. DeepSeek assumeix, a més, que el seu nou model no guanya en tot, en reconèixer que el V4 Pro continua per davant en GPQA i en el text de HLE. Queda per veure com es comporta fora dels benchmarks propis i si la transició cap al V4.1 Pro, ja insinuada en l'ajornament del 14 de setembre, manté la mateixa agressivitat en preus.

Fonts primàries

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog