Modelos

DeepSeek lanza V4.1 Flash: 552B parámetros y precios a la baja

DeepSeek ha presentado este 10 de septiembre su modelo V4.1 Flash, un MoE (mezcla de expertos) de 552.000 millones de parámetros con una arquitectura Causal-Encoder-Decoder asimétrica que activa solo 8B en entrada y 16B en salida. La compañía sostiene que supera a V4 Pro en todas sus métricas clave y lo acompaña de una tarifa que sitúa el millón de tokens de salida en 0,60 dólares en horario valle. Los pesos ya están publicados en Hugging Face y la API está operativa.

Recibe el resumen diario de IA

Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

Frecuencia:

DeepSeek lanza V4.1 Flash: 552B parámetros y precios a la baja
📷 Imagen generada con IA · fuente

En resumen

  • V4.1 Flash es un MoE de 552B parámetros con arquitectura Causal-Encoder-Decoder asimétrica, activación de 8B en entrada y 16B en salida, y comprensión visual nativa.
  • DeepSeek publica 74,2 puntos en DeepSWE y 90,6 en Terminal-Bench 2.1, aunque reconoce que V4 Pro sigue por delante en GPQA y en el subconjunto de texto de HLE.
  • El KV Cache se reduce a 1/437 respecto al modelo original, lo que recorta el requisito de HBM a una cuarta parte y el de SSD a una octava.
  • La API cobra 0,60 dólares por millón de tokens de salida en valle y 1,20 en pico, y la retirada de V4 Pro se aplaza al 14 de septiembre.

Qué es exactamente V4.1 Flash

DeepSeek lanzó oficialmente el 10 de septiembre de 2026, hora de Pekín, su nuevo modelo DeepSeek V4.1 Flash. Se trata de un MoE (mixture of experts, o mezcla de expertos), una arquitectura en la que solo una fracción de los parámetros totales se activa para procesar cada consulta. El modelo suma 552.000 millones de parámetros, pero su diseño mantiene la activación en niveles muy bajos: 8.000 millones de parámetros en la entrada y 16.000 millones en la salida.

La novedad estructural es lo que DeepSeek denomina una arquitectura Causal-Encoder-Decoder asimétrica, es decir, un esquema en el que las partes que procesan el contexto de entrada y las que generan el texto de salida no tienen el mismo tamaño ni la misma carga computacional. Esa asimetría es la que permite mantener un modelo de gran capacidad total con un coste de inferencia contenido.

V4.1 Flash es además multimodal nativo, con comprensión visual incorporada desde el diseño y no añadida como una capa posterior. La compañía lo presenta como el modelo más pequeño de su nueva serie de estructuras de modelo, lo que anticipa versiones de mayor tamaño construidas sobre los mismos principios arquitectónicos.

Detrás del salto hay también cambios en el entrenamiento: DeepSeek describe un nuevo método de preentrenamiento combinado con aprendizaje por refuerzo (RL) aplicado a mayor escala que en generaciones anteriores. Los pesos del modelo están publicados en Hugging Face, de modo que el lanzamiento no se limita al acceso vía API.

Los benchmarks: avances claros y dos excepciones reconocidas

En su comunicado oficial, enviado por correo electrónico a los usuarios de la API entre el 9 y el 10 de septiembre, DeepSeek afirma que V4.1 Flash "supera integralmente a V4 Pro en todas las métricas clave: rendimiento, coste, velocidad y tiempo total de tarea". Es una declaración de la propia compañía sobre su propio modelo y conviene leerla como tal, a la espera de evaluaciones independientes.

Las cifras que acompañan al anuncio proceden de una comparativa sobre 19 benchmarks. Entre las publicadas destacan 74,2 puntos en DeepSWE, una prueba orientada a tareas de ingeniería de software, y 90,6 en Terminal-Bench 2.1, centrada en la ejecución de tareas en línea de comandos. Ambos son terrenos directamente relacionados con el uso del modelo como agente de programación.

La propia DeepSeek matiza el balance: V4 Pro sigue puntuando mejor que V4.1 Flash en GPQA, un conjunto de preguntas científicas de nivel de posgrado, y en el subconjunto de texto de HLE (Humanity's Last Exam). Es un reconocimiento relevante, porque acota el alcance de la afirmación de superioridad integral y sitúa el avance sobre todo en el terreno agéntico y de coste, no en el razonamiento académico más exigente.

El KV Cache como palanca de coste

El cambio con más consecuencias prácticas es la reducción del KV Cache, la memoria intermedia donde el modelo guarda las claves y valores del contexto ya procesado para no recalcularlo en cada nuevo token. Ese caché es uno de los principales consumidores de memoria de alta velocidad durante la inferencia y, por tanto, uno de los principales determinantes del coste.

Según DeepSeek, V4.1 Flash reduce el requisito de HBM (High Bandwidth Memory, la memoria de alto ancho de banda que acompaña a las GPU) a una cuarta parte respecto a la generación anterior, y el de SSD a una octava parte. Frente al modelo original de la familia, la compañía cifra la reducción del KV Cache en un factor de 437.

El efecto se concentra en las tareas de agentes, aquellas en las que el modelo encadena múltiples pasos reutilizando una y otra vez un contexto amplio. En esos flujos, el cache hit —la reutilización de contexto ya almacenado— domina la factura final, de modo que abaratar el caché abarata desproporcionadamente el tipo de uso que más está creciendo en el mercado.

Precios, disponibilidad y transición desde V4 Pro

La API ya está disponible con el nombre de modelo "deepseek-flash". Los anteriores V4 Flash y V4 Flash Vision Exp quedan retirados, aunque sus alias (deepseek-v4-flash y deepseek-v4-flash-vision-exp) redirigen temporalmente al nuevo modelo para no romper las integraciones existentes.

Las tarifas entraron en vigor a las 04:00 UTC del 10 de septiembre y siguen un esquema de valle y pico, en el que el precio valle equivale a la mitad del precio pico. Por millón de tokens de entrada con cache hit se cobran 0,003 dólares en valle y 0,006 en pico; con cache miss, 0,15 y 0,30 dólares respectivamente. El millón de tokens de salida cuesta 0,60 dólares en valle y 1,20 en pico. Las horas pico son, en UTC, de 1:00 a 4:00 y de 6:00 a 10:00, de lunes a viernes.

La retirada de V4 Pro, prevista inicialmente antes, se ha aplazado al 14 de septiembre a las 12:00 hora de Pekín (04:00 UTC). A partir de ese momento y hasta la salida de V4.1 Pro, las peticiones dirigidas a deepseek-v4-pro se enrutarán a V4.1 Flash y se facturarán a precio Flash. Mientras V4 Pro siga en servicio, su precio no cambia.

En el plano de las integraciones, Tencent —a través de WorkBuddy y CodeBuddy— y OpenCode figuran como socios oficiales y ya han incorporado V4.1 Flash a sus productos. Conviene distinguir los tres planos: el anuncio del modelo, su disponibilidad efectiva en la API y en Hugging Face, y la integración en herramientas de terceros, que por ahora se limita a esos socios.

Una guerra de precios que se acelera

El lanzamiento no ocurre en el vacío. Ayer mismo cubrimos el recorte del 80% aplicado por OpenAI al precio de Luna, y la tarifa de V4.1 Flash llega apenas horas después. La coincidencia refuerza una dinámica que lleva meses instalada en el sector: la competencia se está librando cada vez menos en las tablas de benchmarks y cada vez más en el coste por millón de tokens.

La arquitectura de V4.1 Flash encaja bien en esa lógica. Un modelo con activación reducida y un KV Cache drásticamente menor permite bajar precios sin comprimir márgenes de forma insostenible, algo que un recorte puramente comercial no consigue. Es la diferencia entre competir con descuentos y competir con eficiencia estructural.

El calendario añade presión adicional: el movimiento se produce en vísperas de la salida a bolsa de Anthropic, un momento en el que el escrutinio sobre los costes de inferencia y la sostenibilidad de los precios del sector es especialmente intenso. Cada rebaja de un competidor redefine el listón con el que los inversores miden a los demás.

Conclusión

V4.1 Flash es, sobre el papel, un ejercicio de ingeniería orientado al coste: menos parámetros activos, un KV Cache 437 veces menor que el del modelo original y una tarifa que sitúa el millón de tokens de salida por debajo del dólar incluso en hora pico. DeepSeek asume además que su nuevo modelo no gana en todo, al reconocer que V4 Pro sigue por delante en GPQA y en el texto de HLE. Queda por ver cómo se comporta fuera de los benchmarks propios y si la transición hacia V4.1 Pro, ya insinuada en el aplazamiento del 14 de septiembre, mantiene la misma agresividad en precios.

Fuentes primarias

Comentarios

Sé respetuoso. Los comentarios se moderan.

    Recibe el resumen diario de IA

    Cada mañana, lo esencial de la inteligencia artificial en tu correo, sin humo. Al día con la IA.

    Frecuencia:

    ← Volver al blog