Modelos de IA

DeepSeek lanza V4.1-Flash: un modelo multimodal de 552.000 millones de parámetros y contexto de 1 millón de tokens

DeepSeek V4.1-Flash procesa texto e imágenes, admite hasta un millón de tokens y llega a la API con menor consumo de caché y precios reducidos.

DeepSeek ha presentado V4.1-Flash, un nuevo modelo de inteligencia artificial multimodal orientado al razonamiento, los agentes y el procesamiento de contextos muy extensos. El sistema cuenta con 552.000 millones de parámetros en su arquitectura Mixture-of-Experts, puede analizar texto e imágenes de forma nativa y admite ventanas de contexto de hasta un millón de tokens.

El modelo está disponible desde el 10 de septiembre de 2026 mediante la API de DeepSeek bajo el identificador deepseek-flash. La compañía también ha publicado los pesos de V4.1-Flash en Hugging Face bajo licencia MIT, aunque ejecutar localmente un modelo de este tamaño requiere una infraestructura considerable.

V4.1-Flash procesa imágenes y texto de forma nativa

Una de las principales diferencias respecto a DeepSeek-V4-Flash es que la capacidad visual deja de estar separada en una variante experimental. V4.1-Flash incorpora comprensión multimodal directamente en el modelo principal.

Su arquitectura incluye un codificador visual DeepSeek-ViT que transforma las imágenes en representaciones que se procesan conjuntamente con los tokens de texto. El resultado es un modelo capaz de recibir conversaciones que mezclen imágenes y texto y generar respuestas textuales.

DeepSeek había probado previamente estas capacidades mediante V4-Flash-Vision-Exp, lanzado en agosto. Con V4.1-Flash, esa rama experimental queda reemplazada por soporte multimodal nativo dentro del nuevo modelo.

552.000 millones de parámetros, pero solo una parte se activa

DeepSeek-V4.1-Flash utiliza una arquitectura Mixture-of-Experts con 552.000 millones de parámetros de backbone. Esto no significa que todos se utilicen para procesar cada token.

La compañía estrena una arquitectura denominada Causal Encoder-Decoder, formada por 40 capas divididas entre un codificador causal de 20 capas y un decodificador de otras 20.

Durante el procesamiento de la entrada se activan aproximadamente 8.000 millones de parámetros por token. Durante la generación de la respuesta, la cifra aumenta a unos 16.000 millones. DeepSeek busca así combinar una gran capacidad total con un coste computacional considerablemente menor que el de un modelo denso de tamaño equivalente.

Contexto de hasta un millón de tokens

V4.1-Flash mantiene una de las características principales de la generación V4: una ventana de contexto de hasta un millón de tokens.

Esta capacidad está especialmente orientada a agentes, programación y análisis de grandes cantidades de información. Un modelo con este contexto puede recibir repositorios extensos, documentos largos o historiales de ejecución sin tener que fragmentarlos tan agresivamente.

DeepSeek recomienda también configuraciones que permiten generar respuestas de hasta cientos de miles de tokens en determinados entornos, aunque los límites efectivos pueden variar dependiendo de la API o del software utilizado para ejecutar los pesos.

DeepSeek reduce drásticamente la memoria necesaria para la caché

Una de las principales novedades técnicas de V4.1-Flash está en la KV cache, la memoria que conserva información de los tokens ya procesados y que puede convertirse en un coste importante cuando el contexto crece.

Según DeepSeek, V4.1-Flash necesita aproximadamente una cuarta parte de la memoria HBM y una octava parte del almacenamiento SSD requerido por la generación V4-Flash para esta caché.

La implementación reduce la caché global hasta aproximadamente 890 bytes por token. Frente a la primera generación de DeepSeek, la compañía calcula una reducción aproximada de 437 veces.

Estas optimizaciones tienen especial importancia en agentes que reutilizan grandes cantidades de contexto durante muchas llamadas consecutivas, donde almacenar y recuperar la caché puede representar una parte considerable del coste total.

El nivel de razonamiento puede ajustarse entre 1 y 100

DeepSeek-V4.1-Flash incorpora un control continuo del esfuerzo de razonamiento. La configuración acepta valores entre 1 y 100 para equilibrar el coste de inferencia y la precisión según el tipo de tarea.

Un valor inferior puede utilizarse en solicitudes sencillas donde prima la velocidad, mientras que los niveles elevados permiten al modelo emplear más recursos en problemas de programación, matemáticas, agentes o razonamiento complejo.

Los resultados de evaluación publicados por DeepSeek para su variante instruct utilizan el nivel máximo de razonamiento, por lo que no deben interpretarse automáticamente como el rendimiento obtenido con configuraciones más económicas.

DeepSeek afirma que V4.1-Flash supera a V4-Pro en varias pruebas

La compañía sostiene que la combinación de una nueva arquitectura, métodos de preentrenamiento y un entrenamiento posterior con aprendizaje por refuerzo ha permitido que V4.1-Flash supere a DeepSeek-V4-Pro en diferentes evaluaciones, pese a requerir menos parámetros activos.

DeepSeek publica, entre otros resultados, puntuaciones de 90,6 en Terminal-Bench 2.1, 74,2 en DeepSWE v1.1 y 54,8 en AutomationBench bajo sus configuraciones de evaluación.

Estas cifras proceden de las pruebas publicadas por el propio desarrollador y dependen del harness, el nivel de razonamiento, el contexto y otros parámetros utilizados. Por ello, no equivalen por sí solas a una superioridad general en todos los usos.

V4-Pro será sustituido temporalmente por V4.1-Flash en la API

DeepSeek considera que el nuevo modelo ofrece una combinación suficientemente favorable de rendimiento, velocidad y coste como para comenzar a retirar V4-Pro.

A partir de las 04:00 UTC del 14 de septiembre de 2026, las solicitudes enviadas al identificador deepseek-v4-pro serán redirigidas a V4.1-Flash y facturadas con las tarifas de este último.

La medida será temporal hasta la llegada de DeepSeek-V4.1-Pro. La compañía todavía no ha comunicado una fecha de lanzamiento para ese modelo.

También quedan retirados V4-Flash y V4-Flash-Vision-Exp. Por motivos de compatibilidad, sus antiguos identificadores de API continuarán redirigiendo temporalmente las solicitudes hacia V4.1-Flash.

La API también reduce sus precios

La llegada del nuevo modelo viene acompañada de una reducción de las tarifas. DeepSeek mantiene un sistema de precios diferentes según el horario, con tarifas fuera de las horas punta equivalentes a la mitad de las aplicadas durante los periodos de mayor demanda.

Fuera de las horas punta, el precio anunciado es de 0,15 dólares por millón de tokens de entrada sin caché, 0,003 dólares por millón de tokens recuperados de caché y 0,60 dólares por millón de tokens de salida.

Durante las franjas punta, esas cantidades se duplican a 0,30, 0,006 y 1,20 dólares respectivamente. Las nuevas tarifas entraron en vigor el 10 de septiembre.

Los pesos están publicados bajo licencia MIT

DeepSeek ha publicado V4.1-Flash en Hugging Face junto con información sobre su arquitectura, formatos de prompt, evaluación e inferencia. Tanto el repositorio como los pesos se distribuyen bajo licencia MIT.

La publicación permite que proveedores y desarrolladores adapten motores como Transformers, vLLM y SGLang para ejecutar el modelo fuera de la infraestructura oficial de DeepSeek.

Esto no implica que pueda ejecutarse de forma práctica en un PC convencional. DeepSeek habla expresamente de despliegues de gran escala y menciona configuraciones con miles de GPU y almacenamiento dedicado para organizaciones interesadas en operar el sistema a gran capacidad.

DeepSeek prepara modelos mayores con la misma arquitectura

DeepSeek describe V4.1-Flash como el modelo más pequeño de una nueva familia de arquitecturas. El diseño Causal Encoder-Decoder, la reducción de la KV cache y otras optimizaciones están pensados para poder escalar posteriormente a modelos de mayor tamaño.

V4.1-Flash funciona así tanto como sucesor directo de V4-Flash como anticipo de la siguiente generación de DeepSeek. El próximo paso confirmado es V4.1-Pro, aunque la compañía todavía no ha detallado sus parámetros, disponibilidad ni fecha de lanzamiento.