DeepSeek ha lanzado la versión oficial de su modelo DeepSeek-V4-Flash-0731, y los números no mienten: el nuevo modelo no solo barre a su predecesor en tareas de agente y código, sino que lo hace a un precio que pone los dientes largos a la competencia.
Publicado en Hugging Face el 31 de julio de 2026, el checkpoint ya está disponible como API en beta pública. La compañía es clara: no hay nueva arquitectura, el salto viene de un re-entrenamiento intensivo. Sigue siendo un modelo MoE de 284 mil millones de parámetros (13B activos por token), pero el rendimiento ha dado un salto cualitativo.
Rendimiento que habla por sí solo
DeepSeek ha publicado una tabla de benchmarks que enfrenta al V4-Flash-0731 con la versión preview, el V4-Pro (Preview) y modelos de la talla de Opus-4.8 y GLM-5.2. En todas las pruebas de agente, el nuevo modelo arrasa:
- Terminal Bench 2.1: 82.7 (frente a 61.8 del preview Flash y 72.1 del Pro).
- Cybergym: 76.7, doblando prácticamente los 38.7 del preview Flash.
- DeepSWE: 54.4, una bestialidad comparado con el 7.3 del preview Flash.
- Toolathlon-Verified: 70.3, superando incluso al Pro (55.9).
- Agents’ Last Exam: 25.2, frente a 15.8 del preview Flash.
- AutomationBench Public: 25.1, más del doble que el 10.8 del preview Flash.
Y en NL2Repo alcanza un 54.2, muy por encima del 39.4 del preview Flash y del 38.5 del Pro.
Eso sí, hay una advertencia importante: todas estas cifras son proporcionadas por DeepSeek y fueron generadas con una versión mínima de su harness interno que aún no se ha publicado. En palabras llanas: corre tus propias evaluaciones antes de lanzarte.
Precio que duele (a la competencia)
Aquí está el verdadero mazazo. El modelo deepseek-v4-flash se ofrece a $0.14 por millón de tokens de entrada en caso de fallo de caché, $0.0028 si acierta en caché, y $0.28 por millón de tokens de salida. Para ponerlo en contexto, es aproximadamente un tercio del precio de salida del V4-Pro ($0.87).
El análisis de Artificial Analysis sitúa al V4-Flash-0731 por delante del MiniMax M3 (un modelo de 428B) en el índice de inteligencia, y lo coloca en una posición casi solitaria en la esquina más atractiva del gráfico de coste por tarea. Por unos $0.028 por tarea, ofrece un nivel de inteligencia que modelos diez veces más caros como el Kimi K3 o el GLM-5.1 apenas igualan.
Auto-alojamiento: posible, pero no para cualquiera
Los pesos tienen licencia MIT y están sin restricciones de acceso, lo que permite su despliegue on-premise. Sin embargo, el modelo es un monstruo. Aunque solo se activen 13B parámetros por token, todos los expertos residen en memoria. La versión cuantizada a 3-bit de Unsloth pesa 103 GB, y necesitas unos 110 GB combinados de RAM y VRAM. Para precisión completa, DeepSeek recomienda un nodo con 4×GB300.
La clave: post-training, no nueva arquitectura
El modelo mantiene el mismo diseño de abril: atención híbrida con Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA), conexiones residuales con Manifold-Constrained Hyper-Connections (mHC), y más de 32 billones de tokens de pre-entrenamiento con el optimizador Muon.
Lo nuevo es el re-post-training. Y vaya si funciona.
Cómo usarlo
La API ya soporta de forma nativa el formato Responses API y está adaptada para Codex. DeepSeek recomienda temperature = 1.0 y top_p = 0.95 para usos de agente. El parámetro reasoning_effort permite elegir entre low, high o max, con hasta 384K tokens de salida en los niveles altos. Algunos tests informales muestran que subir el nivel de razonamiento de low a high mejora drásticamente la calidad del output.
El V4-Flash-0731 no es un nuevo concepto, pero es la demostración de que el entrenamiento importa tanto como el diseño. A un precio que deja a la competencia con la boca abierta.









