aiexpert
Inicio / Noticias / Nota
Research · 10 ago 2026, 14:03 · 4 fuentes

DeepSeek V4-Flash oficial supera V4-Pro en benchmarks de agentes; Terminal Bench 2.1 alcanza 82,7

DeepSeek lanzó DeepSeek-V4-Flash-0731 en beta pública el 31 de julio de 2026, como lanzamiento oficial del modelo que superó V4-Pro-Preview en los nueve benchmarks de agentes publicados, con Terminal Bench 2.1 puntuando 82,7 al mismo precio de $0,14 por 1M de entrada y $0,28 por 1M de salida.

El V4-Flash-0731 usa exactamente la misma arquitectura y tamaño que la versión de vista previa de abril (parámetros totales de 284B, ~13B activos en Mixture-of-Experts)—solo el post-entrenamiento fue rehecho. Los benchmarks de agentes incluyeron Cybergym 76,7, NL2Repo 54,2, DeepSWE 54,4, Toolathlon verificado 70,3, Agent Last Exam 25,2, Automation Bench 25,1, DSBench-FullStack 68,7 y DSBench-Hard 59,6.

El V4-Flash oficial soporta nativamente el formato API de Respuestas y ha sido adaptado específicamente para Codex, permitiendo integración directa sin shim de traducción. A $0,14 por millón de tokens de entrada, V4-Flash es el modelo de agente más rentable del mercado, entregando 82,7 en Terminal Bench 2.1 versus Opus-4.8's 85,0, una brecha de solo 2,3 puntos, a una fracción del precio. Para constructores: un modelo más barato superando el tier caro en trabajo de agente a través de post-entrenamiento señala una brecha de calidad estrechándose en tareas de agente estándar. Verifique contra su propia carga de trabajo antes de cambiar.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source deepseek.ai
  2. 02 flowtivity.ai flowtivity.ai “DeepSeek V4-Flash just scored 82.7 on Terminal Bench 2.1, beating V4-Pro-Preview by 14.7%”
  3. 03 morphllm.com morphllm.com “DeepSeek V4-Flash: 284B total, 13B active, $0.14/M input, $0.28/M output”
  4. 04 deepseekv4guide.org deepseekv4guide.org “Terminal-Bench 2.1 hits 82.7; DeepSWE 54.4; Agent Last Exam 25.2”