DeepSeek lanza V4 en beta: la guerra de precios china se mide en céntimos por tarea

V4-Flash sube 10 puntos en el Intelligence Index y hace tareas de conocimiento a ~0,04 dólares. El dato no es que China saque modelos: es que el coste por unidad de trabajo se ha roto.

13 min de lectura

En este artículo

Qué ha pasado de verdad (y qué no)

El 31 de julio de 2026 DeepSeek abrió la beta de sus modelos V4. Entre ellos va la API V4-Flash: misma arquitectura original, reentrenada. Lo cuenta Cryptobriefing en el marco de una guerra de precios de IA en China, no como un evento aislado de marketing.

Eso es el hecho crudo. Lo que no es: un anuncio de que V4 “supera a Occidente”, ni una ficha técnica con número de parámetros, ni una promesa de adopción en producción. Esos datos no constan. Quien te los venda como certezas te está metiendo humo.

El contexto importa más que el comunicado. China lleva meses peleando cuota a base de bajar el precio del token y del trabajo útil. DeepSeek no inventa el partido; entra con un reentreno y con la reputación de quien ya forzó una bajada de precios global en 2025. V4 llega cuando el mercado ya está entrenado para preguntar una sola cosa: ¿cuánto me cuesta sacar el trabajo?

Dos fechas, dos armas: mayo y julio

Hay que separar dos movimientos que la prensa tiende a mezclar en un solo titular.

El 23 de mayo de 2026, según Bloomberg, DeepSeek anunció un descuento permanente del 75% en su modelo insignia V4-Pro. Precios para desarrolladores a una cuarta parte del nivel original. Eso no es una promo de fin de semana: es una señal de que el suelo de precio del flagship se reescribe a propósito y se deja clavado.

El 31 de julio llega la beta V4, con V4-Flash en API y arquitectura original reentrenada (Cryptobriefing). Aquí el arma no es solo el cartel de “rebajado”: es un modelo más barato de la familia que sube en índices compuestos y, sobre todo, en coste por tarea real.

Lo que no puedes afirmar sin mentir:

  • Que el 75% de mayo se extiende a toda la beta de julio.
  • Que V4-Flash hereda exactamente la misma política de descuento del Pro.
  • Que “los V4” son un bloque homogéneo de precio y capacidad.

Son piezas distintas de la misma estrategia: aplastar el coste de entrada y el coste de uso. Mayo pega en el flagship. Julio pega en la capa Flash, la que más volumen mueve en productos reales.

El número que duele: 50 en el Intelligence Index

Artificial Analysis, el 31 de julio de 2026, sitúa a DeepSeek V4 Flash 0731 en 50 en el Artificial Analysis Intelligence Index: 10 puntos por encima del V4 Flash anterior.

El Intelligence Index no es un testito de trivia. Es un índice compuesto que integra nueve evaluaciones (GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 y el resto del paquete). Mide inteligencia útil agregada, no un truco de un solo benchmark sacado de contexto.

Diez puntos de un salto, en un índice que promedia varias pruebas exigentes, no es ruido de laboratorio. Es una mejora de capacidades legible en el mismo marco con el que se comparan los demás. ¿Es eso “rendimiento de frontera”? No. El propio análisis de Artificial Analysis, cuando baja al terreno del trabajo real, deja claro que V4 Flash no está en esa liga. Lo que sí está es en otra conversación: cuánta capacidad te llevas por cada céntimo.

Subir 10 puntos en un índice de nueve evaluaciones y quedarte fuera de la frontera es exactamente el perfil que rompe mercados: suficiente para producción seria, barato de verdad.

Esa es la trampa en la que cae medio Twitter: leer “impresionante en benchmarks” (como resume Cryptobriefing el posicionamiento de los V4) y traducirlo a “mata a Claude y a GPT”. No. Tradúcelo a “el listón de lo aceptable se ha abaratado”.

AA-Briefcase: donde el precio deja de ser abstracto

El 18 de junio de 2026 Artificial Analysis lanzó AA-Briefcase. No es un examen de preguntas cortas. Es un benchmark de trabajo de conocimiento: proyectos complejos de varias semanas, miles de archivos fuente, calificación de calidad del resultado. O sea, lo más parecido que tienes en público a “¿me saca la faena o me la embarra?”.

Ahí DeepSeek V4 Flash (Max) cuesta del orden de 0,04 dólares por tarea. Claude Fable 5 se va por encima de 31 dólares por tarea. Misma vara de medir; dos órdenes de magnitud de diferencia en la factura.

Léelo despacio. No dice que V4 Flash (Max) iguale la calidad de Fable 5. Dice que, en un banco de trabajo diseñado para parecerse a proyectos largos con mucho contexto y muchos archivos, el coste unitario se ha desacoplado del coste de los buques insignia occidentales.

Para un equipo que monta pipelines, agentes o extracción masiva de documentos, esa brecha no es un detalle de hoja de cálculo. Es la diferencia entre experimentar cada día y pedir permiso a finanzas cada sprint. La API, la interfaz con la que integras y automatizas peticiones al modelo, deja de ser un grifo de dinero impredecible y se convierte en un recurso que puedes permitirte quemar en pruebas.

Si estás diseñando un router de modelos por tier con presupuesto duro, este es el tipo de dato que te obliga a meter un escalón “barato y decente” antes del escalón “caro y frontera”. No por ideología. Por aritmética.

Dónde encaja GLM-5.2: el otro polo del open weight

Artificial Analysis no deja a DeepSeek solo en la foto. En AA-Briefcase, GLM-5.2 (max) aparece como líder entre los modelos de peso abierto: unos 90 Elo por debajo de Claude Opus 4.8 (max) a menos del 25% del coste.

Eso dibuja un mapa con dos polos baratos que no son el mismo producto:

  • V4 Flash (Max): eficiencia extrema de coste por tarea (~0,04 $), sin pretender el techo de calidad.
  • GLM-5.2 (max): mejor equilibrio coste-rendimiento en abierto, más cerca del techo (aunque sigue por debajo del Opus de referencia) a una fracción del precio.

Quien diga “los modelos chinos” como si fueran un bloque único no ha mirado la tabla. Hay quien optimiza para el suelo de precio y hay quien optimiza para el ratio calidad/dólar en pesos abiertos. Los dos presionan a los cerrados caros; no lo hacen igual.

Shanghái, Kimi K3 y Qwen 3.8: el déjà vu de 2025

En torno a la WAIC de Shanghái (julio 2026), el lanzamiento de Kimi K3 y Qwen 3.8 reavivó el nerviosismo en Silicon Valley. Lo recoge el circuito de iaexpo.ai: buen desempeño a menor costo, APIs más baratas que las occidentales. El eco es explícito, el “efecto DeepSeek” de 2025 otra vez.

Tres hilos se juntan en el mismo mes:

  1. DeepSeek con beta V4 y Flash reentrenado (Cryptobriefing, 31 julio).
  2. Moonshot y Alibaba/Qwen metiendo presión de producto en la misma ventana (iaexpo.ai).
  3. Tablas públicas de Artificial Analysis donde el coste por trabajo útil ya no lo dicta el líder de calidad.

No hace falta inventar una conspiración. El patrón es industrial: cuando varios laboratorios chinos sacan modelos usables con tarifa agresiva a la vez, el relato occidental de “la frontera lo justifica todo” se queda cojo. Puedes seguir pagando frontera donde te juegas marca, seguridad o el 5% de tareas críticas. El otro 95% tiene alternativa medible.

Sobre Qwen y la partida en local ya hemos escrito con más calma: la jugada frontera no es traición, es fábrica de destilados. Aquí el ángulo es otro, no el portátil, sino la factura de API en producción,.

Mercados de predicción y el 93% de Anthropic: no confundan pizarra con despliegue

Cryptobriefing sitúa el lanzamiento de V4 como un posible desafío a líderes como Anthropic, cuyos modelos dominan con un 93% de confianza en mercados de predicción para liderar a finales de agosto de 2026.

Eso es un dato de apuestas, no un bench de producción. Sirve para medir narrativa y expectativa. No sirve para decretar que Anthropic “pierde el liderazgo” mañana por la mañana.

La tensión entre fuentes es sana si la miras de frente:

  • Cryptobriefing enfatiza guerra de precios, beta V4 y presión competitiva sobre los nombres occidentales.
  • Bloomberg (mayo) documenta la agresividad estructural de DeepSeek en el flagship con el 75% permanente.
  • Artificial Analysis baja al barro: +10 en Intelligence Index, ~0,04 $/tarea en Briefcase, y un ranking open weight donde GLM-5.2 también aprieta.
  • iaexpo.ai encuadra Kimi K3 y Qwen 3.8 como repetición del shock de 2025.

Coinciden en lo gordo: China compite por cuota con precio y con modelos “suficientemente buenos”. Discrepan en el foco, quién es el protagonista del titular, cuánto peso dar a mercados de predicción, cuánto a Elo y a dólares por tarea,. La tesis propia sale de resolver esa tensión, no de elegir un medio y parafrasearlo.

Tesis: no es un asalto a la frontera, es un asalto al suelo de precio

La lectura seria de V4 beta no es “DeepSeek ha matado a Anthropic”. Esa frase no se sostiene con los números que hay. La lectura seria es esta:

El suelo del precio por unidad de trabajo de conocimiento ya no lo fijan los modelos que mandan en la frontera.

V4 Flash sube de verdad en un índice compuesto (+10 hasta 50, Artificial Analysis) y se planta en AA-Briefcase a ~0,04 $ por tarea frente a decenas de dólares del Fable 5. A la vez, el ecosistema chino (Kimi K3, Qwen 3.8, GLM-5.2 en abierto) multiplica las salidas de escape. El descuento permanente del 75% en V4-Pro de mayo dice que la política de precios no es un accidente de un trimestre.

Seamos justos: la postura contraria no es un espantajo. Un defensor sensato de los modelos caros argumentaría que el Intelligence Index y AA-Briefcase miden capacidad agregada, no fiabilidad en el 5% de tareas donde un error cuesta reputación o compliance. Anthropic y OpenAI invierten en alineación, seguridad y disponibilidad enterprise que un benchmark de coste no captura. Si tu producto maneja datos sensibles, regulación estricta o decisiones de alto riesgo, pagar 31 $ por tarea no es despilfarro: es un seguro. La frontera no es un lujo cuando el fallo sale caro.

Dicho esto, la mayoría del trabajo en producción no es el 5% crítico. Es el 95% restante: resúmenes, extracción, clasificación, generación de borradores. Y ahí el argumento del seguro se convierte en un sobrecoste que ningún benchmark de seguridad justifica.

Implicaciones prácticas, sin moraleja de póster:

  • Si tu producto pega mil llamadas al día a un modelo caro para tareas que un Flash chino ya saca “decente”, estás donando margen.
  • Si no mides calidad en tus datos y solo miras el leaderboard de moda, vas a tomar la decisión al revés: o te quedas en el caro por miedo, o te cambias al barato por fe. Las dos son pereza.
  • Si tu arquitectura no permite cambiar de proveedor sin reescribir medio backend, la guerra de precios la estás perdiendo aunque ni la estés peleando. El vendor lock-in ya no es teórico.

El canario barato, probar en pequeño antes de quemar la matriz entera, aplica igual de bien a proveedores que a prompts. Coste de probar V4 Flash en un subconjunto de tráfico real: céntimos o pocos dólares. Coste de no haberlo medido y seguir pagando 31 $ de mentalidad Fable por tarea que no lo necesita: la tirada entera del trimestre.

Trampas de lectura (para no hacer el indio)

Trampa 1: “impresionante” = SOTA. Cryptobriefing habla de puntuaciones de benchmark impresionantes y de posicionamiento rentable. Artificial Analysis, en Briefcase, deja explícito que no hay rendimiento de frontera en V4 Flash (Max). Las dos cosas pueden ser ciertas a la vez. Impresionante en la liga de precio/capacidad no es lo mismo que rey de la liga absoluta.

Trampa 2: mezclar Pro y Flash. El 75% permanente es de V4-Pro en mayo (Bloomberg). La beta de julio y los números de Flash del 31 de julio son otra foto. Quien unifique todo en “DeepSeek está al 25% del precio” sin mirar qué SKU habla está inventando la tarifa.

Trampa 3: parámetros fantasma. No consta en el material el número de parámetros ni el detalle de arquitectura de V4 más allá de “arquitectura original reentrenada” en V4-Flash. Cualquier hilo que te suelte un “2.4T” o un esquema de MoE como hecho de este lanzamiento lo está sacando de otra conversación o del culo.

Trampa 4: mercados de predicción como oráculo. El 93% de confianza en que Anthropic lidere a finales de agosto mide apuestas. No mide latencia en tu VPC, ni tasa de error en tus PDFs, ni cumplimiento del AI Act cuando el dato no puede salir de Europa.

Trampa 5: adopción invisible. No hay cifras públicas de uso en producción de estos V4 en el material. Lanzamiento y leaderboard no son retention. Tratar el día del anuncio como día de victoria de mercado es periodismo de nota de prensa.

Qué haría un equipo con el cerebro en su sitio

Olvida el hilo de “¿quién va ganando la AGI?”. La pregunta operativa es más cutre y más útil:

  1. Inventario de tareas. ¿Qué porcentaje de tus llamadas necesita calidad tipo Opus/Fable y cuál se resuelve con un modelo de 50 en el Intelligence Index y buena eficiencia en Briefcase?
  2. Prueba en paralelo. Mismo prompt, mismas herramientas, mismo evaluador. Mide calidad en tu rúbrica, no en la del marketing. Coste por tarea real, no coste por mil tokens sacado de contexto.
  3. Techo de gasto y suelo de calidad. Si V4 Flash u otro open weight tipo GLM-5.2 cumple el suelo, el techo de gasto baja. Si no cumple, sigue en el caro, pero ya lo sabes con datos, no con miedo.
  4. Capa de enrutado. Un router por dificultad / riesgo / presupuesto convierte la guerra de precios en ventaja tuya. Sin router, solo eres rehén del proveedor al que te enganchaste en 2024.

La API barata no te hace mejor ingeniero. Te da margen para iterar. La gente que ya tiene evaluación propia y logs de calidad va a exprimir V4. La que vive de capturas de leaderboard va a hacer el ridículo dos veces: una pagando de más y otra cambiándose sin medir.

Cierre

DeepSeek V4 en beta no es la sentencia de muerte de Anthropic ni el final de los modelos caros. Es un recordatorio con factura: en julio de 2026 puedes subir de verdad en un índice compuesto de nueve evaluaciones, quedarte fuera de la frontera y aun así dejar el coste por tarea de conocimiento en torno a cuatro céntimos mientras el referente occidental se pasea por encima de treinta dólares.

China no está ganando solo “en hype”. Está ganando trozos de la curva de demanda donde el trabajo es repetible, medible y sensible al precio. Kimi K3, Qwen 3.8 y GLM-5.2 empujan la misma pared desde otros ángulos. El 75% permanente en V4-Pro de mayo avisó de la política. El Flash del 31 de julio enseña la aritmética.

Quien siga defendiendo un único modelo caro para todo no es “pro-calidad”. Es alguien que aún no ha mirado el extracto de la API.

Fuentes

  1. DeepSeek launches V4 models beta amid China's AI price warcryptobriefing.com · 2026-07-31
  2. DeepSeek To Make Permanent 75% Discount on Flagship AI Modelbloomberg.com · 2026-05-23
  3. iaexpo.aiiaexpo.ai
  4. AI Model & API Providers Analysis | Artificial Analysisartificialanalysis.ai