DeepSeek V4 Flash: barato por token, caro cuando mides el trabajo terminado
El precio de lista te vende el chollo. El tokenizador en español, el pensamiento por defecto y las alucinaciones te lo cobran después. Aquí van los datos, no el hype.
En este artículo
El Cuñado ya lo tiene claro
El Cuñado dice: "Bro, DeepSeek V4 Flash cuesta una mierda al lado de Opus y Fable. Mismos resultados, una décima del precio. Migra ya y deja de regalar pasta a los americanos."
Lo suelta con la seguridad de quien ha leído un hilo, ha visto el €/millón de tokens en una tabla y ha cerrado el Excel. No ha medido una tarea real. No ha contado tokens en español. No ha mirado si el modelo se pone a "pensar" sin que se lo pidas y te deja la respuesta vacía cuando el contexto crece. Ha visto el catálogo. El catálogo miente por omisión.
Seamos justos: el precio de lista de V4 Flash es agresivo de verdad ($0,14 por millón de tokens de entrada y $0,28 de salida, según la documentación oficial de DeepSeek) y la arquitectura explica por qué puede bajar tanto. Para cargas de inglés técnico limpio, con tareas acotadas y verificables, y con el pensamiento bajo control explícito, la diferencia de precio frente a GPT-5.5 u Opus 4.7 puede traducirse en ahorro real. El Cuñado no se lo ha inventado de la nada: ha leído la fila correcta de la tabla. El problema es que se ha quedado solo con esa fila.
La realidad es: el precio de lista no responde a la única pregunta que importa en producción: cuánto te cuesta el trabajo terminado y si la capacidad aguanta los ejes que no puedes regalar (seguridad, invariantes, precisión factual).
Por qué importa saberlo: porque migrar por el €/token y descubrir a las 48 horas que el run real sale más caro que el modelo anterior no es una anécdota graciosa. Es el modo por defecto de elegir modelo en 2026.
Qué está vendiendo el cartel del chollo
Empieza por lo que sí cuadra. DeepSeek V4 Flash no es humo de marketing vacío: es un MoE (Mixture of Experts) de 284B parámetros totales que activa 13B por token, con ventana de contexto de 1M tokens y salida máxima de 384K. MoE, en cristiano de bar: en vez de encender todo el cerebro para cada palabra, enciende un puñado de "especialistas" y el resto se queda dormido. Menos cómputo por token. Menos factura teórica.
La jugada gorda de eficiencia es la arquitectura híbrida CSA+HCA. Según el análisis de Hugging Face, reduce el cómputo de inferencia a 0.10× y la memoria KV-cache a 0.07× respecto a V3.2. El KV-cache es la libreta donde el modelo anota lo que ya ha "visto" para no recalcularlo en cada palabra nueva; crece con el contexto y en ventanas de un millón de tokens se vuelve un pozo sin fondo de RAM. CSA+HCA mete las entradas KV en FP8 y deja BF16 solo para RoPE, y eso se traduce en una reducción del 98% de memoria KV-cache frente a la atención agrupada estándar (GQA). Sin ese truco, el contexto de 1M sería un lujo de laboratorio. Con él, el precio de API bajo deja de ser magia y pasa a ser ingeniería.
El entrenamiento también empuja en la misma dirección: optimizador Muon (momentum matricial con ortogonalización Newton-Schulz) en lugar de AdamW, y post-entrenamiento que consolida expertos de dominio (razonamiento, código, matemáticas, conocimiento, agentes) con destilación on-policy para no cargarse unos a otros como suele pasar en un RL de una sola etapa. Todo eso es real. Todo eso justifica que el cartel diga "barato".
Y el cartel, en números, pega de verdad:
- V4 Flash: $0,14/M entrada, $0,28/M salida
- GPT-5.5: $5/M entrada, $30/M salida
- Claude Opus 4.7: $5/M entrada, $25/M salida
La brecha en salida es de más de 80×. Para 100M tokens de salida al mes, Flash sale a $28 frente a $3.000 de GPT-5.5 o de Opus 4.7. Si solo miras esa fila, el Cuñado tiene razón y tú eres el idiota que sigue pagando premium.
No mires solo esa fila.
El fine-tuning nuevo y por qué el hype tiene algo de base
El hype actual no viene del lanzamiento original de V4 Flash. Viene de que salió hace nada con un fine-tuning encima que le mete mejoras significativas: más instrucción-following, mejor consolidación de los expertos de dominio y un post-entrenamiento más cuidado. Eso es lo que está circulando en hilos y que ha disparado la comparativa con los premium.
Importa decirlo sin adornos: V4 Flash con ese fine-tuning es un modelo nuevo de facto. Los benchmarks que circulan en Twitter/X pueden estar midiendo la versión anterior, la nueva, o una mezcla. Antes de tomar decisiones de arquitectura basadas en un hilo de 12 posts, vale la pena saber exactamente qué checkpoint están evaluando.
Lo que sí está claro de los datos públicos disponibles: la familia V4 hereda la arquitectura MoE+CSA+HCA de arriba, el precio de API no se ha movido, y las mejoras de fine-tuning apuntan a comportamiento de instrucción, no a que de repente el modelo invente menos hechos. Ese agujero (la fiabilidad factual) es estructural, no de fine-tuning de unas semanas.
Lo que matan las migraciones que parecen obviamente buenas
V4 Flash no ha pasado por nuestro pipeline de producción todavía. Lo que sigue es lo que el patrón de migraciones a familias de razonamiento similares enseña una y otra vez, con datos propios de esas otras migraciones y con lo que los benchmarks públicos anticipan.
Dos mecanismos, ninguno figura en la tabla bonita del vendor:
El tokenizador en español. Los modelos de esta familia tienden a tokenizar idiomas no anglófonos de forma menos eficiente: el mismo texto en español genera más tokens que en inglés técnico limpio. En migraciones a familias similares hemos visto ~30% más tokens por documento en carga real de empresa (contratos, actas, tickets). El €/token baja; los tokens por documento suben; el producto de los dos no siempre es el chollo que vendiste internamente. Ese 30% no está en F1 ni en F2: salió midiendo texto real. Si tu carga es inglés técnico, tu factura se parecerá más al Excel del vendor.
El pensamiento adaptativo por defecto. Los modelos de razonamiento de esta familia se ponen a "pensar" en voz alta (o en voz interna facturable) sin que la tarea lo pida. Tokens de pensamiento que no ve el usuario y sí ve la factura. En conversaciones multi-turno, cuando el hilo crece, el razonamiento puede zamparte el presupuesto de tokens entero y no quedarte cupo para la respuesta visible. El resultado:
finish_reason: stop, content vacío, sin error de API. No es que el modelo sea tonto; es que pensó más de lo que le dejaste y no le sobró sitio para contestar. Subir el tope de tokens de salida (con caps separados para "cerebro" y "boca") baja ese fallo drásticamente.
Ambos patrones son documentados y reproducibles en familias de razonamiento. No hay razón para que V4 Flash escape a ellos; hay razones de arquitectura para esperar que los herede. Pero sin medirlo en tu carga específica, es anticipación informada, no conclusión.
El coste de un modelo es el del trabajo terminado, no el precio por token del catálogo.
La arquitectura te ahorra inferencia. No te regala capacidad frontera
Aquí hay que contrastar fuentes de verdad, no hacer de loro de la que mejor suena.
Donde coinciden F1 y F2: V4 es competitivo en precio y muy eficiente en inferencia; no es el techo absoluto de razonamiento y conocimiento factual frente a los buques insignia cerrados. MindStudio lo acerca a GPT-5.4 y dice que la prima de GPT-5.5 / Opus 4.7 se justifica en multi-paso duro y ciencia difícil. Hugging Face pone números a esa brecha en la variante Pro-Max: GPQA Diamond 90.1 frente a 94.3 de Gemini 3.1 Pro; MMLU-Pro 87.5 frente a 91.0; SimpleQA 57.9 frente a 75.6. Tres a cinco puntos en razonamiento, y un agujero más ancho en precisión factual.
Donde F2 pone el contra-argumento del Cuñado pro-código: en benchmarks de código, V4-Pro-Max lidera o empata arriba del todo (LiveCodeBench 93.5 vs 91.7 de Gemini 3.1 Pro, Codeforces 3206 vs 3168 de GPT-5.4, Apex Shortlist 90.2 vs 89.1, SWE-bench Verified 80.6 vs 80.8 de Opus 4.6 Max). Si tu mundo es contests y parches con olor a benchmark, el cartel de "casi frontera a precio chino" se sostiene mejor.
Donde F2 se pega un tiro en el pie a sí mismo (y eso se agradece): en DeepSWE (91 repos, 5 lenguajes, libre de contaminación) V4-Pro se deja en un 8% pass@1 frente a 70% de GPT-5.5 y 54% de Opus 4.7. Esa discrepancia no es un detalle de frikis. Es la bandera roja de que SWE-bench Verified puede estar inflado por contaminación o por formas de resolver que no generalizan. Cuando un modelo barre el examen de siempre y se despeña en el examen que no ha podido memorizar, no "es malo en general": es bueno en el examen de siempre. Punto.
Lo que F2 desmonta de paso: el rumor de que DeepSeek enrutaba tráfico a Claude Fable 5 para destilar. Desmentido. Los cambios de output se explican por un checkpoint nuevo de instruction tuning y por convergencia de datos de entrenamiento solapados. Quien siga vendiendo el "es Claude con skin" está un rumor por detrás.
Open-weight con licencia MIT: puedes auto-hospedar, auditar y hacer fine-tuning. Eso importa de verdad si tienes residencia de datos, compliance o pánico sano a mandar proprietary a APIs de terceros. No conviertas eso en "gratis". Auto-hospedar Flash (284B totales, 13B activos) tiene coste de GPU, de plataforma, de gente que sepa operarlo. El MIT te quita al intermediario; no te quita la factura de infra.
Nota metodológica importante: los leaderboards finos de código y conocimiento que citamos arriba son de Pro / Pro-Max, no de Flash. No hay en el material benchmarks específicos de Flash equivalentes a esos de Pro-Max. Quien diga "Flash saca 93.5 en LiveCodeBench" se está inventando el sujeto. Flash hereda familia y filosofía; no hereda por arte de magia cada número del hermano mayor.
Alucinaciones: el agujero que el precio no tapa
Suprmind suelta la hostia que el Excel de €/token no quiere ver.
En AA-Omniscience (julio 2026), DeepSeek V4 Flash marca tasa de alucinación del 96% e índice de fiabilidad de conocimiento de -23: el peor del lote evaluado. V4 Pro no se salva: 94% de alucinación, mismo índice -23. Claude Fable 5 lidera ese índice con 40 (61% de precisión, 54.9% de alucinación). Léelo otra vez sin anestesia: incluso el líder alucina más de la mitad de las veces en ese banco. El suelo del sector está alto. El sótano de Flash y Pro, en ese banco, está más abajo.
Matiz obligatorio, porque si no lo pones eres tan demagogo como el Cuñado en sentido contrario: esa tasa del 96% es de AA-Omniscience, no "en todos los contextos". No consta aquí la metodología exacta del banco. No la conviertas en "DeepSeek miente siempre". Conviértela en "en el banco que mide omnisciencia/fiabilidad de conocimiento, sale el último".
En Vectara (resúmenes, metodología distinta), V4 Pro obtiene 8.6% de alucinación: mejor que GPT-5.2 (10.8%) y Claude Opus 4.6 (12.2%), peor que Gemini 2.0 Flash (3.3%). Mismo apellido de modelo, dos bancos, dos películas. En resúmenes cortos se defiende; en el banco de fiabilidad de conocimiento se desangra. Eso no es inconsistencia de periodista. Es que "alucinación" no es una única enfermedad: fallar un resumen y inventarse un hecho en cadena multi-paso no pesan igual en producción.
Contexto de industria, también de F3: pérdidas globales por alucinaciones de IA en 2024, $67.4B. Mejor caso en resúmenes básicos, 0.7% con Gemini-2.0-Flash. Y el Multi-Model Divergence Index (abril 2026): el 51.4% de las respuestas de alta confianza de Gemini fueron contradichas por otro modelo; el 26.4% en Claude. Traducción: la confianza del modelo no es precisión. Un juez que solo mira "qué seguro se oye" está midiendo teatro.
¿Es Flash adecuado para aplicaciones críticas sin verificación independiente? Con estos números, la respuesta seria es no darlo por bueno de fábrica. No porque sea DeepSeek. Porque en el banco que más castiga la fiabilidad de conocimiento sale el farolillo rojo, y porque la confianza percibida no sustituye a un comprobante externo.
Cómo se mide capacidad de verdad (y por qué el juez LLM te estafa)
Si eliges modelo leyendo leaderboards y haciendo "ojo de buen cubero" con unas salidas, estás eligiendo packaging. La pregunta útil no es "¿suena convincente?". Es "¿lo consiguió?". Y "¿lo consiguió?" lo tiene que responder el mundo, no otro modelo leyendo la transcripción.
Un juez LLM valorando si un exploit, un parche o una respuesta "parece buena" hereda los sesgos del juez y no distingue un método que funciona de un método que suena bien. Para capacidad hace falta verificación determinista. Tres piezas, construidas a propósito:
- Entorno donde el éxito deja huella comprobable. Datos sembrados que actúan de canario: si reaparecen en la salida, hubo exfiltración o hubo acceso; se cuentan. El resultado es un número, no un adjetivo.
- Caja negra real. El modelo ve la interfaz, no el código fuente ni el solucionario. Si le pasas la implementación, mides lectura, no descubrimiento.
- El mismo target para todos. Idénticos agujeros, idénticas reglas. Si cada candidato ataca un problema distinto, no hay comparación: hay anécdotas.
Y la guarda de método que casi nadie escribe en el README: quien construye el entorno debe demostrar antes que el éxito es alcanzable. Si el propio autor no completa la tarea, un cero del modelo no significa "no supo". Significa "igual no se podía". Y no sabrías distinguir las dos.
Eso conecta con cómo decidir techo y coste sin liar las variables. Son dos mediciones distintas y el orden importa:
- Mides la arquitectura y el harness con el mejor modelo que puedas pagar en evaluación.
- Cuando el techo está acotado, la pregunta del modelo barato se vuelve binaria y barata: ¿mantiene los ejes innegociables a distancia tolerable del techo?
Si evalúas la arquitectura directamente con el modelo de saldo, un mal resultado es ambiguo (¿falló el diseño o el modelo?) y un buen resultado no te dice cuánto margen dejas sobre la mesa. Si el económico aguanta seguridad e invariantes, desplegar el caro es tirar dinero. Si no aguanta, ya sabes exactamente qué estás comprando al pagar de más (no una vibra de "calidad", un delta medido).
En sistemas reales, eso se opera con un router por tier: el orquestador no conoce SDKs ni nombres de marketing; conoce tiers. Un ModelSpec y config que mapea tier → (proveedor, modelo, precios). Cambio de modelo o de proveedor = config, no refactor. Clientes finos (capa compatible con OpenAI reutilizada vía base_url + key cuando se puede). Por fuera del prompt, no dentro: generate_with_fallback con timeout, cadena de degradación a tier inferior, error tipado tipo AllModelsFailed, y techo de presupuesto diario por usuario (BudgetExceeded) igual de duro en chat que en tareas programadas. El matiz incómodo: el streaming del chat suele anclarse al tier primario; hacer fallback a mitad de stream re-emite tokens y, si no lo has diseñado, lo dejas como deuda explícita en vez de improvisar un monstruo.
Si quieres el montaje fino del router, ya lo desgranamos en cómo montar un router de modelos por tier. Si lo que te falta es dejar de fiarte del leaderboard ajeno, el camino es un pipeline de evaluación con datos propios. Y si aún no tienes ni un canario de humo antes de desplegar, empiezas por la prueba barata que te salva de subir basura.
Entonces, ¿cuándo Flash es la decisión correcta?
No hay moralina de "usa siempre el más caro" ni de "lo open-weight gana". Hay escenarios.
Flash (o la familia V4 en API barata) encaja cuando:
- La tarea es acotada, verificable por código o por un comprobante externo (tests, esquemas, canarios, reglas de negocio).
- El volumen es alto y el coste de salida te está matando con Opus/GPT a $25–30/M.
- Puedes y quieres controlar el pensamiento (caps de tokens, flags apagados si el proveedor los expone, topes de salida distintos para "cerebro" y para "boca").
- Mides tokens reales en tu idioma y tu distribución de documentos, no en el notebook del vendor.
- El open-weight MIT te resuelve residencia o auditoría, y tienes infra (o un hosting serio) para no romanticizar el "gratis".
No encaja (o encaja solo detrás de un modelo juez/validador que tampoco te fías a ciegas) cuando:
- La salida es conocimiento factual de alto riesgo sin herramienta de verificación (legal, médico, financiero, compliance).
- El trabajo es razonamiento científico multi-paso duro o agentes donde un fallo silencioso cuesta más que mil runs baratos.
- Tu evaluación es "le pedí tres cosas a Chat y me gustó el tono".
- Asumes que el 96% de AA-Omniscience "no va contigo" sin haber medido tu propia tasa de invención.
La guerra de precios china es real; ya vimos el primer round cuando DeepSeek lanzó V4 en beta y el tablero se midió en céntimos por tarea. Ahí se ve con números lo que significa competir a 3 céntimos por prueba frente a $1,86 de GPT o $3,15 de Claude: el coste por token del catálogo y el coste por tarea terminada no son la misma columna. Gemini y compañía están en la misma conversación de "menos tokens ≠ menos factura"; el patrón es de sector, no de un villano concreto.
El desmontaje en tres cierres
El Cuñado dice: precio de salida brutalmente menor que el premium, luego Flash sustituye a Opus y Fable.
La realidad es: puede sustituir al premium donde tu harness demuestra que el techo no se cae y donde el contador de tokens por tarea (español, pensamiento, reintentos, vacíos, tools) sigue dando el chollo. En código de leaderboard clásico, la familia Pro-Max pelea arriba. En DeepSWE limpio, se despeña. En fiabilidad de conocimiento AA-Omniscience, Flash y Pro cierran el ranking con índice -23. En precio de lista, machacan: $0,28 por millón de tokens de salida frente a $25–30 del premium. Las cuatro frases son ciertas a la vez. El que elige una y silencia las otras está haciendo marketing, no ingeniería.
V4 Flash es nuevo. Tiene fine-tuning reciente encima. No hay suficiente rodaje propio para sacar conclusiones de primera mano sobre él. Lo que hay son benchmarks públicos, patrones documentados en familias similares, y una arquitectura que ya conocemos bien. Con eso se toman decisiones informadas, no definitivas. El resto se mide.
Por qué importa: porque la decisión de modelo es una de las pocas que te puede fundir el margen sin que el dashboard de producto se entere hasta el mes siguiente. El tokenizador no sale en el changelog de features. El pensamiento por defecto no sale en la landing. El juez LLM que te dice "qué buena respuesta" no ha ejecutado nada.
Mide el techo con el mejor. Despliega el más barato que aguante. Cambia de modelo por config. Cuenta tokens del trabajo terminado. Y cuando el cartel diga "100× más barato", contesta con una sola pregunta de adulto: ¿100× más barato hasta que el canario canta, o 100× más barato en la tabla?
Preguntas frecuentes
¿Es DeepSeek V4 Flash más barato que GPT-5.5 y Claude Opus 4.7?
En precio de lista de API, sí: $0,14/M de entrada y $0,28/M de salida frente a $5/$30 de GPT-5.5 y $5/$25 de Opus 4.7. Eso no garantiza menor coste por tarea. Un tokenizador más voraz en español y el pensamiento adaptativo activado por defecto son los dos mecanismos que más frecuentemente elevan el coste real por run por encima del modelo anterior pese al €/token inferior.
¿DeepSeek V4 Flash alcanza el nivel de los modelos frontera en capacidad?
No de forma general. MindStudio lo sitúa cerca de GPT-5.4; la brecha se abre en razonamiento multi-paso difícil y ciencia. En Pro-Max, F2 muestra 3–5 puntos menos en GPQA/MMLU-Pro y un agujero mayor en SimpleQA, con buen papel en varios benches de código y un 8% pass@1 en DeepSWE frente a 70% de GPT-5.5. Flash no tiene en el material los mismos leaderboards detallados que Pro-Max, y su fine-tuning reciente aún no tiene suficiente evaluación independiente.
¿Por qué DeepSeek V4 Flash puede ofrecer precios de API tan bajos?
Porque es un MoE de 284B con 13B activos por token y arquitectura CSA+HCA que baja el cómputo de inferencia a 0.10× y la memoria KV-cache a 0.07× frente a V3.2, con ~98% menos memoria KV-cache que GQA estándar al guardar KV en FP8 (Hugging Face, F2). Menos recurso por token de inferencia permite precios de API agresivos sin que eso diga nada, por sí solo, de la fiabilidad factual.
¿Qué tasa de alucinación tiene DeepSeek V4 Flash?
En AA-Omniscience (julio 2026) marca 96% de alucinación e índice de fiabilidad -23, el peor del conjunto evaluado; V4 Pro va al 94% con el mismo índice (Suprmind, F3). Ese dato es de ese banco, no de "todo contexto". En Vectara de resúmenes, Pro obtiene 8.6%, mejor que varios premium y peor que Gemini 2.0 Flash (3.3%). Hay que medir alucinación en tu tarea, no heredar un único porcentaje.