VibeThinker 3B: cómo un modelo de 3.000 millones de parámetros le planta cara a los gigantes en razonamiento
Un equipo de investigadores acaba de demostrar que no hacen falta cientos de miles de millones de parámetros para razonar bien. VibeThinker 3B machaca a modelos diez veces más grandes en matemáticas olímpicas y código. Y el cómo es lo que cambia las reglas.
En este artículo
VibeThinker 3B: el modelo que le parte la cara a la narrativa del escalado infinito
VibeThinker 3B (Sen Xu et al., junio de 2026) es un golpe directo a la narrativa del escalado infinito. Desde que GPT-3 demostró que escalar funcionaba, la industria lleva años en la misma dinámica: más parámetros, más datos, más compute, más capacidad. La lógica es sencilla y, hasta cierto punto, empíricamente sólida. Pero tiene un coste que la mayoría de empresas y equipos de investigación no pueden pagar, y una trampa conceptual que pocos quieren nombrar en voz alta: que escalar resuelve muchas cosas, pero no necesariamente las que más importan.
Un modelo denso de 3.000 millones de parámetros, cuando los grandes del sector miden sus modelos en decenas o cientos de miles de millones, que iguala o supera a DeepSeek V3.2, GLM-5, Gemini 3 Pro y Claude Opus 4.5 en benchmarks de razonamiento matemático y código. No en todos los dominios, no en todas las tareas, pero sí exactamente donde se suponía que la escala era imbatible.
La pregunta que responde el paper no es "¿podemos hacer modelos más pequeños?" sino algo más interesante: ¿por qué funciona esto, y qué nos dice sobre cómo se organiza el conocimiento dentro de una red neuronal?
Qué significa tener 3.000 millones de parámetros en la práctica
Para contextualizar sin perderse en la abstracción: un parámetro es, grosso modo, un número ajustable dentro de la red que determina cómo el modelo transforma una entrada en una salida. Más parámetros, en teoría, más capacidad para almacenar conocimiento y representar relaciones complejas.
GPT-4 se estima en el rango de un billón de parámetros (aunque OpenAI no lo confirma oficialmente). Llama 4 Scout tiene 109.000 millones activos. Los modelos "pequeños" que suelen usarse en dispositivos locales rondan los 7.000-13.000 millones. VibeThinker 3B está por debajo de todo eso.
Ejecutar un modelo de 3.000 millones de parámetros en cuantización estándar en una GPU de consumo de gama media. No necesitas un clúster de A100s. No necesitas factura de cloud de cinco cifras al mes. Eso no es un detalle menor: es lo que hace que este resultado sea relevante más allá del paper.
El método: Spectrum-to-Signal en tres etapas
La razón por la que VibeThinker 3B funciona no es magia ni un truco de arquitectura. Es un paradigma de post-entrenamiento que los autores llaman Spectrum-to-Signal, y que se despliega en tres etapas secuenciales. Cada una resuelve un problema distinto.
Etapa 1: SFT curricular (de lo fácil a lo difícil)
El SFT (Supervised Fine-Tuning, ajuste supervisado) curricular es la primera fase. La idea es sencilla pero el detalle importa: en lugar de lanzar al modelo ejemplos de entrenamiento en orden aleatorio, se ordenan de menor a mayor dificultad.
La lógica es la misma que usaría un buen profesor de matemáticas: primero te enseña a sumar antes de meterte con integrales. Si empiezas con los problemas más difíciles, el modelo puede aprender a imitar la forma de las soluciones largas sin entender la lógica subyacente. El entrenamiento curricular fuerza al modelo a internalizar la estructura del razonamiento antes de enfrentarse a cadenas de pensamiento largas y complejas.
Esto no es nuevo como concepto en machine learning, el curriculum learning lleva décadas estudiado, pero aplicarlo sistemáticamente como primera fase de un pipeline de post-entrenamiento para razonamiento verificable es parte de lo que hace robusto al método.
Etapa 2: RL multi-dominio sobre señales verificables
La segunda etapa es donde entra el Reinforcement Learning (aprendizaje por refuerzo). Y aquí hay un matiz técnico que el paper enfatiza y que merece explicación.
El RL en modelos de lenguaje funciona así: el modelo genera una respuesta, se evalúa si esa respuesta es correcta mediante una señal de recompensa, y el modelo se ajusta para producir más respuestas que reciban recompensa positiva. En matemáticas y código, esta señal es verificable de forma objetiva: o la solución es correcta o no lo es. No hay ambigüedad.
El problema con el RL estándar aplicado a razonamiento es que si entrenas solo en un dominio, pongamos, álgebra, el modelo aprende trucos específicos de álgebra que no generalizan. Es como estudiar para un tipo concreto de examen: pasas ese examen, pero el día que cambia el formato te quedas en blanco.
VibeThinker 3B aplica RL sobre señales verificables de múltiples dominios simultáneamente: matemáticas, código, lógica formal. El resultado es que el modelo no memoriza trucos locales sino que aprende estrategias de razonamiento que se transfieren entre dominios. La generalización no es un efecto secundario; es el objetivo explícito del diseño.
Etapa 3: Auto-destilación offline
La tercera etapa es la más elegante conceptualmente. La auto-destilación offline funciona así: el modelo, tras las dos primeras fases de entrenamiento, genera sus propias soluciones a un conjunto de problemas. Se seleccionan las mejores generaciones, las que son correctas y además muestran cadenas de razonamiento limpias, y se usan como datos de entrenamiento adicional.
Sin maestro externo. Sin un modelo más grande del que destilar. El modelo aprende de sus propias mejores versiones.
Esto es relevante por varias razones. Primera: no añade parámetros, no aumenta el coste de inferencia, no requiere acceso a un modelo propietario más potente. Segunda: fuerza al modelo a consolidar y comprimir lo que ya sabe de forma más eficiente. Tercera: es un mecanismo de mejora que, en principio, puede iterarse.
"El razonamiento verificable se comprime en núcleos compactos mientras la cobertura amplia de parámetros sirve para conocimiento general." Hipótesis central del paper (parametric compression-coverage hypothesis)
Los números: qué exactamente supera y qué no
Los benchmarks son el punto donde muchos papers de IA se venden más de lo que entregan. Aquí los datos son concretos.
AIME26 (American Invitational Mathematics Examination 2026, problemas de matemáticas olímpicas): VibeThinker 3B obtiene 94,3. Con escalado en inferencia, es decir, dejando que el modelo genere múltiples soluciones y seleccione la mejor, sube a 97,1. Para referencia, estos son problemas diseñados para estudiantes de élite de secundaria que aspiran a representar a su país en olimpiadas internacionales. No son ejercicios de cálculo rutinario.
LiveCodeBench v6 (benchmark de código sobre problemas de programación competitiva no vistos durante el entrenamiento): 80,2 Pass@1. Pass@1 significa que la primera solución generada es correcta. En programación competitiva, eso es el listón real: no vale generar diez intentos y que uno funcione.
LeetCode no visto: 96,1%. LeetCode es el estándar de facto para entrevistas técnicas de software en grandes empresas. El "no visto" es el matiz importante: problemas que no estaban en los datos de entrenamiento.
IFEval (benchmark de seguimiento de instrucciones): 93,4. Esto importa porque demuestra que el modelo no ha sacrificado capacidad general de seguir instrucciones en el proceso de especializarse en razonamiento. Un modelo que razona bien pero no puede seguir instrucciones complejas tiene utilidad limitada en producción.
Lo que el paper no afirma, y es importante señalarlo: no hay un benchmark único donde VibeThinker 3B sea el mejor en todo. Los modelos con los que se compara, DeepSeek V3.2, GLM-5, Gemini 3 Pro, Claude Opus 4.5, son superiores en tareas de conocimiento general amplio, en multimodalidad, en dominios donde la escala de parámetros sí importa para cubrir más conocimiento. La comparación es específica a razonamiento verificable, y eso es exactamente lo que el paper argumenta que tiene sentido.
La hipótesis que lo explica todo: parametric compression-coverage
El resultado empírico es llamativo, pero la contribución teórica del paper puede ser más duradera. Los autores proponen la parametric compression-coverage hypothesis, que en castellano suena así:
El razonamiento verificable, matemáticas, código, lógica formal, se puede comprimir en núcleos de parámetros relativamente compactos. No necesita escala masiva porque su estructura es, fundamentalmente, algorítmica y generalizable. Un modelo pequeño bien entrenado puede capturar esas estrategias de razonamiento de forma eficiente.
El conocimiento general, en cambio, es intrínsecamente extenso. Saber que la capital de Mongolia es Ulán Bator, que el tratado de Westfalia se firmó en 1648 y que el punto de ebullición del etanol es 78,4°C no tiene estructura comprimible: son hechos que hay que almacenar. Ahí es donde la cobertura de parámetros sí importa.
La implicación práctica es que los modelos pequeños no son versiones degradadas de los modelos grandes. Son herramientas con un perfil diferente: excelentes en razonamiento verificable, limitados en cobertura de conocimiento. Y eso sugiere arquitecturas de sistema donde ambos tipos coexisten con roles distintos en lugar de competir por el mismo puesto.
Por qué esto importa más allá del benchmark
Hay tres consecuencias prácticas que merece la pena desarrollar.
Primera: el coste de despliegue cambia radicalmente. Un modelo de 3.000 millones de parámetros con este nivel de rendimiento en razonamiento matemático y código puede ejecutarse en hardware que una empresa mediana puede permitirse. Puede desplegarse localmente, con datos que no salen de la red corporativa, sin dependencia de APIs externas. Para aplicaciones donde la privacidad o la latencia son críticas, eso no es un detalle: es el factor determinante.
Segunda: el fine-tuning se vuelve accesible. Los modelos grandes son difíciles de ajustar porque el coste computacional del entrenamiento es prohibitivo para la mayoría de equipos. VibeThinker 3B, con licencia MIT que permite descarga, modificación y uso comercial sin restricciones, puede ser ajustado por un equipo de investigación universitario, por una startup con presupuesto limitado, por cualquiera que tenga un problema de razonamiento específico que resolver. El coste de entrenamiento del modelo completo se estima entre 25.000 y 60.000 dólares, frente a los cientos de millones de los modelos frontera.
Tercera: el escalado sigue importando, pero ya no es la única respuesta. Esto es lo que más incomoda a la narrativa dominante del sector. El paper no dice que los modelos grandes sean inútiles. Dice que el razonamiento verificable tiene una estructura que permite compresión, y que explotar esa estructura mediante post-entrenamiento inteligente puede compensar órdenes de magnitud de diferencia en parámetros. Eso obliga a replantear dónde se invierte el presupuesto de compute: ¿en más parámetros o en mejores métodos de entrenamiento?
Las trampas que el paper no resuelve
Sería deshonesto presentar VibeThinker 3B como la solución definitiva sin señalar los límites reales.
El benchmark más honesto siempre es el que no está en el paper. AIME26 y LiveCodeBench son excelentes proxies de razonamiento matemático y de código, pero no cubren razonamiento causal en lenguaje natural, razonamiento sobre conocimiento del mundo real, ni tareas multimodales. Que el modelo rinda bien en esos benchmarks específicos no implica que sea el mejor agente de propósito general. OJBench, el benchmark de código más amplio, lo deja en 38,6, confirmando exactamente esa limitación.
La auto-destilación offline tiene un límite inherente: el modelo solo puede aprender de lo que ya es capaz de generar correctamente. Si hay tipos de problemas donde el modelo falla sistemáticamente, esas fallas no se corrigen con auto-destilación; se necesita señal externa. El método es potente para consolidar y comprimir, pero no para explorar terreno completamente nuevo.
El coste de inferencia con escalado, el escenario donde VibeThinker 3B llega a 97,1 en AIME26, no es gratuito. Generar múltiples soluciones y seleccionar la mejor multiplica el tiempo de inferencia y el coste por consulta. Para aplicaciones en tiempo real o con restricciones de latencia, ese tradeoff puede ser inaceptable.
Y finalmente: la reproducibilidad. El paper es de junio de 2026 y acaba de publicarse. Los resultados son los que son, pero hasta que otros grupos los reproduzcan de forma independiente con el código y los pesos publicados, hay que mantener el escepticismo metodológico que cualquier resultado extraordinario merece.
Dónde encaja esto en el mapa actual
El momento en que aparece VibeThinker 3B no es casual. El sector lleva meses con señales contradictorias: por un lado, los laboratorios grandes siguen apostando por escalar con modelos de cientos de miles de millones de parámetros; por otro, hay una presión creciente para demostrar que el compute tiene retorno de inversión real y no solo en benchmarks internos.
En ese contexto, un paper que demuestra resultados de estado del arte en razonamiento con 3.000 millones de parámetros y un método de post-entrenamiento que cualquier equipo con recursos moderados puede replicar es una señal importante. No de que los modelos grandes vayan a desaparecer, la parametric compression-coverage hypothesis explica exactamente por qué no, sino de que el espacio de soluciones es más rico de lo que la narrativa del escalado infinito sugiere.
La tendencia no es aislada. El predecesor VibeThinker-1.5B costó alrededor de 7.800 dólares en post-entrenamiento (noviembre de 2025). La evolución a 3B multiplica parámetros y rendimiento manteniendo una fracción del coste de los modelos frontera. Junto a otros equipos que apuestan por modelos compactos con post-entrenamiento sofisticado y licencias abiertas, está quedando claro que el monopolio del razonamiento de alta calidad no pertenece exclusivamente a quien tiene más compute.
El escalado sigue importando. Pero ya no es la única respuesta. Y eso, para cualquiera que construya sistemas con IA sin presupuesto ilimitado, cambia bastante las cuentas.
Preguntas frecuentes
¿Qué es VibeThinker 3B y para qué sirve?
VibeThinker 3B es un modelo de razonamiento de código abierto con 3.000 millones de parámetros, desarrollado por investigadores de Sina Weibo Inc. y lanzado en junio de 2026. Está diseñado exclusivamente para tareas con señales de verificación claras: matemáticas competitivas, programación, razonamiento STEM e instrucciones con restricciones explícitas. No es un modelo de propósito general.
¿Cómo consigue VibeThinker 3B superar a modelos mucho más grandes?
Mediante el método Spectrum-to-Signal: una combinación de ajuste supervisado curricular, aprendizaje por refuerzo multi-dominio sobre señales verificables y auto-destilación offline. El resultado es que el modelo aprende estrategias de razonamiento generalizables en lugar de memorizar trucos específicos de dominio.
¿Cuánto cuesta entrenar un modelo como VibeThinker 3B?
El coste de entrenamiento de VibeThinker 3B se estima entre 25.000 y 60.000 dólares, frente a los cientos de millones de los modelos frontera. El predecesor VibeThinker-1.5B costó aproximadamente 7.800 dólares en post-entrenamiento, lo que ilustra la tendencia hacia modelos compactos de alto rendimiento con presupuestos manejables.
¿Puedo usar VibeThinker 3B en local o en mis propios proyectos?
Sí. Los pesos están disponibles en Hugging Face y GitHub con licencia MIT, que permite uso comercial, fine-tuning y despliegue sin restricciones. Al tener solo 3.000 millones de parámetros, puede ejecutarse en una GPU de consumo de gama media sin infraestructura de cloud, lo que garantiza además privacidad de datos al no depender de APIs externas.
Fuentes
- I can't help rooting for tiny open source AI model maker Arcee | TechCrunch
- This AI knew the answers but didn’t understand the questions
- ChatGPT’s new ‘Thinking’ mode just hit a 94% reasoning score — 7 prompts it can solve that standard AI can’t
- General-purpose large language models outperform specialized clinical AI tools on medical benchmarks - Nature Medicine