Modelos pequeños y eficientes: ¿el futuro del razonamiento automático?
Hace años que los modelos de inteligencia artificial crecen sin parar. Pero una startup llamada Pathway acaba de demostrar que el tamaño no siempre determina el resultado. Su modelo BDH-CQ, con apenas 150 millones de parámetros, obtiene un rendimiento cercano al de sistemas mucho más grandes y lo hace a una fracción del coste.
Los números hablan por sí solos. En la prueba de razonamiento ARC-AGI-1, BDH-CQ alcanzó el 29,5%, mientras que GPT 5.6 Luna logró el 34,2%. La diferencia de rendimiento es pequeña. El coste, en cambio, no: 0,0007 dólares por tarea frente a 0,008 dólares. Eso significa que el modelo de Pathway sale once veces más barato, incluso después de que OpenAI redujera sus precios un 80% en julio.
¿Cómo lo consigue? Aquí entra en juego un detalle técnico importante. Muchos sistemas de razonamiento generan pasos intermedios antes de darte la respuesta final, un proceso que se conoce como «pensar en voz alta». BDH-CQ funciona de forma distinta: realiza el razonamiento de forma interna, sin producir esos textos intermedios. Eso reduce drásticamente el consumo de tokens, que es lo que al final determina tu factura.
Según la CEO de Pathway, el coste elevado del razonamiento no viene impuesto por ninguna ley física de la inteligencia artificial, sino por cómo están diseñados estos sistemas. En otras palabras: otros modelos podrían ser más eficientes si sus arquitecturas estuvieran pensadas de otro modo.
¿Es realmente competitivo frente a los mejores?
Antes de entusiasmarse, conviene poner las cosas en perspectiva. Claude Opus 5 y Gemini 3.1 Pro alcanzan entre el 97% y el 98% en la misma prueba. La diferencia con BDH-CQ es enorme. No es lo mismo un modelo que razona bien en ciertos casos que uno que lo hace de forma consistente y fiable en casi cualquier situación.
Dicho esto, hay un elemento que sí cambia el juego: el coste por tarea. Si tu empresa necesita procesar millones de consultas, la diferencia se multiplica. BDH-CQ también superó a Qwen3 235B, el modelo de Alibaba, que obtuvo peor puntuación y costó más del triple por cada respuesta. Es decir, más parámetros no garantizaban mejor relación entre precio y rendimiento.
Este debate sobre la eficiencia lleva meses presente. DeepSeek V4 ya demostró que era posible reducir costes sin sacrificar la calidad, y ahora vuelve a aparecer desde otro ángulo. La pregunta es esencialmente práctica: ¿cuánto cuesta realmente cada respuesta cuando tienes que servir decenas de millones de peticiones?
Para empresas que pagan la infraestructura, esto importa. Incluso si un modelo no es el más capaz, un uso intensivo con un precio bajo puede cambiar completamente las cuentas frente a un modelo más potente pero también más caro. Por eso figuras como Nicolas Tarducci, de AWS, señalan la importancia de llevar el razonamiento avanzado «de la experimentación a producción», donde lo que prevalece es el rendimiento, la eficiencia y la escalabilidad.
Pathway probará ahora su modelo en pruebas más exigentes: matemáticas, ARC-AGI-2 y ARC-AGI-3. Veremos si esa ventaja de coste se sostiene cuando suben las exigencias.
