Entre el modelo ganador y el más eficiente hay una gran diferencia en los costos.
Estamos en un momento en que todas las semanas están apareciendo nuevos modelos LLM y las camapañas de marketing de las tecnológicas lo publicitan como «el mejor modelo», lo que ha generado muchas preguntas a la hora de cuál usar, ya que hay múltiples rankings y para todos los gustos. En la gráfica siguiente, muestra un pequeño arbol genelógico de los modelos LLM’s con sus versiones existentes a la fecha.
A raiz de esto, hice un pequeño ejercicio para poderlos ordenar (lo hice solo para el top 10), usando los datos de LiveBench, uno de los benchmarks disponibles más reconocidos. El principal atributo de LiveBenh es que utiliza preguntas que se van modificando para evitar contaminación y lo crucé con los costos de cada modelo de tres formas diferentes (precio de lista, tarea exitosa y frontera de Pareto). Otros benchmarks que mantienen sus preguntas en el tiempo, los fabricantes entrenan sus modelos para que tengan buenos resultados.
Debo destacar que no existe el«mejor modelo», ya que desempeño y costo no son las únicas variables a evaluar, hay otras dimensiones: abierto vs cerrado, políticas de privacidad, etc., pero me pareció que esto podía ser un inicio al momento de analizar los diferentes modelos existentes y que seguramente seguirán aumentando.
Alternativa 1: Precio de lista
En primer lugar tomar el puntaje del benchmark y usar el precio por millón de tokens que publica cada proveedor, normalizar costo y desempeño ponderarlos. Para ponderar utilice una cifra arbitraria de 70% de desempeño y 30% de costo, proporción bastante usual en procesos de evaluación técnico-económica. En todo caso a modo de sensibilizar hice el análisis moviendo la ponderación de 70/30 a 80/20, y el top 5 no cambió mucho.
Con los 10 mejores modelos del release de junio de 2026 de LiveBench, el resultado sorprende: los modelos más famosos quedan al fondo de la tabla. Claude Fable 5, que lidera el benchmark en desempeño puro (83,4 puntos), cae al noveno lugar del ranking: cuesta 5 a 10 veces más que los líderes en valor, por una ventaja de apenas 4 a 5 puntos de benchmark. Arriba quedan los modelos de bajo costo con desempeño, tales como: Muse Spark 1.2 de Meta y Qwen3.8 Max de Alibaba.
El problema con esta forma de categorizar, el precio de lista no identifica cuántos tokens consume un modelo para resolver algo, que es lo que finalmente le interesa a un usuario final.
Alternativa 2: Tarea exitosa
LiveBench publica para un subconjunto de modelos una métrica mucho más interesante: el costo por tarea exitosa. Esta métrica se calcula en dos pasos.
El costo medido por pregunta: los tokens que el modelo efectivamente consumió al correr el benchmark, incluyendo todo el «razonamiento» interno, multiplicados por su tarifa.
Ese costo se divide por la tasa de éxito.
La fórmula captura tres cosas que el precio de lista ignora: cuánto cobra el proveedor por token, cuántos tokens gasta el modelo para resolver algo, y qué fracción de ese gasto se traduce en respuestas correctas.
Con esta métrica (disponible para el release de enero de 2026), el ranking cambia de nuevo y aparece un caso notable: DeepSeek V4 Pro. Es el modelo cuyas salidas (output) son más extensas, en el dataset de enero-2026, el modelo con la mayor cantidad de tokens de salids es DeepSeek (33.261 tokens de salida promedio por pregunta), bastante mayor que el que le sigue, con una tarifa por tarea exitoso es de US$ 0,039 siendo el que le sigue tiene un costo de US$ 0,12.
La lección para quien evalúa adopción de IA: un modelo «caro por token» que responde conciso y acierta mucho puede salir más barato que uno «barato por token» que divaga y falla. Solo el costo por tarea exitosa lo revela.
Alternativa 3: Frontera de Pareto (no ponderar)
La tercera alternativa es la que usan algunos evaluadores independientes, como Artificial Analysisno ponderar nada. Se grafica desempeño contra costo y se marca la frontera eficiente: los modelos para los cuales no existe otro más barato e igual de bueno. Todo lo que queda bajo la frontera está dominado, hay una opción mejor y más barata, y todo lo que está sobre ella es una elección legítima según el presupuesto.
En mi ejercicio, siete de diez modelos quedaron en la frontera, desde DeepSeek V4 Pro en el extremo económico hasta GPT-5.5 en el extremo de máximo desempeño. La gracia de este enfoque es que elimina el ponderador y cada persona puede tomar una decisión.
La reflexión de fondo
Algunas reflexiones para organizaciones que están definiendo sus estrategias de adopción de IA, el mensaje es incómodo pero necesario: desconfíen de cualquier ranking que no explicite su metodología, su fecha de corte y su tratamiento del costo.
Estás viendo un contenido de marcador de posición de Facebook. Para acceder al contenido real, haz clic en el siguiente botón. Ten en cuenta que al hacerlo compartirás datos con terceros proveedores.
Estás viendo un contenido de marcador de posición de Instagram. Para acceder al contenido real, haz clic en el siguiente botón. Ten en cuenta que al hacerlo compartirás datos con terceros proveedores.
Estás viendo un contenido de marcador de posición de X. Para acceder al contenido real, haz clic en el siguiente botón. Ten en cuenta que al hacerlo compartirás datos con terceros proveedores.