infografía de las modalidades de evaluación entre modelos de lenguaje LLM

¿Qué modelo de lenguaje elegir?

infografía de las modalidades de evaluación entre modelos de lenguaje LLM

Entre el modelo ganador y el más eficiente hay una gran diferencia en los costos.

Estamos en un momento en que todas las semanas están apareciendo nuevos modelos LLM y las camapañas de marketing de las tecnológicas lo publicitan como «el mejor modelo», lo que ha generado muchas preguntas a la hora de cuál usar, ya que hay múltiples rankings y para todos los gustos. En la gráfica siguiente, muestra un pequeño arbol genelógico de los modelos LLM’s con sus versiones existentes a la fecha.


árbol genealógico de los modelos de lenguaje


A raiz de esto, hice un pequeño ejercicio para poderlos ordenar (lo hice solo para el top 10), usando los datos de LiveBench,  uno de los benchmarks disponibles más reconocidos. El principal atributo de LiveBenh es que utiliza preguntas que se van modificando para evitar contaminación y lo crucé con los costos de cada modelo de tres formas diferentes (precio de lista, tarea exitosa y frontera de Pareto). Otros benchmarks que mantienen sus preguntas en el tiempo, los fabricantes entrenan sus modelos para que tengan buenos resultados.


Debo destacar que no existe el «mejor modelo», ya que desempeño y costo no son las únicas variables a evaluar, hay otras dimensiones: abierto vs cerrado, políticas de privacidad, etc., pero me pareció que esto podía ser un inicio al momento de analizar los diferentes modelos existentes y que seguramente seguirán aumentando.



Alternativa 1: Precio de lista

En primer lugar tomar el puntaje del benchmark y usar el precio por millón de tokens que publica cada proveedor, normalizar costo y desempeño ponderarlos. Para ponderar utilice una cifra arbitraria de 70% de desempeño y 30% de costo, proporción bastante usual en procesos de evaluación técnico-económica.  En todo caso a modo de sensibilizar hice el análisis moviendo la ponderación de 70/30 a 80/20, y el top 5 no cambió mucho.

Con los 10 mejores modelos del release de junio de 2026 de LiveBench, el resultado sorprende: los modelos más famosos quedan al fondo de la tabla. Claude Fable 5, que lidera el benchmark en desempeño puro (83,4 puntos), cae al noveno lugar del ranking: cuesta 5 a 10 veces más que los líderes en valor, por una ventaja de apenas 4 a 5 puntos de benchmark. Arriba quedan los modelos de bajo costo con desempeño, tales como: Muse Spark 1.2 de Meta y Qwen3.8 Max de Alibaba.

El problema con esta forma de categorizar, el precio de lista no identifica cuántos tokens consume un modelo para resolver algo, que es lo que finalmente le interesa a un usuario final.


Alternativa 2: Tarea exitosa

LiveBench publica para un subconjunto de modelos una métrica mucho más interesante: el costo por tarea exitosa. Esta métrica se calcula en dos pasos.

  1. El costo medido por pregunta: los tokens que el modelo efectivamente consumió al correr el benchmark, incluyendo todo el «razonamiento» interno, multiplicados por su tarifa.
  2. Ese costo se divide por la tasa de éxito.

La fórmula captura tres cosas que el precio de lista ignora: cuánto cobra el proveedor por token, cuántos tokens gasta el modelo para resolver algo, y qué fracción de ese gasto se traduce en respuestas correctas.

Con esta métrica (disponible para el release de enero de 2026), el ranking cambia de nuevo y aparece un caso notable: DeepSeek V4 Pro. Es el modelo cuyas salidas (output) son más extensas, en el dataset de enero-2026, el modelo con la mayor cantidad de tokens de salids es DeepSeek (33.261 tokens de salida promedio por pregunta), bastante mayor que el que le sigue, con una tarifa por tarea exitoso es de US$ 0,039 siendo el que le sigue tiene un costo de US$ 0,12.

La lección para quien evalúa adopción de IA: un modelo «caro por token» que responde conciso y acierta mucho puede salir más barato que uno «barato por token» que divaga y falla. Solo el costo por tarea exitosa lo revela.


ranking ponderado de los modelos de IA



Alternativa 3: Frontera de Pareto (no ponderar)

La tercera alternativa es la que usan algunos evaluadores independientes, como Artificial Analysis no ponderar nada. Se grafica desempeño contra costo y se marca la frontera eficiente: los modelos para los cuales no existe otro más barato e igual de bueno. Todo lo que queda bajo la frontera está dominado, hay una opción mejor y más barata, y todo lo que está sobre ella es una elección legítima según el presupuesto.

En mi ejercicio, siete de diez modelos quedaron en la frontera, desde DeepSeek V4 Pro en el extremo económico hasta GPT-5.5 en el extremo de máximo desempeño. La gracia de este enfoque es que elimina el ponderador y cada persona puede tomar una decisión.




La reflexión de fondo

Algunas reflexiones para organizaciones que están definiendo sus estrategias de adopción de IA, el mensaje es incómodo pero necesario: desconfíen de cualquier ranking que no explicite su metodología, su fecha de corte y su tratamiento del costo.



La diferencia entre «el mejor modelo» y «el mejor modelo para tu caso de uso y presupuesto» puede ser una gran diferencia, como muestra este ejercicio. Y esa diferencia, escalada a millones de transacciones de una organización grande, es la diferencia entre un proyecto viable y uno que se gasta todo el presupuesto en poco tiempo.

Como siempre en tecnología,

la pregunta correcta no es: «¿cuál es el mejor?»

sino

¿mejor para qué, a qué costo?

Comparte este artículo en

Deja un comentario:

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.