El alto coste del benchmarking en modelos de inteligencia artificial
En la era actual, la inteligencia artificial (IA) ha pasado de ser un concepto futurista a una herramienta omnipresente en diversas industrias. Sin embargo, a medida que esta tecnología avanza, también lo hacen los desafíos asociados a su evaluación y comparación. Un aspecto crucial de este proceso es el benchmarking, que se refiere a la práctica de medir el rendimiento de un modelo de IA frente a un conjunto de estándares predefinidos. Este proceso ha revelado una tendencia alarmante: los modelos de IA que incorporan capacidades de razonamiento son significativamente más caros de evaluar que sus homólogos que no lo hacen.
La disparidad de costes en la evaluación
Los datos recientes de Artificial Analysis, una firma independiente dedicada a la evaluación de IA, destacan esta problemática. Por ejemplo, evaluar el modelo de razonamiento o1 de OpenAI costó la asombrosa cifra de $2,767.05, mientras que el modelo Claude 3.7 Sonnet de Anthropic, considerado un modelo "híbrido" de razonamiento, tuvo un coste de $1,485.35 en pruebas similares. En comparación, los modelos de IA que no utilizan razonamiento, como el o3-mini de OpenAI, resultaron mucho más asequibles, con un coste de $344.59.
Este desajuste en los costes plantea interrogantes sobre la accesibilidad y la equidad en el desarrollo de IA.
La tendencia se mantiene incluso entre modelos de razonamiento más pequeños. El modelo o1-mini de OpenAI, por ejemplo, costó $141.22 para su evaluación, una cifra relativamente baja en comparación con otros modelos de razonamiento. Sin embargo, cuando se observa el panorama general, la evaluación de los modelos de razonamiento resulta ser casi el doble de cara que la de los modelos no razonantes. Este aumento en los costes no solo afecta a las empresas de IA, sino que también limita la capacidad de los investigadores académicos para replicar resultados y avanzar en el campo.
¿Por qué son tan caros los modelos de razonamiento?
La razón principal detrás de los altos costes de evaluación de los modelos de razonamiento se encuentra en la cantidad de tokens que generan durante las pruebas. Los tokens son fragmentos de texto que un modelo produce, y cada palabra o parte de una palabra cuenta como un token. Según los datos de Artificial Analysis, el modelo o1 de OpenAI generó más de 44 millones de tokens durante las pruebas, en comparación con los aproximadamente 5.5 millones de tokens producidos por el modelo GPT-4o. Este incremento en la generación de tokens implica un mayor coste para las empresas, ya que la mayoría cobra por el uso del modelo en función de la cantidad de tokens procesados.
La complejidad de las pruebas también juega un papel crucial en el coste. Los benchmarks modernos suelen involucrar tareas que requieren múltiples pasos y habilidades complejas, como escribir y ejecutar código, navegar por Internet y utilizar ordenadores. Jean-Stanislas Denain, investigador sénior en Epoch AI, menciona que, aunque el número de preguntas por benchmark ha disminuido, la complejidad de las preguntas ha aumentado, lo que provoca que los modelos generen más tokens y, por lo tanto, incurra en costes más elevados.
Impacto en la investigación y el desarrollo
El elevado coste del benchmarking no solo afecta a las empresas de IA, sino que también plantea serias dificultades para la comunidad académica. Ross Taylor, CEO de la startup General Reasoning, compartió su experiencia al gastar $580 evaluando el modelo Claude 3.7 Sonnet en alrededor de 3,700 prompts únicos. Además, estima que realizar una única evaluación completa de MMLU Pro, un conjunto de preguntas diseñado para medir las habilidades de comprensión del lenguaje, habría costado más de $1,800.
La creciente brecha entre los recursos disponibles para las empresas y los académicos podría llevar a una falta de reproducibilidad en los resultados de investigación.
Taylor advierte que estamos avanzando hacia un mundo donde las evaluaciones de los laboratorios no se pueden replicar debido a los altos costes asociados. Este fenómeno podría crear una desigualdad en el acceso a la tecnología y limitar la capacidad de los investigadores para validar y construir sobre el trabajo de otros. La pregunta que surge es: ¿cómo se puede garantizar que los resultados de la IA sean accesibles y verificables por todos?
El dilema de la transparencia
Otro aspecto crítico relacionado con los altos costes de benchmarking es la transparencia. Muchas empresas de IA, incluyendo OpenAI, ofrecen acceso gratuito o subvencionado a sus modelos para fines de evaluación. Sin embargo, este enfoque puede influir en los resultados de las pruebas, lo que genera dudas sobre la integridad de los datos obtenidos. Taylor plantea una cuestión fundamental: "Desde un punto de vista científico, si publicas un resultado que nadie puede replicar con el mismo modelo, ¿es realmente ciencia?" Esta incertidumbre pone en jaque la validez de las evaluaciones y podría dañar la credibilidad de la comunidad científica.
La necesidad de un cambio
Ante esta situación, la comunidad de IA se enfrenta a un dilema: la necesidad de equilibrar el progreso tecnológico con la accesibilidad y la reproducibilidad. George Cameron, cofundador de Artificial Analysis, ha declarado que la organización planea aumentar su presupuesto para el benchmarking a medida que más laboratorios de IA desarrollen modelos de razonamiento. Este aumento en la inversión es un indicativo de la creciente importancia de la evaluación rigurosa en el campo de la IA.
A medida que se desarrollan modelos más complejos y sofisticados, es esencial que las organizaciones encuentren maneras de mitigar los costes de evaluación. La implementación de estándares más accesibles y la creación de colaboraciones entre empresas y académicos podrían ser un paso en la dirección correcta. La comunidad debe trabajar unida para garantizar que el desarrollo de la IA sea inclusivo y sostenible, permitiendo que tanto investigadores como empresas avancen en este campo emocionante y en constante evolución.
Un futuro incierto
A medida que los modelos de IA continúan evolucionando, también lo hará el paisaje del benchmarking. Es probable que surjan nuevos modelos y enfoques de evaluación, lo que podría alterar la dinámica actual de costes y accesibilidad. Sin embargo, la pregunta permanece: ¿será suficiente esta evolución para garantizar que la IA sea una herramienta accesible y verificable para todos?
El futuro del benchmarking en inteligencia artificial está lleno de desafíos y oportunidades. Si bien los costes actuales pueden ser prohibitivos, la comunidad de IA tiene la capacidad de adaptarse y encontrar soluciones que beneficien a todos. La clave estará en la colaboración, la innovación y el compromiso con la transparencia en el desarrollo y la evaluación de estos modelos.
Otras noticias • IA
Rox revoluciona ventas con IA y alcanza 1.200 millones
Rox, una startup valorada en 1.200 millones de dólares, utiliza agentes de IA para optimizar las operaciones de ventas, integrándose en sistemas como Salesforce y...
Tinder lanza nuevas funciones para citas rápidas y seguras
Tinder ha presentado innovaciones como una pestaña de Eventos para fomentar encuentros en persona y citas rápidas por video. También incorpora inteligencia artificial para personalizar...
Facebook Marketplace mejora experiencia con nuevas funciones de IA
Facebook Marketplace ha introducido nuevas funciones impulsadas por IA, como respuestas automáticas y listados simplificados, para mejorar la experiencia de vendedores y compradores. Estas innovaciones...
Grammarly enfrenta críticas por uso indebido de nombres de expertos
La controversia sobre la función “Expert Review” de Grammarly ha generado críticas por el uso no autorizado de nombres de expertos, como Julia Angwin y...
Bumble lanza "Bee", su asistente de inteligencia artificial para citas
Bumble está introduciendo un asistente de inteligencia artificial generativa llamado "Bee" para personalizar la experiencia de citas, mejorando las coincidencias y fomentando interacciones significativas. Esta...
Gumloop transforma la automatización empresarial con IA accesible
Gumloop, cofundada por Max Brodeur-Urbas, empodera a empleados no técnicos para automatizar tareas mediante IA. Su plataforma ha revolucionado la productividad en empresas como Shopify...
Wonderful recauda 150 millones y se valora en 2.000 millones
La startup israelí Wonderful ha recaudado 150 millones de dólares, alcanzando una valoración de 2.000 millones. Su plataforma de inteligencia artificial para atención al cliente...
Amazon lanza Alexa "Sassy" con humor mordaz para adultos
Amazon ha introducido una nueva personalidad "Sassy" para Alexa, destinada a adultos y caracterizada por un humor mordaz. Esta opción busca diversificar la interacción, reflejando...
Lo más reciente
- 1
Peacock revoluciona streaming con IA y contenido móvil innovador
- 2
Uber lanza robotaxis autónomos de Motional en Las Vegas
- 3
Truecaller lanza alerta familiar contra llamadas fraudulentas globalmente
- 4
QuTwo revoluciona la IA cuántica con innovadora plataforma híbrida
- 5
Alexa lanza personalidad "Sassy" para interacciones más humanas
- 6
Bumble lanza "Bee", su asistente AI para citas personalizadas
- 7
Nvidia revela innovaciones en IA y hardware en GTC 2023

