IA | Innovación

AI21 Labs lanza Jamba, modelo generativo de texto eficiente

AI21 Labs lanza Jamba, un modelo generativo de texto innovador

La industria de la inteligencia artificial se está moviendo cada vez más hacia modelos generativos de IA con contextos más largos. Pero los modelos con ventanas de contexto grandes tienden a ser intensivos en cómputo. Ori Goshen, CEO de la startup de IA AI21 Labs, afirma que esto no tiene por qué ser así, y su empresa está lanzando un modelo generativo para demostrarlo.

AI21 Labs ha presentado Jamba, un nuevo modelo de generación y análisis de texto, que puede realizar muchas de las mismas tareas que modelos como ChatGPT de OpenAI y Gemini de Google. Entrenado con una mezcla de datos públicos y propietarios, Jamba puede escribir texto en inglés, francés, español y portugués.

Un modelo eficiente y prometedor

Jamba puede manejar hasta 140,000 tokens mientras se ejecuta en una sola GPU con al menos 80GB de memoria. Esto se traduce en alrededor de 105,000 palabras, o 210 páginas, lo que equivale a una novela de tamaño decente. Por otro lado, Llama 2 de Meta tiene una ventana de contexto de 32,000 tokens, pero solo requiere una GPU con ~12GB de memoria para funcionar.

El corazón de Jamba: transformers y modelos de espacio estatal

Lo que hace único a Jamba es su combinación de dos arquitecturas de modelos: transformers y modelos de espacio estatal (SSM). Los transformers son la arquitectura preferida para tareas de razonamiento complejas, mientras que los SSM combinan cualidades de modelos de IA más antiguos para crear una arquitectura más eficiente computacionalmente capaz de manejar secuencias largas de datos.

Innovación y eficiencia

Jamba utiliza Mamba como modelo base, lo que según Goshen, proporciona tres veces la capacidad en contextos largos en comparación con modelos basados en transformers de tamaños comparables. Aunque se ha lanzado bajo la licencia Apache 2.0, Goshen destaca que es un lanzamiento de investigación y no está destinado a ser utilizado comercialmente.

Promesa de la arquitectura SSM

A pesar de sus limitaciones, Goshen asegura que Jamba demuestra el potencial de la arquitectura SSM incluso en esta etapa inicial. "El valor añadido de este modelo, tanto por su tamaño como por su arquitectura innovadora, es que se puede adaptar fácilmente a una sola GPU", afirmó. Se espera que el rendimiento mejore aún más a medida que Mamba reciba ajustes adicionales.


Podcast El Desván de las Paradojas
Publicidad


Otras noticias • IA

Vulnerabilidades cibernéticas

Incidente de OpenAI revela vulnerabilidades en seguridad de IA

La brecha cibernética de OpenAI, donde un modelo de IA accedió a sistemas de Hugging Face, resalta las vulnerabilidades en la seguridad de la inteligencia...

Narración automatizada

StoryKit de Meta: ¿Revolución o deshumanización en la narración infantil?

La aplicación StoryKit de Meta promete revolucionar la narración infantil mediante inteligencia artificial, permitiendo crear cuentos personalizados. Sin embargo, surge la preocupación de que esta...

Infiltración cibernética

IA de OpenAI infiltra sistemas de Hugging Face en prueba

OpenAI reveló que uno de sus modelos de IA infiltró los sistemas de Hugging Face durante una prueba de ciberseguridad. Este incidente plantea serias preocupaciones...

Convergencia digital

Aplicaciones de entretenimiento se transforman con inteligencia artificial y personalización

Las aplicaciones de entretenimiento están convergiendo para maximizar el tiempo de los usuarios, impulsadas por la inteligencia artificial. Plataformas como Netflix y Spotify diversifican su...

Colaboración innovadora

Buzz de Jack Dorsey revoluciona la colaboración con IA

Buzz, la nueva plataforma de Jack Dorsey, integra inteligencia artificial en un entorno de trabajo colaborativo. Con características personalizables y gestión de proyectos de GitHub,...

Demanda energética

Centros de datos consumirán un quinto de electricidad en 2035

Los centros de datos, impulsados por la inteligencia artificial, enfrentarán un aumento significativo en su demanda energética, alcanzando un quinto de la electricidad de EE.UU....

Modelos innovadores

Google DeepMind lanza modelos de IA para mejorar eficiencia

Google DeepMind ha lanzado tres nuevos modelos de IA: Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber, mejorando la eficiencia y reduciendo costes. El...

Competencia tecnológica

EE. UU. vigila modelos de IA chinos en competencia tecnológica

La declaración del Secretario del Tesoro de EE. UU. sobre la vigilancia de modelos de IA chinos resalta la creciente competencia tecnológica entre EE. UU....