AI21 Labs lanza Jamba, un modelo generativo de texto innovador
La industria de la inteligencia artificial se está moviendo cada vez más hacia modelos generativos de IA con contextos más largos. Pero los modelos con ventanas de contexto grandes tienden a ser intensivos en cómputo. Ori Goshen, CEO de la startup de IA AI21 Labs, afirma que esto no tiene por qué ser así, y su empresa está lanzando un modelo generativo para demostrarlo.
AI21 Labs ha presentado Jamba, un nuevo modelo de generación y análisis de texto, que puede realizar muchas de las mismas tareas que modelos como ChatGPT de OpenAI y Gemini de Google. Entrenado con una mezcla de datos públicos y propietarios, Jamba puede escribir texto en inglés, francés, español y portugués.
Un modelo eficiente y prometedor
Jamba puede manejar hasta 140,000 tokens mientras se ejecuta en una sola GPU con al menos 80GB de memoria. Esto se traduce en alrededor de 105,000 palabras, o 210 páginas, lo que equivale a una novela de tamaño decente. Por otro lado, Llama 2 de Meta tiene una ventana de contexto de 32,000 tokens, pero solo requiere una GPU con ~12GB de memoria para funcionar.
El corazón de Jamba: transformers y modelos de espacio estatal
Lo que hace único a Jamba es su combinación de dos arquitecturas de modelos: transformers y modelos de espacio estatal (SSM). Los transformers son la arquitectura preferida para tareas de razonamiento complejas, mientras que los SSM combinan cualidades de modelos de IA más antiguos para crear una arquitectura más eficiente computacionalmente capaz de manejar secuencias largas de datos.
Innovación y eficiencia
Jamba utiliza Mamba como modelo base, lo que según Goshen, proporciona tres veces la capacidad en contextos largos en comparación con modelos basados en transformers de tamaños comparables. Aunque se ha lanzado bajo la licencia Apache 2.0, Goshen destaca que es un lanzamiento de investigación y no está destinado a ser utilizado comercialmente.
Promesa de la arquitectura SSM
A pesar de sus limitaciones, Goshen asegura que Jamba demuestra el potencial de la arquitectura SSM incluso en esta etapa inicial. "El valor añadido de este modelo, tanto por su tamaño como por su arquitectura innovadora, es que se puede adaptar fácilmente a una sola GPU", afirmó. Se espera que el rendimiento mejore aún más a medida que Mamba reciba ajustes adicionales.
Otras noticias • IA
Google facilita la transición a Gemini con nuevas herramientas
Google ha lanzado herramientas que permiten a los usuarios transferir memorias y historiales de chat a su asistente Gemini, facilitando la transición desde otros chatbots....
OpenAI pausa modo erótico y prioriza proyectos empresariales y militares
OpenAI ha pausado el controvertido modo "erótico" de ChatGPT y ha depriorizado otros proyectos, centrándose en áreas más relevantes como soluciones empresariales y militares. Esta...
Senadores piden datos para regular consumo energético de centros de datos
La preocupación por el consumo energético de los centros de datos ha crecido en EE.UU., impulsando a senadores a solicitar a la EIA datos específicos...
ByteDance lanza Dreamina Seedance 2.0 para crear vídeos fácilmente
ByteDance ha lanzado Dreamina Seedance 2.0, una herramienta de IA que facilita la creación de vídeos mediante descripciones textuales. Con su expansión en mercados clave,...
Cohere lanza Transcribe, revolucionando el reconocimiento de voz ligero
Cohere ha lanzado Transcribe, un modelo de reconocimiento de voz de código abierto y ligero, que admite 14 idiomas y procesa 525 minutos de audio...
Vigilancia tecnológica: ¿seguridad o violación de la privacidad?
La tecnología de vigilancia enfrenta un debate ético sobre privacidad y seguridad. Empresas como Conntour destacan por su enfoque selectivo y ético, utilizando inteligencia artificial...
Mistral lanza Voxtral TTS, revolucionando la comunicación empresarial
Mistral ha lanzado Voxtral TTS, un innovador modelo de texto a voz que soporta nueve idiomas y permite personalización rápida. Optimizado para rendimiento en tiempo...
Inteligencia artificial genera temor a pérdida de empleos laborales
La rápida evolución de la inteligencia artificial genera incertidumbre laboral, con un aumento del temor a la pérdida de empleos. Propuestas como gravar centros de...
Lo más reciente
- 1
Waymo logra 500,000 viajes semanales pero enfrenta grandes desafíos
- 2
SK hynix planea cotizar en EE. UU. para atraer inversores
- 3
Aetherflux busca revolucionar energía solar espacial con financiación millonaria
- 4
Hackeo al director del FBI revela vulnerabilidad cibernética estadounidense
- 5
Apple refuerza ciberseguridad con el Lockdown Mode eficaz
- 6
Juez apoya a Anthropic en disputa sobre regulación de IA
- 7
David Sacks deja cargo en Trump y asume nuevo rol

