La asistente de inteligencia artificial generativa ChatGPT, una de las grandes victorias tecnológicas de los últimos tiempos, está evolucionando para incorporar funciones de voz e imagen a sus capacidades, según anunció OpenAI. Hasta ahora, ChatGPT ha permitido a los usuarios generar ensayos, poemas y resúmenes a partir de simples comandos de texto. Sin embargo, pronto será posible tener una conversación de voz con el chatbot, haciendo que la interacción sea aún más dinámica.
La guerra de la IA generativa
El anuncio llega el mismo día en que Amazon se compromete a invertir hasta 4.000 millones de dólares en Anthropic, rival de OpenAI. Esta decisión forma parte de una batalla más amplia en el ámbito de la inteligencia artificial generativa, en la que participan gigantes tecnológicos como Google con su chatbot Bard, Meta adoptando una firme filosofía de código abierto para ganar ventaja, y Microsoft estrechando lazos con OpenAI.
Avance en la conversación
Hoy marca una evolución notable para el movimiento de la IA generativa, con OpenAI combinando el mundo familiar de los asistentes de voz con sus potentes modelos de lenguaje grande (LLM).
Por ejemplo, un usuario podrá pedir verbalmente a ChatGPT que invente un cuento para dormir al instante, con algunos comandos de voz para guiar la narrativa. O simplemente, el usuario puede hacerle una pregunta, obteniendo la respuesta de ChatGPT en forma hablada.
Además, los usuarios de ChatGPT podrán buscar respuestas usando imágenes, subiendo una foto de algo y pidiendo a ChatGPT que explique qué es, o que proporcione instrucciones para alcanzar un objetivo.
Nuevas voces para ChatGPT
La función de voz se alimenta de un nuevo modelo de texto a voz que puede generar voces humanas a partir de texto y algunos segundos de voz muestreada. OpenAI ha trabajado con actores de voz profesionales para crear cinco voces diferentes, utilizando su sistema de reconocimiento de voz de código abierto Whisper para transcribir las expresiones verbales en texto.
Spotify también se reveló como un socio de lanzamiento, introduciendo una nueva característica para los podcasters que les permite muestrear su voz y traducir sus programas del inglés al español, francés o alemán, manteniendo su propia voz original. Sin embargo, OpenAI está siendo cautelosa para evitar críticas, ya que no está poniendo esta tecnología a disposición de cualquiera. Ha trabajado específicamente con podcasters como Dax Shepard, Monica Padman, Lex Fridman, Bill Simmons y Steven Bartlett para el lanzamiento.
"La nueva tecnología de voz, capaz de crear voces sintéticas realistas a partir de unos pocos segundos de habla real, abre puertas a muchas aplicaciones creativas y centradas en la accesibilidad", escribió la empresa en una entrada de blog. "Sin embargo, estas capacidades también presentan nuevos riesgos, como la posibilidad de que actores malintencionados suplanten a figuras públicas o cometan fraudes".
Las nuevas funciones comenzarán a desplegarse para los suscriptores de pago Plus y Enterprise en las próximas dos semanas. Para activar las funciones de voz, los usuarios deben ir al menú "configuración" en la aplicación, luego a "nuevas funciones" y optar por las conversaciones de voz. Luego deben tocar el botón de auriculares en la esquina superior derecha y seleccionar la voz que desean.
La función de voz estará limitada inicialmente a las aplicaciones ChatGPT para Android e iOS en una base de beta opt-in, mientras que la búsqueda de imágenes se implementará en todas las plataformas por defecto.
Otras noticias • IA
AirTrunk invierte 30.000 millones en India para centros de datos
La inversión de AirTrunk de 30.000 millones de dólares en India para desarrollar 5GW de centros de datos destaca el potencial del país como epicentro...
Mira Murati resalta la evolución humana de la IA
Mira Murati, CEO de Thinking Machines Lab, destaca la evolución de la IA y la importancia de modelos de interacción más humanos. Enfrentando desafíos como...
Anthropic alcanza valoración de 965.000 millones tras recaudar 65.000 millones
Anthropic ha recaudado 65.000 millones de dólares, alcanzando una valoración de 965.000 millones. La cofundadora, Daniela Amodei, destaca la necesidad de capital para seguir innovando....
StrictlyVC Los Ángeles: Innovaciones en tecnología y capital de riesgo
El evento StrictlyVC en Los Ángeles, programado para el 18 de junio, reunirá a líderes del sector tecnológico para discutir innovaciones en capital de riesgo,...
Brian Chesky lanza laboratorio de IA para innovar en Airbnb
Brian Chesky, CEO de Airbnb, planea establecer un laboratorio de inteligencia artificial para liderar en el sector. Con una visión centrada en la experiencia del...
Meta construye centros de datos en Ohio pero enfrenta desafíos
Meta ha comenzado a construir centros de datos en tiendas temporales en Nueva Albany, Ohio, con el objetivo de acelerar la construcción y reducir costos....
Poke revoluciona la comunicación empresarial en iMessage con IA
Poke, la primera IA aprobada en la plataforma Messages for Business de Apple, transforma la comunicación entre consumidores y empresas, permitiendo interacciones eficientes a través...
WWDC 2026 promete revolucionar Siri y mejorar aplicaciones clave
La WWDC 2026 genera gran expectación por la renovación de Siri, que se volverá más conversacional y capaz de realizar tareas complejas. También se esperan...
Lo más reciente
- 1
Aumentos de precios en GitHub Copilot inquietan a empresas AI
- 2
Renuncia de asesor de IA en Casa Blanca genera incertidumbre
- 3
WWDC 2026 traerá innovaciones en Siri y aplicaciones de Apple
- 4
Trump explora IA y redistribución de beneficios de OpenAI
- 5
Exejecutivo de IBM denuncia encubrimiento de graves brechas de seguridad
- 6
Cierre de inscripciones para Startup Battlefield 200 el 8 de junio
- 7
SpaceX y Google firman acuerdo de 920 millones para IA

