OpenAI has launched GPT-Live, a new generation of voice models for ChatGPT that can listen and speak simultaneously, aiming for more natural conversations. The full-duplex architecture processes audio continuously, allowing interruptions and real-time backchanneling. However, viral tests show the model still struggles with basic counting tasks.
Despite the advanced voice capabilities, GPT-Live-1 incorrectly counted letters in simple words:
OpenAI plans to expand GPT-Live to API and enterprise users. The company emphasizes safety measures, including parental controls and fraud prevention Source: Infobae. Despite the letter-counting hiccups, GPT-Live represents a significant step toward more human-like AI interaction.
“El sistema se basa en una arquitectura full-duplex, lo que significa que puede escuchar y hablar al mismo tiempo.”
“GPT-Live-1 también tuvo dificultades para resolver correctamente este ejercicio, pese a que otros sistemas ya suelen superar el reto.”
“La segunda innovación arquitectónica de GPT-Live es la separación entre la interacción continua y el procesamiento complejo.”
“Jason Liu, ingeniero de experiencia para desarrolladores de OpenAI Codex, compartió el vídeo acompañado de una reacción de una sola palabra: ‘Joder’.”
“GPT-Live es, según las palabras de OpenAI, el modelo de voz más inteligente hasta la fecha de la firma tecnológica.”