OpenAI lanzó el nuevo modelo de voz GPT-Live. Si hubiera que resumir el anuncio en una frase, sería esta: «Una arquitectura full-duplex que escucha y habla al mismo tiempo». Hasta ahora, la IA de voz, por rápida que fuera, funcionaba como un walkie-talkie: una parte tenía que terminar de hablar para que la otra pudiera hacerlo. GPT-Live ha convertido esta estructura en un teléfono. Revisemos qué ha cambiado y por qué importa desde la perspectiva de la arquitectura.
Antes, veamos brevemente cómo comienza una nueva conversación de voz.
▶ Pantalla de inicio de una conversación de voz con GPT-Live (oficial de OpenAI)
De un sistema en cascada a uno basado en turnos y, finalmente, full-duplex
La arquitectura de la IA de voz ha pasado por tres etapas.
Las primeras conversaciones de voz de ChatGPT utilizaban una arquitectura en cascada (cascaded). Era una cadena de tres modelos: el reconocimiento de voz convertía el habla en texto, el modelo de lenguaje generaba la respuesta y el modelo de texto a voz volvía a convertirla en audio. Aunque conversar por voz con un modelo frontier era algo nuevo, cada salto entre modelos filtraba información y ralentizaba la respuesta. También existía una limitación estructural: los matices de la voz desaparecían al transformarse en texto.
Los modelos basados en turnos, representados por Advanced Voice Mode, fusionaron todo en un único modelo. Al procesar y generar voz directamente, redujeron la latencia y lograron expresiones más naturales. Sin embargo, seguían procesando la conversación por turnos. Esperaban a que el usuario terminara de hablar para responder, y determinaban que había terminado mediante el silencio. Si haces una pausa breve para ordenar tus ideas, el sistema interrumpe; si confunde el ruido ambiental con el final de la conversación, surgen momentos incómodos.
GPT-Live abandonó el concepto mismo de turno. Mientras genera una respuesta, sigue procesando la entrada del usuario y decide varias veces por segundo si hablar, continuar escuchando, hacer una pausa, interrumpir o usar una herramienta. Esta estructura permite los backchannels, como responder «mm» o «sí» mientras la otra persona habla, y también la interpretación en tiempo real. Esta diferencia se entiende mejor al escucharla que al leerla. Incluyo dos vídeos de demostración publicados por OpenAI.
▶ Demostración de una conversación natural (oficial de OpenAI)
▶ Escuchar y hablar al mismo tiempo: demostración de interpretación en tiempo real (oficial de OpenAI)
Segundo diseño: separar la conversación del razonamiento
Tan importante como el dúplex completo es la separación de responsabilidades. GPT-Live se encarga de la interacción fluida, mientras que las preguntas que requieren búsquedas o razonamiento profundo se delegan a un modelo frontier en segundo plano. En el momento del lanzamiento, ese puesto lo ocupa GPT-5.5, y OpenAI ha indicado que se sustituirá cuando aparezca un nuevo modelo frontier.
Esta arquitectura es inteligente por dos motivos. El primero es la experiencia de usuario. GPT-Live mantiene la conversación mientras las tareas pesadas se ejecutan en segundo plano. En lugar de guardar silencio mientras llegan los resultados de búsqueda, se conserva el flujo de la conversación. El segundo es la ruta de actualización. Como las funciones de conversación y razonamiento están separadas, basta con cambiar el modelo posterior para aumentar la inteligencia sin modificar la experiencia de voz. Es la misma idea que separar el orquestador de los trabajadores en un sistema de agentes.
Las cifras de rendimiento también respaldan esta arquitectura. Según OpenAI, GPT-Live-1 obtuvo mejores resultados que el modo de voz avanzado en GPQA, que evalúa el razonamiento científico de nivel experto; BrowseComp, que evalúa la búsqueda web agéntica; y τ³-Voice Telecom, que evalúa tareas de voz multiturno en entornos de soporte de telecomunicaciones. En evaluaciones comparativas de uso real de 5 a 10 minutos, también recibió mayor preferencia en la alternancia de turnos, las interrupciones y el flujo conversacional. La demo siguiente muestra cómo funciona realmente la delegación en segundo plano.
▶ Respuestas más inteligentes: demo de razonamiento en segundo plano (oficial de OpenAI)
Qué se puede usar y qué todavía no
Así se ofrece el servicio. Las dos versiones, GPT-Live-1 y GPT-Live-1 mini, se están distribuyendo gradualmente a usuarios de todo el mundo en iOS, Android y ChatGPT.com. Los planes Go, Plus y Pro usan GPT-Live-1 de forma predeterminada; Free usa mini. También se puede elegir el nivel de razonamiento: Instant para respuestas rápidas, o Medium y High para respuestas más profundas, con GPT-5.5 Thinking ejecutándose en segundo plano.
Durante la conversación, temas como el tiempo, las acciones y los deportes se muestran mediante tarjetas visuales. La búsqueda, la memoria, las imágenes y la carga de archivos también siguen disponibles dentro de las conversaciones de voz. Además, se ha mejorado la capacidad de centrarse en la voz del usuario en entornos ruidosos. Ambas funciones cuentan con demos oficiales.
▶ Demo de tarjetas visuales durante la conversación (oficial de OpenAI)
▶ Demo de conversación con ruido de fondo (oficial de OpenAI)
Las medidas de seguridad también se rediseñaron para la voz. Como las conversaciones de voz son en tiempo real, incorporan protecciones que funcionan incluso mientras se emite una respuesta y permiten finalizar la conversación si el riesgo es alto. En conversaciones sobre autolesiones se indican líneas de ayuda en crisis; en cuentas de menores, los padres pueden configurar el uso de conversaciones de voz y podrían recibir avisos en situaciones de alto riesgo. También se especifica que solo se ofrecen 9 voces predefinidas para impedir la imitación de voces reales.
Aún hay funciones que no están disponibles. La API para desarrolladores está «próximamente» y por ahora solo permite registrarse para recibir avisos de lanzamiento. Las conversaciones de voz junto con video o pantalla compartida tampoco estarán disponibles justo después del lanzamiento; si necesitas esas funciones, debes usar el modo de voz existente. La optimización lingüística se centra en los idiomas principales, por lo que la entonación puede resultar extraña en algunos idiomas.
Resumen
- GPT-Live es un modelo de voz full-duplex que escucha y habla al mismo tiempo. La incomodidad del enfoque anterior, que determinaba el turno mediante el silencio, desaparece desde la propia arquitectura.
- GPT-Live se ocupa de la conversación y GPT-5.5, en segundo plano, de la búsqueda y el razonamiento. Esta separación permite actualizar continuamente la inteligencia subyacente sin alterar la experiencia conversacional.
- La aplicación en ChatGPT comienza ahora de forma gradual, pero la API aún no está disponible. Los desarrolladores que preparan una interfaz de voz deberían revisar su diseño tomando esta arquitectura como base, en lugar de un pipeline escalonado.
Se dice que 150 millones de personas conversan con ChatGPT por voz cada semana. A medida que la voz se convierte en la interfaz principal y no en una entrada auxiliar, eliminar los turnos podría ser un punto de inflexión mucho mayor de lo esperado.

