OpenAI lanza GPT-Live-1 para conversaciones de voz más naturales y fluidas
OpenAI introduce GPT-Live-1 y su versión mini, modelos full-duplex que permiten interrupciones naturales y una interacción más fluida con ChatGPT.
Puntos clave:
- Contexto: Redactado por Redacción Orbynex y validado por la mesa editorial.
- Hecho central:OpenAI introduce GPT-Live-1 y su versión mini, modelos full-duplex que permiten interrupciones naturales y una interacción más fluida con ChatGPT.

OpenAI ha dado un paso significativo en la evolución de sus herramientas de interacción oral con el lanzamiento de GPT-Live-1 y GPT-Live-1 mini. Estos nuevos modelos conversacionales han sido diseñados para ofrecer una experiencia auditiva mucho más fluida y natural, superando las limitaciones técnicas de las versiones anteriores. La principal innovación radica en su arquitectura full-duplex, la cual permite que el sistema escuche y hable de manera simultánea. Esta capacidad elimina las pausas incómodas y permite que los usuarios interrumpan al asistente de forma orgánica, tal como ocurriría en una conversación humana real, facilitando además funciones avanzadas como la traducción en tiempo real.
La transición tecnológica es notable, ya que los modelos previos dependían de una cadena secuencial que combinaba un sistema de transcripción de voz a texto, el procesamiento del lenguaje y una etapa final de síntesis de voz. Este proceso fragmentado solía generar problemas de latencia y dificultades para gestionar interrupciones. Con la nueva arquitectura, OpenAI busca resolver estos inconvenientes técnicos, integrando la capacidad de razonamiento de modelos avanzados como GPT-5.5. Esto permite que el asistente no solo mantenga una charla, sino que también realice búsquedas, ejecute tareas de razonamiento o gestione capacidades agentiles mientras continúa el diálogo.
En cuanto a la disponibilidad, la compañía ha decidido que GPT-Live-1 mini se convierta en el estándar predeterminado para el Modo de Voz Avanzado dentro de ChatGPT. Por su parte, los usuarios suscritos a los niveles de pago tendrán acceso exclusivo al modelo GPT-Live-1, que ofrece capacidades superiores. Durante las pruebas iniciales, se ha destacado la habilidad del sistema para permanecer en silencio mientras absorbe el contexto de una conversación prolongada, esperando el momento adecuado para intervenir. Además, al estar conectado a los modelos de lenguaje más recientes, el sistema tiene la capacidad de presentar información en formatos visuales, una tendencia que otros actores del sector también están explorando para mejorar la interactividad.
La visión a largo plazo de la empresa es posicionar la voz como la interfaz principal para la computación, especialmente para la gestión de tareas complejas y de larga duración. Representantes de la firma han señalado que ya es posible mantener sesiones de conversación de hasta cuarenta minutos sin interrupciones, lo que sugiere un cambio en cómo los usuarios podrían interactuar con la tecnología en el futuro. Aunque existen especulaciones sobre el posible desarrollo de hardware propio, como auriculares con capacidades de inteligencia artificial, la compañía se ha centrado por ahora en el perfeccionamiento del software.
A pesar de estos avances, el sistema aún presenta desafíos, como se observó en demostraciones de traducción donde el tono y el acento en ciertos idiomas aún no alcanzan una naturalidad perfecta. No obstante, la empresa subraya que estos modelos han sido diseñados con salvaguardas de seguridad integradas, enfocándose en proporcionar respuestas apropiadas para adolescentes y recursos de apoyo en situaciones críticas. Con más de 150 millones de usuarios ya interactuando mediante voz y dictado, OpenAI busca consolidar su posición frente a competidores que también están modernizando sus asistentes digitales.