ChatGPT con voz ya está disponible para todos los usuarios gratuitos

El nuevo modo de voz de ChatGPT, ahora disponible para usuarios gratuitos en la app móvil, se percibe como un salto importante frente a asistentes tradicionales como Siri y Alexa, al permitir conversaciones naturales y abiertas que algunos encuentran útiles y a la vez inquietantemente humanas. Los comentaristas destacan casos de uso como aprender mientras se conduce, practicar idiomas, contar historias interactivas y prepararse para exámenes, pero también señalan limitaciones en la latencia, la gestión de interrupciones, los acentos y errores ocasionales de transcripción o de hecho. Un hilo paralelo plantea preocupaciones sobre privacidad, retención de datos y dependencia de un servicio en la nube, lo que impulsa el interés por ejecutar localmente LLM con voz comparable en hardware personal.

Disponibilidad y despliegue

  • La voz de ChatGPT ya está disponible para los usuarios gratuitos a través de la app móvil; los usuarios deben buscar un icono de auriculares que a veces aparece con retraso o después de reiniciar la app.
  • Algunos informan de caídas e incidencias con la API en torno al lanzamiento, y sospechan que el despliegue está tensionando la infraestructura.
  • La voz no funciona cuando el historial del chat/la recopilación de datos está desactivado, algo descrito como una “limitación técnica” pero visto por algunos como hostil a la privacidad.
  • No está claro si hay soporte de voz en navegador/web; varios lo piden o lo usan con herramientas de dictado.

Experiencia de usuario y casos de uso

  • Muchos describen la experiencia como “alucinante”, “surrealista” o “inquietante” por la entonación natural, la respiración y las respuestas casi en tiempo real.
  • Casos de uso populares: aprender mientras se conduce o camina, explicar conceptos desde distintos ángulos, hacer preguntas tipo test para memorizar, practicar idiomas, historias interactivas para niños y coescribir ficción.
  • Algunos lo usan como un participante extra en discusiones de grupo o como sustituto de un pódcast: eligen un tema, obtienen resúmenes y luego hacen preguntas de seguimiento.
  • Otros se frustran con la gestión de turnos: interrumpe a los usuarios en las pausas, tiene dificultades con el flujo natural de la conversación y ofrece poca configurabilidad para la duración de las pausas o un estilo tipo “push-to-talk”.

Calidad de la voz, idiomas y acentos

  • La calidad del TTS es muy elogiada, pero a muchos no les gusta el tono “alegre/de centralita” y quieren variantes más neutras o culturales.
  • Admite muchos idiomas, pero a menudo los habla con acento inglés o “estadounidense”; la pronunciación y el acento tónico en idiomas como alemán, ruso y portugués no son perfectos.
  • A algunos usuarios les resultan involuntariamente divertidos o irritantes los acentos regionales; unos pocos intentos de cambiar acento/dialecto no tuvieron efecto audible.

Precisión, alucinaciones y confianza

  • Para temas generales, muchos consideran útiles las respuestas al nivel de GPT‑4 y comparables o mejores que los pódcast informales o la búsqueda web al azar.
  • Otros advierten sobre alucinaciones, especialmente en temas de nicho o técnicos; los cuestionarios y el contenido de “aprendizaje” pueden contener errores sutiles.
  • Varios sostienen que los usuarios deben tratarlo como cualquier fuente falible, no como un oráculo, y verificar los detalles importantes en otro lugar.

Privacidad, modelo de negocio y momento del lanzamiento

  • Hay fuertes preocupaciones de que los chats de voz se conserven y se usen para entrenamiento por defecto; la exclusión voluntaria se hace en el cliente y se percibe como fácil de eludir u olvidar.
  • Algunos ven esto como “tú eres el producto”; otros contraargumentan que los planes de pago desplazan los incentivos lejos de la simple extracción de datos.
  • Se debate el momento del lanzamiento durante el drama interno de liderazgo: se ve ya sea como una distracción/estrategia de crecimiento o simplemente como trabajo que ya estaba prácticamente terminado.

Alternativas y modelos locales

  • Varios comentarios destacan pilas locales de voz + LLM basadas en GPU como más rápidas, más privadas y en rápida mejora, sugiriendo un futuro “Jarvis personal” ejecutándose en hardware de consumo.