Launch HN: Retell AI (YC W24) – API de voz conversacional para tu LLM
Una nueva startup respaldada por YC está mostrando una API de voz en tiempo real que permite a los desarrolladores conectar sus propios LLM y proveedores de audio en agentes telefónicos y de voz muy receptivos y con apariencia humana. Los comentaristas están impresionados por la baja latencia, el habla natural y el manejo de interrupciones, pero señalan carencias prácticas como el manejo de fechas/horas, los bucles conversacionales ocasionales y la necesidad de mejores prompts y memoria. Gran parte del debate gira en torno a la economía y la ética: si el precio por minuto puede competir con los centros de llamadas humanos, cómo evitar el abuso o el engaño en escenarios de atención al cliente y respuesta a crisis, y qué salvaguardas o divulgaciones deberían integrarse en estos sistemas.
Impresiones generales
- Muchos comentaristas encontraron la demo “increíble”, especialmente por la latencia, el manejo de turnos y la calidad natural de la voz; varios dijeron que se sentía muy cercana a la humana y más allá del “valle inquietante”.
- Otros señalaron que todavía se ven las “fisuras” de la IA: contradicciones ocasionales, bucles y promesas claramente guionizadas o inapropiadas (por ejemplo, decir que “volvería” con información pero no hacerlo nunca).
Capacidades y diseño técnico
- Puntos fuertes destacados: baja latencia (~subsegundo), buen manejo de interrupciones y prosodia natural.
- El producto es “trae tu propio LLM” y “trae tu propio TTS/ASR”: actualmente se integra con proveedores como OpenAI TTS, ElevenLabs, Deepgram; planea entrenar TTS internamente y añadir clonación de voz.
- Arquitectura: Retell gestiona la entrada/salida de audio, VAD, el manejo de turnos y llama al servidor/LLM del cliente; no posee el modelo de razonamiento.
- Soporta hooks al estilo de function-calling para que los desarrolladores puedan cerrar llamadas o activar acciones.
Limitaciones y modos de fallo
- Problemas reportados: manejo incorrecto o rígido de fechas/horas, confusión con restricciones de varios pasos, quedarse atrapado en bucles de disculpa, no realizar realmente las acciones prometidas y caerse/desconectarse a mitad de conversación.
- Algunos navegadores (Firefox, Safari en iOS, selección de micrófono en Chrome) provocaron fallos en la demo.
- Las demos actuales usan GPT‑3.5 y se describen explícitamente como no especializadas; varios comentaristas sintieron que 3.5 no es lo bastante fuerte para conversaciones telefónicas matizadas.
Casos de uso y alcance del producto
- Casos de uso destacados: reserva de citas (dentales), logística, triaje prequirúrgico, tutoría, escucha terapéutica/de crisis, asistentes/compañeros de IA, agentes de centro de llamadas, participación en Zoom/chat de voz.
- Debate sobre voz vs GUI: algunos ven a los agentes de voz como inferiores a los formularios web para tareas sencillas; otros valoran evitar colas de 40–50 minutos.
Precios y economía
- El precio actual por minuto se percibe como alto frente a pipelines DIY básicos o tarifas de centros de contacto; varios desarrolladores dijeron que es 5–10× su costo de STT+TTS y difícil de justificar a escala.
- El equipo reconoce esto y sugiere explorar niveles más baratos.
Ética, confianza y experiencia de usuario
- Hay una fuerte preocupación por que las IA de voz deban identificarse como IA si se les pide o bajo ciertas condiciones (por ejemplo, personas mayores confundidas que llaman).
- Sentimientos mixtos sobre casos de uso de “terapeuta” IA: algunos ven valor como medida temporal en crisis; otros se preocupan por la deshumanización y el menor incentivo para dotación de personal.
- Varios comentaristas no quieren ser derivados sin saberlo a una IA cuando llaman a una empresa, pero lo aceptarían si resuelve problemas rápidamente.
Comparaciones y alternativas
- Comparado con herramientas como vocode, Google Dialogflow, KITT/LiveKit, Gridspace, Nero; Retell se considera especialmente fuerte en latencia y manejo de interrupciones.
- Algunos preferirían una capa TTS en streaming, económica y autónoma; otros piden opciones de código abierto o autoalojadas/comunitarias.