Lançamento HN: Retell AI (YC W24) – API de fala conversacional para seu LLM

Uma nova startup apoiada pela YC está mostrando uma API de fala em tempo real que permite aos desenvolvedores conectar seus próprios LLMs e provedores de áudio a agentes telefônicos e de voz altamente responsivos e com aparência humana. Os comentaristas estão impressionados com a baixa latência, a fala natural e o tratamento de interrupções, mas apontam lacunas práticas como consciência de datas/horários, loops conversacionais ocasionais e a necessidade de melhores prompts e memória. Grande parte do debate gira em torno de economia e ética: se o preço por minuto consegue competir com call centers humanos, como evitar abuso ou engano em atendimento ao cliente e cenários de resposta a crises, e quais salvaguardas ou divulgações devem ser incorporadas a esses sistemas.

Impressões gerais

  • Muitos comentaristas acharam a demo “incrível”, particularmente a latência, o controle de turnos e a qualidade natural da voz; vários disseram que parecia quase humana e além do “vale da estranheza”.
  • Outros observaram que as “falhas da IA” ainda aparecem: contradições ocasionais, loops e promessas claramente roteirizadas ou inadequadas (por exemplo, dizer que vai “retornar” com informações, mas nunca fazê-lo).

Capacidades e design técnico

  • Principais pontos fortes destacados: baixa latência (~subsegundo), bom tratamento de interrupções e prosódia natural.
  • O produto é “traga seu próprio LLM” e “traga seu próprio TTS/ASR”: atualmente integra com provedores como OpenAI TTS, ElevenLabs, Deepgram; há planos para treinar TTS internamente e adicionar clonagem de voz.
  • Arquitetura: a Retell gerencia áudio de entrada/saída, VAD, turn-taking e chama o servidor/LLM do cliente; ela não possui o modelo de raciocínio.
  • Suporta hooks no estilo function calling, para que desenvolvedores possam encerrar chamadas ou disparar ações.

Limitações e modos de falha

  • Problemas relatados: tratamento incorreto ou rígido de datas/horários, confusão em restrições de múltiplas etapas, ficar preso em loops de desculpas, falhar em executar de fato ações prometidas e cair/desconectar no meio da conversa.
  • Alguns navegadores (Firefox, Safari no iOS, seleção de microfone no Chrome) causaram falhas na demo.
  • As demos atuais usam GPT‑3.5 e são explicitamente descritas como não especializadas; vários comentaristas sentiram que o 3.5 não é forte o suficiente para conversas telefônicas com nuances.

Casos de uso e escopo do produto

  • Casos de uso destacados: agendamento de consultas (odontologia), logística, triagem pré-cirúrgica, tutoria, terapia/escuta em crises, assistentes/companheiros de IA, agentes de call center, participação em Zoom/voicechat.
  • Debate sobre voz vs GUI: alguns veem agentes de voz como inferiores a formulários web para tarefas simples; outros valorizam evitar filas de 40–50 minutos.

Preços e economia

  • O preço atual por minuto é visto como alto em comparação com pipelines DIY básicos ou tarifas de contact center; vários desenvolvedores disseram que é 5–10× o custo de STT+TTS deles e difícil de justificar em escala.
  • A equipe reconhece isso e sugere explorar faixas mais baratas.

Ética, confiança e experiência do usuário

  • Forte preocupação de que IAs de voz devam ser obrigadas a se identificar como IA quando solicitado ou em certas condições (por exemplo, chamadas de idosos confusos).
  • Sentimentos mistos sobre casos de uso de “terapeuta” por IA: alguns veem valor como medida temporária em crises; outros se preocupam com desumanização e redução de incentivos à contratação de pessoal.
  • Vários comentaristas não gostam de ser encaminhados sem saber para uma IA ao ligar para uma empresa, mas aceitariam isso se resolvesse problemas rapidamente.

Comparações e alternativas

  • Comparado com ferramentas como vocode, Google Dialogflow, KITT/LiveKit, Gridspace, Nero; a Retell é vista como particularmente forte em latência e tratamento de interrupções.
  • Alguns prefeririam uma camada de TTS em streaming barata e independente; outros pedem opções open source ou auto-hospedadas/comunitárias.