Launch HN: Retell AI (YC W24) – आपके LLM के लिए संवादात्मक Speech API

एक नया YC-समर्थित startup एक real-time speech API दिखा रहा है, जो developers को अपने LLMs और audio providers को अत्यधिक responsive, human‑like phone और voice agents में plug करने देता है। टिप्पणीकार कम latency, प्राकृतिक speech, और interruption handling से प्रभावित हैं, लेकिन date/time awareness, कभी-कभार conversational loops, और बेहतर prompts तथा memory की ज़रूरत जैसी व्यावहारिक कमियों को भी उजागर करते हैं। बहस का बड़ा हिस्सा economics और ethics के इर्द-गिर्द है: क्या per-minute pricing human call centers से प्रतिस्पर्धा कर सकती है, customer service और crisis-response scenarios में abuse या deception को कैसे रोका जाए, और ऐसे systems में कौन-से guardrails या disclosures होने चाहिए।

समग्र प्रभाव

  • कई टिप्पणीकारों को डेमो “अविश्वसनीय” लगा, खासकर latency, turn-taking, और प्राकृतिक आवाज़ की गुणवत्ता; कई ने कहा कि यह लगभग मानवीय महसूस होता है और “uncanny valley” से आगे निकल चुका है।
  • दूसरों ने नोट किया कि “AI cracks” अभी भी दिखते हैं: कभी-कभार विरोधाभास, loops, और स्पष्ट रूप से scripted या अनुपयुक्त वादे (जैसे जानकारी के साथ “get back” करने का दावा, लेकिन फिर कभी न करना)।

क्षमताएँ और तकनीकी डिज़ाइन

  • उजागर की गई मुख्य ताकतें: कम latency (~sub-second), मजबूत interruption handling, और प्राकृतिक prosody।
  • उत्पाद “bring your own LLM” और “bring your own TTS/ASR” है: अभी OpenAI TTS, ElevenLabs, Deepgram जैसे providers के साथ एकीकृत होता है; in-house TTS train करने और voice cloning जोड़ने की योजना है।
  • Architecture: Retell audio in/out, VAD, turn-taking संभालता है, और customer के server/LLM को calls करता है; यह reasoning model का मालिक नहीं है।
  • function-calling–style hooks का समर्थन करता है ताकि developers calls समाप्त कर सकें या actions trigger कर सकें।

सीमाएँ और failure modes

  • रिपोर्ट की गई समस्याएँ: dates/times का गलत या rigid handling, multi-step constraints पर भ्रम, apology loops में फँस जाना, वास्तव में दावा किए गए actions न करना, और बातचीत के बीच में drop/“disconnect” हो जाना।
  • कुछ browsers (Firefox, iOS Safari, Chrome में mic selection) ने demo failures पैदा किए।
  • मौजूदा demos GPT‑3.5 का उपयोग करते हैं और स्पष्ट रूप से non-specialized बताए गए हैं; कई टिप्पणीकारों को लगा कि nuanced phone conversations के लिए 3.5 पर्याप्त मजबूत नहीं है।

उपयोग के मामले और product scope

  • उजागर use cases: appointment booking (dental), logistics, pre-surgery intake, tutoring, therapy/crisis listening, AI assistants/companions, call center agents, Zoom/voicechat participation।
  • voice बनाम GUI पर बहस: कुछ लोग voice agents को सीधे-सादे tasks के लिए web forms से inferior मानते हैं; दूसरे 40–50 minute queues से बचने को महत्व देते हैं।

मूल्य निर्धारण और economics

  • मौजूदा per-minute pricing को bare-bones DIY pipelines या contact-center rates की तुलना में ऊँचा माना जा रहा है; कई developers ने कहा कि यह उनकी STT+TTS लागत से 5–10× है और scale पर इसे उचित ठहराना कठिन है।
  • टीम इसे स्वीकार करती है और सस्ते tiers तलाशने का संकेत देती है।

नैतिकता, भरोसा, और user experience

  • मजबूत चिंता है कि voice AIs को अनुरोध पर या कुछ स्थितियों में (जैसे confused elderly callers) स्वयं को AI के रूप में पहचानना अनिवार्य होना चाहिए।
  • AI “therapist” use cases पर मिश्रित भावनाएँ: कुछ लोग इसे crisis stopgap के रूप में मूल्यवान मानते हैं; अन्य dehumanization और staffing incentives में कमी को लेकर चिंतित हैं।
  • कई टिप्पणीकारों को यह पसंद नहीं कि वे किसी business को कॉल करते समय अनजाने में AI से जुड़ जाएँ, लेकिन अगर यह समस्याएँ जल्दी हल करे तो वे इसे स्वीकार करेंगे।

तुलनाएँ और विकल्प

  • vocode, Google Dialogflow, KITT/LiveKit, Gridspace, Nero जैसे tools से तुलना की गई; Retell को latency और interruption handling में विशेष रूप से मजबूत माना जाता है।
  • कुछ लोग एक सस्ता, standalone streaming TTS layer पसंद करेंगे; दूसरे open-source या self-hosted/community विकल्पों की माँग करते हैं।