Launch HN:Retell AI(YC W24)——面向你的 LLM 的对话式语音 API
一家新的 YC 支持创业公司正在展示一个实时语音 API,让开发者把自己的 LLM 和音频提供商接入到响应迅速、接近真人的电话和语音代理中。评论者对低延迟、自然语音和打断处理印象深刻,但也指出了实际缺口,例如对日期/时间的感知、偶尔的对话循环,以及更好的提示词和记忆机制的需求。讨论的很大一部分集中在经济性和伦理上:按分钟计费能否与人工呼叫中心竞争,如何防止客户服务和危机响应场景中的滥用或误导,以及这类系统应当内置哪些保护措施或披露机制。
总体印象
- 许多评论者认为这个演示“令人难以置信”,尤其是延迟、轮流发言以及自然的声音质量;几位还表示它已经接近人类,越过了“恐怖谷”。
- 也有人指出“AI 裂缝”仍然明显:偶尔自相矛盾、陷入循环,以及明显脚本化或不合适的承诺(例如声称会“回头”提供信息,但实际上从未做到)。
能力与技术设计
- 被重点提到的核心优势:低延迟(约亚秒级)、强大的打断处理,以及自然的语调。
- 产品是“自带 LLM”和“自带 TTS/ASR”:目前已集成 OpenAI TTS、ElevenLabs、Deepgram 等提供商;计划未来自研 TTS 并加入声音克隆。
- 架构上:Retell 负责音频输入/输出、VAD、轮流发言,并调用客户的服务器/LLM;它不拥有推理模型。
- 支持类似函数调用的钩子,开发者可以用来结束通话或触发动作。
局限与失效模式
- 报告的问题包括:对日期/时间处理不正确或过于僵硬、多步约束处理混乱、陷入道歉循环、未能真正执行所声称的动作,以及在对话中途掉线/“断开连接”。
- 一些浏览器(Firefox、iOS Safari、Chrome 中的麦克风选择)会导致演示失败。
- 当前演示使用 GPT‑3.5,并且明确说明并非专门定制;几位评论者认为 3.5 对细腻的电话对话来说还不够强。
用例与产品范围
- 被强调的用例包括:预约安排(牙科)、物流、术前问诊、辅导、治疗/危机倾听、AI 助手/陪伴、呼叫中心坐席、参与 Zoom/语音聊天。
- 关于语音与 GUI 的争论:有人认为对于简单任务,语音代理不如网页表单;也有人重视跳过 40–50 分钟排队等待的价值。
定价与经济性
- 目前按分钟计费的价格,被认为相较于最基础的自建流水线或呼叫中心费率偏高;多位开发者表示,这比他们的 STT+TTS 成本高出 5–10 倍,很难在规模化时证明合理性。
- 团队承认这一点,并暗示正在考虑更便宜的层级。
伦理、信任与用户体验
- 强烈担忧语音 AI 应在被要求时,或在某些情况下(例如让困惑的老年人来电者)必须表明自己是 AI。
- 对 AI“治疗师”用例感受不一:有人认为它可作为危机情况下的临时补位;也有人担心这会去人性化,并降低增加人工岗位的动力。
- 几位评论者不喜欢在拨打企业电话时在不知情的情况下被转接到 AI,但如果它能快速解决问题,他们也可以接受。
比较与替代方案
- 与 vocode、Google Dialogflow、KITT/LiveKit、Gridspace、Nero 等工具相比;Retell 被认为在延迟和打断处理方面尤其强。
- 有些人更希望有一个便宜、独立的流式 TTS 层;另一些人则希望有开源、可自托管或社区版本。