带语音功能的 ChatGPT 现已向所有免费用户开放
ChatGPT 新的语音模式现已通过移动应用向免费用户开放。相较于 Siri 和 Alexa 等传统助手,它被许多人视为一次重大跃升,能够支持更自然、开放式的对话,让一些人觉得既实用又令人不安地像真人。评论者提到的使用场景包括开车时学习、语言练习、互动叙事和备考,但也指出了延迟、打断处理、口音以及偶尔的转录或事实错误等限制。另一条讨论则对隐私、数据保留以及对云服务的依赖表达担忧,并因此对在个人硬件上本地运行类似的支持语音的 LLM 表现出兴趣。
可用性与推出
- ChatGPT 语音现已通过移动应用向免费用户开放;用户可留意一个耳机图标,它有时会延迟出现,或需重启应用后才会显示。
- 有些人反映在上线前后出现了服务中断和 API 问题,怀疑此次推出正在给基础设施带来压力。
- 当聊天历史/数据收集被禁用时,语音功能无法使用;这一点被描述为“技术限制”,但在一些人看来具有反隐私倾向。
- 浏览器/网页端是否支持语音尚不明确;不少人要求提供这一功能,或通过听写工具变通实现。
用户体验与使用场景
- 许多人将体验描述为“惊艳”“超现实”或“诡异”,原因在于其自然的语调、呼吸感以及近乎实时的回应。
- 常见用途包括:开车或步行时学习、从不同角度解释概念、用于记忆的测验、语言练习、面向儿童的互动故事,以及共同撰写小说。
- 有些人把它当作群组讨论中的额外参与者,或当作播客替代品:先选一个话题,获取摘要,再提出后续问题。
- 也有人对轮流发言感到沮丧:它会在用户停顿时打断对话,难以维持自然的交流节奏,而且对停顿时长或“按住说话”式交互的可配置性有限。
语音质量、语言与口音
- 语音合成质量普遍受到称赞,但许多人不喜欢那种“愉快/呼叫中心”式的语气,希望有更中性或更具文化差异的变体。
- 它支持多种语言,但常常带着英语或“美国式”口音;德语、俄语和葡萄牙语等语言的发音与重音并不完美。
- 一些用户觉得地区口音无意间很搞笑或很刺耳;少数尝试更改口音/方言的操作并未产生可听见的效果。
准确性、幻觉与信任
- 对于一般话题,许多人认为 GPT-4 级别的回答很有用,且与随意听播客或随机网页搜索相比不遑多让,甚至更好。
- 也有人警告会出现幻觉,尤其是在小众或技术性话题上;测验和“学习”类内容可能包含细微错误。
- 有几位评论者认为用户必须把它当作一个会犯错的来源,而不是神谕,并应在其他地方核实重要细节。
隐私、商业模式与发布时间
- 人们强烈担忧语音聊天默认会被保留并用于训练;退出机制在客户端侧进行,且被认为很容易被绕过或忘记。
- 有人认为这说明“你就是产品”;也有人反驳说,付费层级会把激励从单纯的数据挖掘转移开。
- 关于其在内部领导层纷争期间发布的时机,讨论颇多:有人认为这是转移注意力或增长黑客手段,也有人认为只是把已经接近完成的工作推向发布。
替代方案与本地模型
- 多条评论强调,本地、基于 GPU 的语音+LLM 栈更快、更私密,而且进步很快,暗示未来会在消费级硬件上运行一个“个人 Jarvis”。