Show HN: WhisperFusion – AI चैटबॉट के साथ कम-विलंबता बातचीत
WhisperFusion जैसे कम-विलंबता, पूरी तरह स्थानीय वॉइस असिस्टेंट Siri और Alexa जैसी cloud-based प्रणालियों के एक विश्वसनीय विकल्प के रूप में उभर रहे हैं, जो streaming speech recognition (WhisperLive), एक कॉम्पैक्ट LLM, और text-to-speech को मिलाकर लगभग real-time back-and-forth संवाद देते हैं। टिप्पणीकार तकनीकी बाधाओं—विशेषकर Whisper की 30-सेकंड chunking, streaming latency, और end-of-turn detection—के साथ-साथ UX ज़रूरतों जैसे प्राकृतिक interruption, परिवर्तनशील response timing, और conversational cues पर चर्चा करते हैं। privacy-preserving, home-automation और coding companions में गहरी रुचि है, लेकिन deployment complexity, GPU आवश्यकताओं, और लाइव ऑडियो के लिए मूल रूप से न बने मॉडलों को पुनः उपयोग करने की सीमाओं को लेकर चिंता भी है.
समग्र प्रतिक्रिया और उपयोग-के-परिदृश्य
- कई लोगों को WhisperFusion उस दिशा में एक मजबूत कदम लगता है, जैसा Siri/Alexa “होना चाहिए था”: कम-विलंबता, संवादात्मक, और होम ऑटोमेशन, हैंड्स-फ्री इंटरैक्शन, तथा “बहुत स्मार्ट दोस्त” जैसे परिदृश्यों के लिए उपयोगी।
- लोग चलती-फिरती बातचीत, आवाज़ से खाना ऑर्डर करने, घर के आसपास के उपकरणों के साथ इंटरैक्ट करने, और स्क्रीन देखने वाले AI के साथ पेयर प्रोग्रामिंग/सीखने जैसे उपयोग-के-परिदृश्य कल्पित करते हैं।
स्थानीय, निजी वॉइस असिस्टेंट्स
- हर चीज़ का स्थानीय रूप से चलना बहुत आकर्षक माना गया, ताकि निरंतर ऑडियो स्ट्रीम्स को रिमोट APIs पर भेजना न पड़े।
- कुछ का तर्क है कि उपयोगकर्ता increasingly local-only AI की मांग करेंगे, खासकर जब उसे स्क्रीन और माइक्रोफ़ोन दोनों की पूरी पहुँच हो; जबकि कुछ अन्य मानते हैं कि अधिकांश लोग तब तक परवाह नहीं करेंगे जब तक किसी लीक से सीधे नुकसान न हो।
विलंबता, स्ट्रीमिंग ASR, और मॉडल विकल्प
- परियोजना कम विलंबता के लिए WhisperLive (ASR), WhisperSpeech (TTS), और TensorRT से अनुकूलित छोटे LLMs (Phi‑2, Mistral) का उपयोग करती है।
- Whisper के 30-सेकंड chunk डिज़ाइन की आलोचना की गई कि यह sub-second streaming के लिए उपयुक्त नहीं है; कुछ लोग padding और continuous reprocessing वाले workaround को अक्षम और संभावित रूप से उच्च-विलंबता वाला मानते हैं।
- ठोस WER और latency metrics, आदर्श रूप से graphs के साथ, की माँग की गई; मौजूदा दस्तावेज़ीकरण को अपर्याप्त माना गया।
- विकल्प और भविष्य की दिशाएँ जिन पर चर्चा हुई: W2v‑BERT 2.0, recurrent / Mamba-जैसे मॉडल, Kaldi/sherpa और Parakeet streaming मॉडल, chunked attention architectures।
- यह स्पष्ट नहीं है कि WhisperLive की वास्तविक-दुनिया latency/WER, विशेषीकृत streaming ASR शोध से कैसे तुलना करती है, जो कथित तौर पर ~1s latency के साथ minimal WER degradation हासिल करता है।
बातचीत की गतिशीलता और UX
- प्रमुख समस्याएँ: छोटे pauses पर समय से पहले turn-taking, interrupt न कर पाना, fixed speaking speed, और voice mode में text-style responses।
- वांछित विशेषताएँ: स्पष्ट interruption (“hang on”), उत्तर से पहले स्पष्ट cues (“What do you think?”, “Over”), content-based end-of-turn detection, और कब बोलना है इसकी prediction।
- कुछ लोग सुझाव देते हैं कि turn-taking को सीधे audio से predict किया जाए और continuous “intention” तथा conversation-style modeling किया जाए, ताकि इंटरैक्शन मानवीय लगे।
विजन और संदर्भ एकीकरण
- एक desktop/mobile assistant में रुचि है जो screenshots, accessibility APIs, या multimodal models के माध्यम से screen context तक पहुँच सके, जबकि latency और hallucinations का प्रबंधन करे।
- दीर्घकालिक विचारों में घर के भीतर vision शामिल है, ताकि वस्तुओं को ट्रैक किया जा सके (“मेरी चाबियाँ कहाँ हैं?”), और एक persistent “artificial attention” जो स्क्रीन पर दिखने वाली हर चीज़ को याद रखे।
इम्प्लीमेंटेशन, डिप्लॉयमेंट, और हार्डवेयर
- परियोजना की सराहना की गई, लेकिन Python packaging complexity, TensorRT की “examples”-केंद्रित distribution, और Hugging Face के custom download tooling को लेकर निराशा भी जताई गई।
- उपयोगकर्ता सरल installers (.deb/.rpm/.dmg) या कम से कम एक single Docker command चाहते हैं; maintainers Docker-based demo को सरल बनाने की योजना बना रहे हैं।
- RTX 3090/4090 पर परीक्षण किया गया; Jetson support और CoreML backends वांछित हैं, लेकिन फिलहाल “in progress” हैं या स्पष्ट नहीं हैं।