Show HN: WhisperFusion – Conversaciones de baja latencia con un chatbot de IA
Asistentes de voz de baja latencia y totalmente locales como WhisperFusion están emergiendo como una alternativa creíble a sistemas basados en la nube como Siri y Alexa, combinando reconocimiento de voz en streaming (WhisperLive), un LLM compacto y texto a voz para un intercambio casi en tiempo real. Los comentaristas exploran obstáculos técnicos —especialmente el fragmentado de 30 segundos de Whisper, la latencia en streaming y la detección del fin de turno— así como necesidades de UX como interrupción natural, tiempos de respuesta variables y señales conversacionales. Existe un gran interés en compañeros para la automatización del hogar y la programación que preserven la privacidad, pero también preocupación por la complejidad del despliegue, los requisitos de GPU y los límites de reutilizar modelos que no fueron diseñados originalmente para audio en vivo.
Reacción general y casos de uso
- Muchos ven WhisperFusion como un paso sólido hacia lo que Siri/Alexa “deberían haber sido”: baja latencia, conversacional y útil para automatización del hogar, interacción manos libres y escenarios de “amigo súper inteligente”.
- La gente imagina casos de uso como caminar y conversar, pedir comida por voz, interactuar con dispositivos por toda la casa y programación en pareja/aprendizaje con una IA que ve la pantalla.
Asistentes de voz locales y privados
- Fuerte interés en que todo funcione localmente para evitar enviar flujos continuos de audio a APIs remotas.
- Algunos argumentan que los usuarios exigirán cada vez más IA solo local, especialmente cuando tenga acceso completo a la pantalla y al micrófono, aunque otros creen que a la mayoría no le importará hasta que sufra filtraciones directamente.
Latencia, ASR en streaming y elecciones de modelos
- El proyecto usa WhisperLive (ASR), WhisperSpeech (TTS) y LLMs pequeños (Phi‑2, Mistral) optimizados con TensorRT para baja latencia.
- El diseño de Whisper de fragmentos de 30 segundos es criticado por ser poco adecuado para streaming por debajo del segundo; algunos llaman ineficiente y potencialmente de alta latencia al workaround (relleno, reprocesamiento continuo).
- Se piden métricas concretas de WER y latencia, idealmente gráficas; la documentación actual se percibe como insuficiente.
- Se discuten alternativas y direcciones futuras: W2v‑BERT 2.0, modelos recurrentes / tipo Mamba, modelos de streaming Kaldi/sherpa y Parakeet, arquitecturas de atención por fragmentos.
- No queda claro cómo se comparan la latencia y el WER reales de WhisperLive con la investigación especializada en ASR en streaming que, según se informa, logra ~1 s de latencia con una degradación mínima del WER.
Dinámica de conversación y UX
- Puntos de dolor principales: toma de turno prematura tras pausas breves, imposibilidad de interrumpir, velocidad de habla fija y respuestas en estilo texto en modo voz.
- Funciones deseadas: interrupción explícita (“espera”), señales explícitas antes de responder (“¿Qué piensas?”, “Cambio y corto”), detección de fin de turno basada en contenido y predicción de cuándo hablar.
- Algunos proponen predecir la toma de turno directamente a partir del audio y hacer un modelado continuo de “intención” y estilo conversacional para que las interacciones se sientan humanas.
Visión e integración de contexto
- Hay interés en un asistente de escritorio/móvil que pueda acceder al contexto de la pantalla mediante capturas, APIs de accesibilidad o modelos multimodales, mientras gestiona la latencia y las alucinaciones.
- Ideas a más largo plazo incluyen visión en el hogar para rastrear objetos (“¿dónde están mis llaves?”) y “atención artificial” persistente que recuerde todo lo que aparece en pantalla.
Implementación, despliegue y hardware
- Se elogia el proyecto, pero hay frustración con la complejidad del empaquetado en Python, la distribución centrada en “ejemplos” de TensorRT y la herramienta de descarga personalizada de Hugging Face.
- Los usuarios piden instaladores sencillos (.deb/.rpm/.dmg) o al menos un único comando Docker; los mantenedores planean simplificar la demo basada en Docker.
- Probado en RTX 3090/4090; se desea compatibilidad con Jetson y backends de CoreML, pero actualmente están “en progreso” o no están claros.