Show HN: WhisperFusion – Conversaciones de baja latencia con un chatbot de IA

Asistentes de voz de baja latencia y totalmente locales como WhisperFusion están emergiendo como una alternativa creíble a sistemas basados en la nube como Siri y Alexa, combinando reconocimiento de voz en streaming (WhisperLive), un LLM compacto y texto a voz para un intercambio casi en tiempo real. Los comentaristas exploran obstáculos técnicos —especialmente el fragmentado de 30 segundos de Whisper, la latencia en streaming y la detección del fin de turno— así como necesidades de UX como interrupción natural, tiempos de respuesta variables y señales conversacionales. Existe un gran interés en compañeros para la automatización del hogar y la programación que preserven la privacidad, pero también preocupación por la complejidad del despliegue, los requisitos de GPU y los límites de reutilizar modelos que no fueron diseñados originalmente para audio en vivo.

Reacción general y casos de uso

  • Muchos ven WhisperFusion como un paso sólido hacia lo que Siri/Alexa “deberían haber sido”: baja latencia, conversacional y útil para automatización del hogar, interacción manos libres y escenarios de “amigo súper inteligente”.
  • La gente imagina casos de uso como caminar y conversar, pedir comida por voz, interactuar con dispositivos por toda la casa y programación en pareja/aprendizaje con una IA que ve la pantalla.

Asistentes de voz locales y privados

  • Fuerte interés en que todo funcione localmente para evitar enviar flujos continuos de audio a APIs remotas.
  • Algunos argumentan que los usuarios exigirán cada vez más IA solo local, especialmente cuando tenga acceso completo a la pantalla y al micrófono, aunque otros creen que a la mayoría no le importará hasta que sufra filtraciones directamente.

Latencia, ASR en streaming y elecciones de modelos

  • El proyecto usa WhisperLive (ASR), WhisperSpeech (TTS) y LLMs pequeños (Phi‑2, Mistral) optimizados con TensorRT para baja latencia.
  • El diseño de Whisper de fragmentos de 30 segundos es criticado por ser poco adecuado para streaming por debajo del segundo; algunos llaman ineficiente y potencialmente de alta latencia al workaround (relleno, reprocesamiento continuo).
  • Se piden métricas concretas de WER y latencia, idealmente gráficas; la documentación actual se percibe como insuficiente.
  • Se discuten alternativas y direcciones futuras: W2v‑BERT 2.0, modelos recurrentes / tipo Mamba, modelos de streaming Kaldi/sherpa y Parakeet, arquitecturas de atención por fragmentos.
  • No queda claro cómo se comparan la latencia y el WER reales de WhisperLive con la investigación especializada en ASR en streaming que, según se informa, logra ~1 s de latencia con una degradación mínima del WER.

Dinámica de conversación y UX

  • Puntos de dolor principales: toma de turno prematura tras pausas breves, imposibilidad de interrumpir, velocidad de habla fija y respuestas en estilo texto en modo voz.
  • Funciones deseadas: interrupción explícita (“espera”), señales explícitas antes de responder (“¿Qué piensas?”, “Cambio y corto”), detección de fin de turno basada en contenido y predicción de cuándo hablar.
  • Algunos proponen predecir la toma de turno directamente a partir del audio y hacer un modelado continuo de “intención” y estilo conversacional para que las interacciones se sientan humanas.

Visión e integración de contexto

  • Hay interés en un asistente de escritorio/móvil que pueda acceder al contexto de la pantalla mediante capturas, APIs de accesibilidad o modelos multimodales, mientras gestiona la latencia y las alucinaciones.
  • Ideas a más largo plazo incluyen visión en el hogar para rastrear objetos (“¿dónde están mis llaves?”) y “atención artificial” persistente que recuerde todo lo que aparece en pantalla.

Implementación, despliegue y hardware

  • Se elogia el proyecto, pero hay frustración con la complejidad del empaquetado en Python, la distribución centrada en “ejemplos” de TensorRT y la herramienta de descarga personalizada de Hugging Face.
  • Los usuarios piden instaladores sencillos (.deb/.rpm/.dmg) o al menos un único comando Docker; los mantenedores planean simplificar la demo basada en Docker.
  • Probado en RTX 3090/4090; se desea compatibilidad con Jetson y backends de CoreML, pero actualmente están “en progreso” o no están claros.