Show HN: WhisperFusion – Conversas de baixa latência com um chatbot de IA
Assistentes de voz totalmente locais e de baixa latência, como o WhisperFusion, estão surgindo como uma alternativa credível a sistemas baseados na nuvem como Siri e Alexa, combinando reconhecimento de fala em streaming (WhisperLive), um LLM compacto e texto para fala para um vai-e-vem quase em tempo real. Os comentaristas exploram obstáculos técnicos — especialmente o particionamento de 30 segundos do Whisper, a latência de streaming e a detecção de fim de turno — além de necessidades de UX como interrupção natural, timing variável de respostas e sinais conversacionais. Há forte interesse em companheiros de automação residencial e programação que preservem a privacidade, mas também preocupação com a complexidade de implantação, os requisitos de GPU e os limites de reaproveitar modelos que não foram originalmente projetados para áudio ao vivo.
Reação geral e casos de uso
- Muitos veem o WhisperFusion como um passo importante rumo ao que a Siri/Alexa “deveriam ter sido”: de baixa latência, conversacional e útil para automação residencial, interação sem as mãos e cenários de “amigo superinteligente”.
- As pessoas imaginam casos de uso como caminhar e conversar, pedir comida por voz, interagir com dispositivos pela casa e programação em dupla/aprendizado com uma IA que vê a tela.
Assistentes de voz locais e privados
- Há forte interesse em tudo rodar localmente para evitar enviar fluxos contínuos de áudio para APIs remotas.
- Alguns argumentam que os usuários vão exigir cada vez mais IA somente local, especialmente quando ela tiver acesso total à tela e ao microfone, embora outros achem que a maioria das pessoas não vai se importar até ser diretamente prejudicada por vazamentos.
Latência, ASR em streaming e escolhas de modelo
- O projeto usa WhisperLive (ASR), WhisperSpeech (TTS) e pequenos LLMs (Phi‑2, Mistral) otimizados com TensorRT para baixa latência.
- O design de blocos de 30 segundos do Whisper é criticado por ser inadequado para streaming em subsegundos; alguns chamam a solução de contorno (padding, reprocessamento contínuo) de ineficiente e potencialmente de alta latência.
- Há pedidos por métricas concretas de WER e latência, idealmente em gráficos; a documentação atual é vista como insuficiente.
- Alternativas e direções futuras discutidas: W2v‑BERT 2.0, modelos recorrentes / estilo Mamba, Kaldi/sherpa e modelos de streaming Parakeet, arquiteturas de attention em blocos.
- Não está claro como a latência/WER real do WhisperLive se compara à pesquisa especializada em ASR de streaming, que supostamente atinge ~1s de latência com degradação mínima de WER.
Dinâmica de conversa e UX
- Principais dores: alternância de turno prematura em pausas curtas, incapacidade de interromper, velocidade de fala fixa e respostas em estilo de texto no modo de voz.
- Recursos desejados: interrupção explícita (“espera aí”), sinais explícitos antes da resposta (“O que você acha?”, “Passo a palavra”), detecção de fim de turno baseada em conteúdo e previsão de quando falar.
- Alguns propõem prever a alternância de turno diretamente a partir do áudio e fazer modelagem contínua de “intenção” e estilo de conversa para tornar as interações mais humanas.
Visão e integração de contexto
- Há interesse em um assistente para desktop/mobile que possa acessar o contexto da tela por meio de capturas de tela, APIs de acessibilidade ou modelos multimodais, enquanto gerencia latência e alucinações.
- Ideias de longo prazo incluem visão em casa para rastrear objetos (“onde estão minhas chaves?”) e “atenção artificial” persistente que lembra tudo o que está na tela.
Implementação, implantação e hardware
- O projeto é elogiado, mas há frustração com a complexidade de empacotamento em Python, com a distribuição “centrada em exemplos” do TensorRT e com a ferramenta de download personalizada do Hugging Face.
- Usuários pedem instaladores simples (.deb/.rpm/.dmg) ou, no mínimo, um único comando Docker; os mantenedores planejam simplificar a demo baseada em Docker.
- Testado em RTX 3090/4090; suporte a Jetson e backends CoreML são desejados, mas atualmente estão “em progresso” ou pouco claros.