Show HN: Refiz o demo falso do Google Gemini, só que usando GPT-4 e é real

Um desenvolvedor recriou o vídeo de lançamento polido do Google Gemini usando a API de visão do GPT‑4 e ferramentas padrão de fala do navegador, mostrando que o mesmo tipo de “mágica” multimodal já é possível com tecnologia pronta para uso por apenas centavos por sessão. Comentaristas contrastam isso com o demo fortemente editado do Google, criticando marketing enganoso, incentivos de curto prazo nas ações e o que veem como um padrão de superestimar modelos pouco impressionantes. A discussão também explora limites técnicos dos sistemas multimodais atuais — como falta de entrada contínua real de vídeo/áudio, latência e custo — e aponta alternativas de código aberto como LLaVA e inferência local como direções promissoras.

Demo e Capacidades

  • Comentaristas consideram o demo de visão do GPT‑4 impressionante e observam que funcionalidades semelhantes já eram possíveis desde o GPT‑4V (intercalando imagens e texto).
  • O autor relata 77 chamadas à API de visão custando cerca de $0.47; alguns veem isso como razoável para demos, mas se preocupam com os custos de uso diário em produção.

Comparação com o Demo do Gemini do Google

  • Muitos argumentam que isso mostra que o Google poderia ter feito um demo real e honesto em vez de uma “visualização” fortemente editada.
  • Alguns veem o vídeo do Gemini como marketing enganoso que prejudicou a confiança e o sentimento dos investidores; outros observam que as ações subiram inicialmente e dizem que o impacto real é incerto.
  • Há debate sobre o quanto foi realmente “falsificado”, mas é amplamente aceito que o Google depois admitiu pós-processamento substancial e alterações no prompt.

Abordagem Técnica: Frames, Áudio, Latência

  • Este demo captura screenshots periódicas (por exemplo, a cada ~800 ms) em vez de vídeo contínuo de verdade.
  • Vários comentários argumentam que “vídeo é só frames”, enquanto outros enfatizam que continuidade temporal, previsão de movimento e áudio sincronizado tornam o vídeo real qualitativamente diferente.
  • O áudio é tratado separadamente via speech-to-text e text-to-speech do navegador; as pessoas se surpreendem com a eficácia das APIs nativas do navegador.

Interação Multimodal em Tempo Real e Turn-Taking

  • Vários comentários destacam que a “mágica” no anúncio do Gemini era a escuta contínua e saber quando falar ou ficar em silêncio.
  • As pessoas propõem:
    • Tokens especiais ou treinamento para pausas/turn-taking.
    • Modelos leves de “monitor” que decidem quando acordar o grande LLM.
    • Heurísticas baseadas em detecção de silêncio/movimento e transcrições parciais.
  • Um protótipo de sistema de chat por voz contínuo é descrito com baixa latência e capacidade de interrupção, mas com limitações de confiabilidade, turn-taking e ausência de tratamento de emoção/prosódia.

Alternativas Locais e de Código Aberto

  • LLaVA e llamafile são elogiados pelo forte desempenho de visão no dispositivo; exemplos incluem renomear fotos automaticamente com base no conteúdo da imagem.
  • Complicações de licenciamento são observadas: o código pode ser permissivo (Apache 2.0), enquanto os pesos não são comerciais.
  • Alguns sugerem inferência local (por exemplo, via LocalAI/Mistral) como um caminho para reduzir custos por uso.

Negócios, Ética e Hype em Torno do Google

  • Muitos veem o Gemini como parte de um padrão de demos super-hyped ou enganosas do Google e produtos fracassados.
  • Há discussão sobre incentivos de curto prazo nas ações, problemas principal–agente e “metric hacking” impulsionando marketing enganoso.
  • Alguns agora duvidam que o Google tenha tido modelos ocultos significativamente melhores; o Gemini Ultra é visto, no máximo, como não claramente à frente do GPT‑4.

Projetos Derivados e a Realidade de UX

  • Um comentarista relata que o app de tradução conversacional do Google parece inutilizável na vida real, reforçando o ceticismo em relação a demos polidos.
  • Taxas de erro em reconhecimento de voz e frustração cumulativa são destacadas, especialmente para uso contínuo e acessibilidade.
  • Inspirado pelo demo, alguém construiu um sistema “Chapéu Seletor” para lixo/composto/reciclagem, testado ao vivo com uma criança, mostrando usos educacionais imediatos.