Show HN: Remake la falsa demo de Google Gemini, excepto usando GPT-4 y es real

Un desarrollador recreó el pulido video de lanzamiento de Gemini de Google usando la API de visión de GPT‑4 y herramientas estándar de voz del navegador, mostrando que el mismo tipo de “magia” multimodal ya es posible con tecnología lista para usar por solo centavos por sesión. Los comentaristas contrastan esto con la demo muy editada de Google, criticando el marketing engañoso, los incentivos bursátiles a corto plazo y lo que ven como un patrón de exagerar modelos decepcionantes. El hilo también explora los límites técnicos de los sistemas multimodales actuales —como la falta de entrada continua real de video/audio, la latencia y el coste— y señala alternativas de código abierto como LLaVA y la inferencia local como direcciones prometedoras.

Demo y capacidades

  • Los comentaristas consideran impresionante la demo de visión con GPT‑4 y señalan que una funcionalidad similar ha sido posible desde GPT‑4V (intercalando imágenes y texto).
  • El autor informa de 77 llamadas a la API de visión con un coste de unos $0.47; algunos creen que eso es razonable para demos, pero se preocupan por los costes del uso diario en producción.

Comparación con la demo de Gemini de Google

  • Muchos sostienen que esto demuestra que Google podría haber hecho una demo real y honesta en lugar de una “visualización” muy editada.
  • Algunos ven el video de Gemini como marketing engañoso que perjudicó la confianza y el sentimiento de los inversores; otros señalan que la acción subió inicialmente y dicen que el impacto real no está claro.
  • Hay debate sobre cuánto se “falseó” realmente, pero se acepta ampliamente que Google luego admitió un posprocesamiento sustancial y cambios en los prompts.

Enfoque técnico: fotogramas, audio, latencia

  • Esta demo captura capturas de pantalla periódicas (por ejemplo, cada ~800 ms) en lugar de video continuo real.
  • Varios comentarios argumentan que “el video son solo fotogramas”, mientras que otros destacan que la continuidad temporal, la predicción del movimiento y el audio sincronizado hacen que el video real sea cualitativamente diferente.
  • El audio se maneja por separado mediante reconocimiento de voz y síntesis de voz del navegador; sorprende a la gente lo eficaces que pueden ser las API integradas del navegador.

Interacción multimodal en tiempo real y turn-taking

  • Varios comentarios destacan que la “magia” del promo de Gemini era la escucha continua y saber cuándo hablar o quedarse en silencio.
  • La gente propone:
    • Tokens especiales o entrenamiento para pausas/turn-taking.
    • Modelos ligeros de “monitor” que decidan cuándo despertar al gran LLM.
    • Heurísticas basadas en detección de silencio/movimiento y transcripciones parciales.
  • Se describe un prototipo de sistema continuo de chat por voz con baja latencia y capacidad de interrupción, pero con limitaciones en fiabilidad, turn-taking y falta de manejo de emoción/prosodia.

Alternativas locales y de código abierto

  • Se elogia a LLaVA y llamafile por su gran rendimiento de visión en el dispositivo; entre los ejemplos figura renombrar automáticamente fotos a partir del contenido de la imagen.
  • Se señalan complicaciones de licencia: el código puede ser permisivo (Apache 2.0) mientras que los weights no son comerciales.
  • Algunos sugieren la inferencia local (por ejemplo, mediante LocalAI/Mistral) como una vía para reducir los costes por uso.

Negocio, ética y hype en torno a Google

  • Muchos ven Gemini como parte de un patrón de demos de Google exageradas o engañosas y de productos fallidos.
  • Hay discusión sobre incentivos bursátiles a corto plazo, problemas principal-agente y “metric hacking” que impulsan marketing engañoso.
  • Algunos ahora dudan de que Google haya tenido alguna vez modelos ocultos significativamente mejores; Gemini Ultra se considera, en el mejor de los casos, no claramente por delante de GPT‑4.

Proyectos posteriores y realidad de la UX

  • Un comentarista informa de que la app conversacional de traducción de Google resulta inutilizable en la vida real, lo que refuerza el escepticismo sobre las demos pulidas.
  • Se destacan las tasas de error del reconocimiento de voz y la frustración acumulada, especialmente para uso continuo y accesibilidad.
  • Inspirado por la demo, alguien construyó un sistema “Sorting Hat” para basura/compost/reciclaje, probado en vivo con un niño, mostrando usos educativos inmediatos.