La aplicación estrella de Gemini Pro 1.5 es usar video como entrada
El modelo Gemini Pro 1.5 de Google puede aceptar entradas de video largas muestreándolas como fotogramas de imagen (aproximadamente un fotograma por segundo a ~258 tokens cada uno), lo que permite tareas como indexar una estantería a partir de un breve video de teléfono en lugar de la entrada manual de datos o el OCR tradicional. Los comentaristas lo comparan con GPT-4 Vision, examinan cómo funcionan realmente los tokens de video e imagen, y debaten la precisión, las alucinaciones, el coste y la viabilidad de usar estos sistemas para moderación o automatización. Un trasfondo importante es la preocupación por la privacidad y la vigilancia: una vez que las secuencias de video pueden entenderse barato y a escala, todo, desde los “asistentes de memoria” personales hasta los panópticos estatales y corporativos, se vuelve mucho más factible.
Cómo Gemini 1.5 maneja el video
- El video se trata, en la práctica, como una secuencia de imágenes; la documentación y el informe indican que se extrae aproximadamente ~1 fotograma/segundo, y se descarta el audio.
- Un ejemplo de película de 45 minutos en el informe: 2.674 fotogramas a 1 FPS ≈ 684k tokens; el coste por fotograma coincide con el uso de tokens de una sola imagen.
- Varios comentaristas confirman la matemática de tokens: ~258 tokens por imagen, ~1.800 tokens para un clip de 7 s ⇒ ~7 fotogramas ≈ 1 FPS.
- Se menciona la segmentación de escenas y la indexación para videos más largos, pero los detalles son a nivel de herramientas y no se describen por completo.
Tokens, codificación multimodal y confusión
- A varias personas les cuesta entender cómo se aplican los “tokens” a imágenes/video.
- Un grupo sostiene que las imágenes se convierten en texto descriptivo antes de entrar al LLM; otro apunta a artículos de Google (Flamingo, PaLI, modelos tipo ViT) que dicen que las imágenes se tokenizan como parches visuales, no mediante un paso externo de OCR.
- Consenso: la facturación se expresa en “tokens” por familiaridad para el usuario, pero los tokens internos de imagen no son lo mismo que los tokens de texto; el mapeo interno exacto no está claro.
Comparación con GPT-4V y el OCR clásico
- El informe afirma que Gemini 1.5 puede procesar hasta una hora de video a 1 FPS, mientras que GPT-4V supuestamente falla alrededor de 3–4 minutos a 1 FPS.
- El coste por fotograma parece menor que el de GPT-4V en alta definición.
- Muchos señalan que indexar estanterías es, básicamente, un OCR sofisticado más contexto largo. Los defensores dicen que la novedad es la escala + el razonamiento multimodal; los escépticos dicen que flujos similares (fotogramas + OCR + LLM) ya son posibles con otras herramientas.
Casos de uso y aplicaciones
- Usos sugeridos: indexación de bibliotecas personales, comprensión de video para analítica, moderación de contenido, reconocimiento de tráfico/matrículas, asistentes de flujo de trabajo que “observan” tu pantalla, monitoreo de postura, aprendizaje de idiomas, registros personales de “memoria perfecta”.
- Algunos lo ven como una “aplicación estrella” para convertir rápidamente imágenes desordenadas del mundo real en datos estructurados.
Seguridad, moderación y censura
- Fuerte crítica a los filtros de seguridad demasiado agresivos (p. ej., bloquear “cocktail”, términos sexuales, algunas imágenes históricas).
- Debate sobre si esas barreras son necesarias o si debería ofrecerse modos menos filtrados.
- La inyección de prompts mediante video se señala como una preocupación real.
Privacidad, vigilancia e impacto social
- Preocupación extensa de que la comprensión de video barata y escalable destruya la privacidad práctica y potencie enormemente la vigilancia estatal y corporativa (protestas, perfilado de consumidores, aplicación de la ley).
- Algunos aceptan más vigilancia por seguridad (p. ej., control de tráfico); otros argumentan que esto socava la democracia y la protesta.
Escepticismo y limitaciones
- Los errores en los títulos de libros extraídos y las alucinaciones reducen la confianza para usos archivísticos o críticos; muchos ven los LLM como aceleradores que requieren revisión humana.
- Debate sobre si los LLM actuales son juguetes o herramientas serias de automatización; varios señalan que ya pueden reemplazar tareas humanas estrechas a escala pese a tasas de error no nulas.