¿Qué tan grande es YouTube?
Los investigadores han usado una técnica de muestreo ingeniosa —tratando los IDs de video de 64 bits de YouTube como un enorme espacio de direcciones y sondeándolo al azar— para estimar que hay aproximadamente 13 mil millones de videos públicos en la plataforma, lo que permite inferencias aproximadas sobre vistas, idiomas y necesidades de almacenamiento a escala de exabytes. Los comentaristas analizan los supuestos estadísticos detrás de este método, debaten cómo la asignación de IDs, el comportamiento del autocompletado y los “trucos” podrían sesgar los resultados, y lo comparan con técnicas de captura-recaptura en ecología. El hilo también deriva hacia preocupaciones sobre sistemas de recomendación opacos, el acceso restringido a las API tras escándalos de privacidad y si las grandes plataformas deberían estar obligadas a publicar estadísticas agregadas para investigar la desinformación y la influencia mediática.
Método de estimación y razonamiento estadístico
- La discusión se centra en una técnica de muestreo ingeniosa para estimar el total de videos de YouTube sondeando el espacio de IDs y midiendo la tasa de aciertos.
- Varios comentarios la relacionan con captura-recaptura, problemas de especies no observadas, Monte Carlo y el problema del tanque alemán.
- Varias personas sostienen que el estimador no requiere que los IDs de video estén distribuidos uniformemente; siempre que las sondas sean uniformes sobre el verdadero espacio de IDs, la probabilidad de acierto es “IDs asignados / IDs totales”.
- Otros se preocupan inicialmente por IDs sesgados o estructurados; las respuestas recorren pequeños ejemplos didácticos que muestran que la agrupación no cambia la probabilidad de acierto.
- Un comentarista calcula una desviación estándar implícita de menos del 1% de la estimación, y argumenta que el método es estadísticamente bastante preciso dada la enorme cantidad efectiva de muestras.
“Trucos”, independencia y sesgos
- El principal “truco” es usar la insensibilidad a mayúsculas y minúsculas de la búsqueda de YouTube y cadenas OR de IDs aleatorios para que cada consulta cubra ~32.000 IDs reales.
- Preocupaciones: esto puede sobremuestrear IDs que contienen letras frente a dígitos/símbolos, y depende de que el motor de búsqueda devuelva todas las coincidencias; además excluye videos privados y, en la práctica, no listados.
- Algunos temen que estos trucos rompan la independencia o hagan que la muestra no sea aleatoria; otros creen que el efecto es menor y que hacerlo a fuerza bruta sería computacionalmente inviable.
- Se especula sobre cómo YouTube podría frustrar estudios así (redirecciones aleatorias, resultados falsos, ocultar búsquedas de hashes aleatorios), pero varios señalan que estas contramedidas serían costosas y a menudo detectables.
Implicaciones, acceso y regulación
- Algunos sostienen que plataformas tan grandes son cuasi-servicios públicos y que por ley deberían publicar estadísticas agregadas (p. ej., dislikes, alcance) para una supervisión democrática.
- Otros responden que YouTube tiene competidores y que los reguladores deberían centrarse en privacidad, antimonopolio y normas de contenido, no en obligar a divulgar datos.
- Varios ven los bloqueos de API (después de Cambridge Analytica y, en general, más ampliamente) como parte de la “muerte de la web abierta”, y elogian la investigación basada en scraping como una solución alternativa.
- Se destacan como importantes las disposiciones de la Ley de Servicios Digitales de la UE que exigen acceso a datos para investigadores verificados, aunque potencialmente sesgadas por la “verificación”.
Escala de YouTube, almacenamiento e impacto
- Usando el número estimado de videos y supuestos aproximados de bitrate/duración, los comentaristas derivan necesidades de almacenamiento de varios exabytes, y algunos argumentan que los requisitos reales (múltiples códecs, resoluciones, replicación, originales) probablemente empujen a YouTube hacia decenas o incluso ~100 exabytes.
- Hay una discusión secundaria sobre códecs (H.264, VP9, AV1, HEVC), subidas originales y si se conservan los originales.
- Un enlace aporta emisiones de Google del orden de 10 millones de toneladas de CO₂/año, algo que algunos consideran llamativo para una sola empresa.
Experiencia de usuario y recomendaciones
- Varios usuarios informan que la búsqueda y las recomendaciones se sienten “encogidas” pese al enorme tamaño de YouTube: feeds de inicio repetitivos, contenido irrelevante de “Para ti” y dificultad para descubrir la cola larga.
- Entre las soluciones están usar filtros en la búsqueda y depender de la página de suscripciones; algunos usan scripts para evitar el feed de inicio.
- Otros señalan que, desde la perspectiva de YouTube, es más barato si todos ven un pequeño subconjunto repetidamente, lo que crea una tensión entre descubrimiento y monetización.
Miscelánea
- El hilo menciona el sitio público de estadísticas que lo acompaña y un conjunto de datos aparte de “dislikes de YouTube” como recursos valiosos para la investigación.
- Un único comentario extremadamente conspirativo sobre una “Alianza” eliminando “plataformas comunistas” es ampliamente ridiculizado, incluso por el uso excéntrico de punto y coma, y se usa para ilustrar cómo las creencias marginales se filtran en discusiones convencionales.