Qué le pasó a TheNumbers.com
El scraping web impulsado por IA y el arbitraje en mercados de predicción están abrumando a sitios pequeños y ricos en datos como TheNumbers.com, empujando los costes de ancho de banda e infraestructura más allá de lo que pueden sostener operadores aficionados o con financiación limitada. Los comentaristas debaten si una mejor caché, CDNs y reescrituras a sitio estático pueden resolver el problema, o si la cuestión central es que las empresas de IA y las plataformas de apuestas externalizan los costes mientras monetizan los datos extraídos. Muchos temen que esta dinámica empuje más información valiosa detrás de muros de pago o la haga desaparecer por completo, socavando la web abierta y los recursos impulsados por voluntarios.
Múltiples problemas superpuestos
- Los comentaristas señalan que el artículo mezcla varios problemas:
– Tráfico excesivo de bots y coste de ancho de banda
– Scraping que elude el acceso de pago/licenciado
– Riesgo de seguridad por atacantes que sondean datos tempranos/privilegiados - Algunos creen que este es un caso de nicho (base de código antigua, datos de nicho, ángulo de mercados de predicción) más que una historia general de “la IA mató la web”; otros lo ven como emblemático.
Ideas de mitigación técnica y limitaciones
- Muchos sugieren reconstrucciones como sitio estático, caché agresiva (Varnish/CDNs) o protección al estilo Cloudflare; algunos afirman que esto es casi un “proyecto de fin de semana” con herramientas modernas y ayuda de LLM.
- Réplica:
– Lo estático/el caché no resuelve el modelo de negocio si los bots extraen todo el valor.
– La salida de datos en la nube/CDN puede ser ruinosa bajo carga de scrapers; hay ejemplos de decenas de TB de HTML y facturas mensuales de más de $1k para sitios de aficionados.
– Los bots con proxies residenciales y navegadores sin interfaz ignoran robots.txt y son difíciles de bloquear.
– La invalidación de caché y los endpoints de búsqueda dinámicos siguen siendo, en esencia, difíciles.
Economía, modelos de negocio e incentivos
- TheNumbers aparentemente depende más de la venta de datos privados que de la publicidad; los bots no hacen clic en anuncios ni pagan.
- Varios esperan que más contenido pase a muros de pago, se mueva a plataformas de datos alojadas, o simplemente desaparezca.
- Algunos proponen infraestructura de micropagos o de “los bots deben pagar”; otros dudan de que esto pueda funcionar social o técnicamente.
Los mercados de predicción como motor
- Muchos ven los mercados de predicción no regulados como el incentivo clave para el scraping abusivo e incluso el hacking para adelantarse a las publicaciones de datos.
- Soluciones propuestas: bloquear las operaciones antes del cierre, o prohibir por completo esos mercados; contrapunto: la competencia y la indiferencia de los usuarios hacia la equidad hacen improbable la autorregulación.
Ética del scraping y del entrenamiento de IA
- Fuerte división:
– Un lado: si publicas abiertamente, no deberías controlar quién o qué consume el contenido; el entrenamiento de IA es solo otro uso.
– El otro lado: ver cómo el trabajo gratuito se absorbe en modelos propietarios se siente explotador y desincentiva futuras contribuciones abiertas, especialmente cuando la IA devuelve casi nada de tráfico e impone costes reales. - Algunos discuten nuevas licencias (p. ej., variantes de GPL/AGPL) para restringir el entrenamiento, con escepticismo sobre si serían aplicables si el entrenamiento se considera uso legítimo.
Futuro de la web abierta
- Hay una preocupación generalizada de que los scrapers de IA “socializan los costes, privatizan los beneficios” y aceleran el declive de los recursos abiertos y gestionados por aficionados.
- Otros ven la IA como una herramienta poderosa que también puede ayudar a asegurar y modernizar esos sitios, si sus mantenedores deciden استخدامها.