Google llegó a un acuerdo con Reddit para datos de entrenamiento de IA
El acuerdo de Google por $60M al año para licenciar datos de Reddit para el entrenamiento de IA está generando debate sobre quién debería beneficiarse cuando el contenido generado por usuarios se monetiza. Los comentaristas cuestionan si el archivo de publicaciones de Reddit es realmente de alta calidad o está muy manipulado por astroturfing, y si este movimiento erosionará aún más el “internet abierto” al empujar más conversaciones hacia espacios privados o con muro de pago. Otros señalan que los términos de servicio de Reddit ya permiten una reutilización amplia del contenido, presentan el acuerdo como una monetización impulsada por la IPO similar a la venta de anuncios, y se preocupan de que los contribuyentes no verán ninguna ganancia financiera.
Tamaño del acuerdo, valor y exclusividad
- Muchos ven $60M/año como barato dada la centralidad de Reddit para la búsqueda y su valoración prevista de $5B en la IPO; algunos estiman que las consultas en Reddit representan una gran parte de su propio uso de Google.
- Otros sostienen que no se pueden comparar las tarifas anuales de licencia con el valor total de la empresa; Reddit puede revender datos a muchos proveedores de IA.
- Varios sugieren que el pago es por acceso incremental a la API y cobertura legal, ya que Google ya indexa Reddit; la exclusividad es ampliamente puesta en duda.
- Una opinión minoritaria: pagar por datos que los usuarios crearon gratis es “obsceno”, especialmente sin reparto de ingresos con los usuarios, mientras que otros responden que el alojamiento y la construcción de comunidad justifican la parte de Reddit.
Propiedad de los datos, compensación y TOS
- Varios comentarios destacan que los TOS de Reddit le otorgan derechos amplios, perpetuos y sublicenciables; los usuarios consienten efectivamente la reventa de datos.
- Algunos argumentan que, si la gente quisiera que le pagaran, no publicaría en abierto y gratis; otros dicen que publicaron para debatir y por alojamiento financiado con anuncios, no como datos de entrenamiento.
- Preocupa que esto desplace internet de un “mercado de ideas” a materia prima para IA y accionistas, erosionando la buena voluntad.
- Comparaciones con StackOverflow y la publicidad: debate sobre si el acuerdo datos-por-anuncios era un intercambio implícito “más justo” que datos-por-IA.
Impacto en la web abierta, la privacidad y las plataformas
- Varios creen que el scraping de cualquier contenido público por IA ya es inevitable; se espera que más conversaciones se trasladen a espacios privados o semiprivados (Discord, etc.), aunque estos también podrían monetizar datos.
- Otros ven peligrosa y poco regulada esta centralización tanto de datos como de cómputo en unas pocas empresas.
- Algunos interpretan el movimiento como preparación para la IPO y monetización de APIs a largo plazo, incluido el cierre de APIs públicas y del acceso desde búsquedas.
Calidad y sesgo de los datos de Reddit
- Hay un fuerte escepticismo de que Reddit sea buen dato de entrenamiento: mucho astroturfing, bots manipulando votos, cámaras de eco y respuestas de “hive mind” seguras pero erróneas.
- Preocupan los sesgos políticos e ideológicos, además de agendas de moderación agresivas en algunos subreddits, que podrían sesgar la IA.
- Bromean con que esto hará a la IA más sarcástica, moralista y equivocada, pero también reconocen que muchos LLM ya usaron volcados antiguos de Reddit.
Respuestas de los usuarios y contramedidas
- Algunos dicen que reducirán o dejarán de contribuir a Reddit, “votando con su tiempo”.
- Se comparten herramientas para borrar masivamente o desordenar contenido anterior de Reddit como medida defensiva, aunque persisten dudas sobre lo que Reddit conserva y revende.