El pelícano de Karpathy
Una demostración viral de un modelo de IA generando una escena 3D de *The Lord of the Rings* a partir de prompts de texto se está usando para debatir qué hace que un benchmark sea significativo para los modelos de lenguaje grandes. Los comentaristas comparan esta nueva animación 3D “de una sola toma” con las pruebas SVG anteriores del “pelícano en bicicleta”, discutiendo si estas proezas muestran un progreso real en razonamiento, comprensión espacial y creación de software o si solo producen un “slop” cada vez más pulido pero de poco valor. Muchos también cuestionan los costes económicos, creativos y medioambientales de quemar grandes presupuestos de tokens para demos llamativas, y si los sistemas de IA están cerca de construir de forma fiable cosas útiles, divertidas o robustas en entornos del mundo real.
Nuevo benchmark: animación 3D de LotR vs. SVG del pelícano
- El hilo se centra en reemplazar la prueba SVG del “pelícano en bicicleta” por un benchmark más difícil: generar una animación en three.js de la apertura de The Lord of the Rings.
- Algunos consideran que es una mejor prueba de esfuerzo: larga, espacial, narrativa, requiere código, física y trabajo de cámara, no solo un dibujo estático.
- Otros sostienen que LotR es una mala elección porque los modelos están saturados con su texto e imágenes, así que podrían estar copiando las películas en lugar de “entender” el pasaje.
Valor y diseño de los benchmarks
- Quienes lo apoyan: las nuevas tareas deberían empezar con un rendimiento pésimo y dejar margen de mejora; los SVG del pelícano ya convergieron y discriminan menos.
- Críticos: el pelícano no está “resuelto” (las bicicletas siguen sin funcionar), así que pasar a otra cosa es prematuro y está impulsado por el atractivo de la demostración.
- Varios piden benchmarks vinculados a tareas del mundo real (auditoría, UIs, backends, máquinas expendedoras), no a proezas arbitrarias.
Calidad, creatividad y “AI slop” en juegos/medios
- Muchos señalan que los juegos y escenas 3D generados por IA se ven impresionantes en clips, pero son aburridos, rotos o injugables; los comparan con “demo porn” o un “oso bailarín”.
- Los escépticos dudan de que los LLM puedan optimizar de forma significativa para la “diversión” o el estilo creativo de un juego.
- Algunos ven una utilidad clara como asistente de shaders/gráficos/código, no como diseñador autónomo de juegos.
Entretenimiento hiperpersonalizado vs. cultura compartida
- Un bando imagina películas/juegos de IA “1:1” a partir de prompts de alto nivel (elige tu propia aventura a escala).
- Otro responde: la mayoría de la gente no tiene deseos específicos de contenido personalizado y valora las experiencias comunitarias (por ejemplo, comentar juntos la misma franquicia).
Capacidades y debilidades
- Evidencias de fortalezas: generación de escenas no triviales en three.js/WebGL, integraciones con Blender, animaciones procedurales, experimentos de texto→música.
- Debilidades persistentes: razonamiento espacial (bicicletas, mesas de pinball, impresiones 3D), restricciones del mundo real e incapacidad para auditar de forma robusta sus propias salidas.
- Algunos señalan que los rechazos por copyright son inconsistentes; otros se preocupan por la fuerte dependencia de datos de entrenamiento icónicos (p. ej., las películas de LotR).
Coste, externalidades y el encuadre de “~gratis”
- Se cuestiona la narrativa de “
gratis”: solo la demo de LotR costó ~1M de tokens ($10) y se apoya en centros de datos grandes y de gran consumo de recursos. - Se plantean los impactos ambientales y en la infraestructura local de los centros de datos como contrapunto a tratar las ejecuciones grandes como si fueran prácticamente gratis.
Software y herramientas desechables
- Varios prevén “software desechable”: herramientas puntuales generadas rápidamente con LLM en lugar de productos pulidos.
- Otros sostienen que el software duradero y mantenido sigue siendo económicamente superior; la regeneración constante para sistemas complejos es poco práctica y costosa en tokens.
Confianza, hype y mensajes
- Algunos comentaristas están impresionados por las rápidas mejoras de capacidades; otros ven exageración, marketing corporativo y narrativas cambiantes sobre los plazos.
- Sigue habiendo tensión entre el entusiasmo por las posibilidades y la frustración por el hype, el slop y las demostraciones superficiales optimizadas para la atención.