Modelos generativos: ¿Qué saben? ¿Saben cosas? Vamos a averiguarlo

Los modelos generativos de imágenes parecen aprender implícitamente propiedades 3D de la escena como profundidad, normales de superficie, albedo e iluminación, aunque solo se entrenen con imágenes 2D y texto. Los comentaristas ven esto como evidencia de que estos sistemas construyen representaciones internas, interpretables por humanos, en lugar de limitarse a “pegar” píxeles, lo que abre el debate sobre si esto cuenta como verdadero modelado del mundo o comprensión frente a un emparejamiento de patrones sofisticado. El trabajo también alimenta la especulación sobre aplicaciones en visión, VR y reconstrucción 3D, así como preguntas más amplias sobre hasta qué punto estos modelos se asemejan a la percepción y el aprendizaje humanos.

Acceso / Configuración

  • Algunos usuarios vieron problemas de SSL en el sitio principal; otros confirmaron el certificado y compartieron el espejo de GitHub.
  • Se compartieron detalles del fingerprint del certificado para mostrar que es válido al menos desde algunas ubicaciones.

Representaciones internas 3D / de escena

  • A muchos les llama la atención que los modelos generativos de imágenes aparentemente representen de forma implícita la profundidad, las normales de superficie, el albedo y posiblemente propiedades del material como la especularidad.
  • Esto se compara con los pipelines tradicionales de renderizado basado en física y con deferred shading/G-buffers.
  • El hecho de que los modelos autoregresivos y de difusión, entrenados solo con imágenes 2D + texto, puedan producir mapas de profundidad/normales de alta calidad sorprende a la gente y se toma como evidencia de un “modelo del mundo” interno o de un motor 3D.

“Comprensión” vs. loros estocásticos

  • Un lado argumenta que estos modelos claramente aprenden estructuras abstractas, interpretables por humanos, socavando la visión de “loro estocástico” / mera regurgitación.
  • Otros replican que no hay “cero evidencia” de comprensión genuina y que los modelos siguen optimizando para reproducir las estadísticas de los datos de entrenamiento.
  • Una postura intermedia: la “comprensión” se entiende mejor como tener un modelo causal interno que generaliza; bajo ese criterio, es un espectro, no un binario.

Qualia, conciencia y comparación con los humanos

  • Algunos equiparan la crítica a la comprensión de la IA con antiguos debates sobre las almas.
  • Otros insisten en que hay una brecha fundamental: los humanos tienen qualia y voluntad; los modelos no, y ni siquiera sabemos cómo detectarlo.
  • Hay objeciones a eso: los qualia quizá estén mal definidos y posiblemente sean reducibles a estados internos y auto-modelos; si es así, sistemas como estos podrían llegar a calificar.

Escepticismo sobre los modelos del mundo

  • Los críticos sostienen que un razonamiento 3D consistente eliminaría artefactos (extremidades extra, perspectivas defectuosas), que siguen ocurriendo.
  • Algunos señalan que las herramientas tradicionales pueden estimar normales/profundidad a partir de una sola imagen sin afirmar una simulación completa del mundo.
  • No está claro si la UNet subyacente fue entrenada alguna vez con datos emparejados de G-buffer; algunos sospechan que eso podría ser la “salsa secreta” oculta.

Cómo funciona I-LoRA (a alto nivel)

  • Las explicaciones enfatizan que I-LoRA añade un pequeño número de parámetros entrenables (LoRA) encima de un modelo base congelado y solo afina esos.
  • Como se cambian <1% de los parámetros y aun así emergen buenas normales/profundidad, los comentaristas infieren que el modelo base ya contiene representaciones casi listas; LoRA solo las “lee”.

Aplicaciones y extensiones

  • La gente prevé beneficios para VR/computación espacial (vistas estéreo), reconstrucciones 3D relightables (p. ej., gaussian splatting) y mejores mapas de profundidad, aunque algunos señalan que los mapas de profundidad típicos se rompen en uso real.
  • Hay curiosidad por saber si técnicas similares podrían aplicarse a modelos de texto (p. ej., edición de conocimiento factual) y a otros sistemas generativos, incluidos NN-generating NNs.

Sora, simulación del mundo y alucinaciones

  • Algunos vinculan este trabajo con las reacciones a Sora, tomando ambos como evidencia de que los modelos de video ejecutan una simulación física implícita en lugar de simplemente “pegar clips”.
  • Otros destacan artefactos llamativos de Sora (p. ej., extremidades extra) como razones para dudar de un modelado físico robusto.
  • Las alucinaciones humanas y las distorsiones oníricas se citan como analogía: salidas defectuosas no significan necesariamente ausencia de un modelo del mundo.

Tamaño de LoRA y “extracción real” vs. modelo nuevo

  • Una preocupación es que una LoRA con millones de parámetros podría estar haciendo la mayor parte del trabajo, creando normales/profundidad plausibles en lugar de exponer realmente la estructura existente.
  • Los partidarios señalan controles: cuando LoRA se entrena sobre una UNet inicializada aleatoriamente, los mapas intrínsecos colapsan, lo que sugiere que las características del modelo preentrenado son esenciales.

Uso en imágenes reales y extracción de profundidad / normales

  • La afirmación del artículo de que los modelos de difusión son estructuras imagen-a-imagen hace que aplicarlos a fotos reales sea sencillo.
  • Se demuestran profundidad y normales a partir de fotos reales; el albedo/iluminación a partir de fotos reales sigue siendo especulativo, pero se ve como especialmente emocionante para relighting.

Relación con trabajos más amplios de interpretabilidad

  • Los comentaristas conectan esto con otros resultados de interpretabilidad mecanicista (p. ej., estructura interna en transformadores que juegan Othello, edición de hechos en LLMs).
  • La imagen emergente: los grandes modelos generativos codifican representaciones intermedias ricas que pueden aprovecharse con entrenamiento adicional relativamente ligero.

Financiación y reacción por el título / cultura pop

  • Hay diversión y algo de sorpresa por parte de financiadores corporativos (p. ej., empresas automotrices y de software creativo) apoyando una investigación con un título caprichoso, inspirado en la TV.
  • La referencia al concurso de Bojack Horseman es muy apreciada, lo que lleva a discutir la mezcla de humor y oscuridad del programa y cómo eso refleja el encuadre juguetón del artículo sobre un trabajo serio.