Todo modelo aprendido por descenso de gradiente es aproximadamente una máquina de kernels (2020)

Las redes neuronales entrenadas por descenso de gradiente pueden reformularse matemáticamente como máquinas de kernels, pero los comentaristas sostienen que esta equivalencia es sobre todo de interés teórico: los kernels implícitos dependen de toda la trayectoria de entrenamiento y no ofrecen las ventajas prácticas de los métodos clásicos de kernels. El hilo se expande hacia un debate más amplio sobre si los modelos profundos modernos —especialmente los grandes modelos de lenguaje y los modelos generativos de vídeo— memorizan principalmente los datos de entrenamiento o si realmente generalizan, abordando la eficiencia, el papel de la memoria asociativa y lo que estos comportamientos implican para las afirmaciones sobre la inteligencia artificial general.

Máquinas de kernels vs redes neuronales

  • Varios comentaristas señalan que desde hace tiempo se sabe que las redes neuronales simples se relacionan con los métodos de kernels y los procesos gaussianos; algunos ven el artículo de 2020 más como una exposición que como algo original.
  • Una crítica clave: el “kernel” construido depende de toda la trayectoria de entrenamiento del descenso de gradiente. Esto lo hace distinto de los métodos clásicos de kernels, donde el kernel es en su mayoría independiente de los datos (por ejemplo, gaussiano con parámetros ajustables).
  • Como cada nuevo punto de datos cambia toda la trayectoria de entrenamiento, no se obtienen actualizaciones incrementales al estilo kernel; toda la complejidad quizá solo se “traslada al kernel”, lo que limita la utilidad práctica.
  • Otros señalan que muchos métodos de ML son, en un sentido amplio, memorización sofisticada sobre una representación de características, así que llamar a los modelos entrenados por descenso de gradiente “máquinas de kernels” puede ser técnicamente cierto pero no muy esclarecedor.

Memorización vs generalización en los modelos modernos

  • Un subhilo importante debate si los resultados llamativos de los modelos grandes (LLMs, modelos de vídeo) son sobre todo memorización o evidencia de una generalización más amplia.
  • Un bando sostiene: el detalle visual o textual fino probablemente proviene de repetir datos de entrenamiento; las particiones opacas entre entrenamiento y prueba permiten “lavado de datos”.
  • El otro bando responde con tareas que parecen requerir aprendizaje genuino de patrones e inducción algorítmica (por ejemplo, regresión en contexto, seguimiento de gramática, sistemas que juegan Go, composiciones nuevas de imágenes).
  • El desacuerdo gira en torno a la definición de “memorización”: reutilización exacta de ejemplos frente a aprendizaje de representaciones comprimidas de alto nivel y algoritmos a partir de ejemplos.

Inteligencia humana, memoria y comparación con la IA

  • Muchos comentarios trazan paralelos: expertos humanos (fontaneros, abogados, ingenieros, grandes maestros de ajedrez) dependen en gran medida de la memoria y la reutilización de patrones; la creatividad suele ser derivativa.
  • Otros discrepan, enfatizando la capacidad humana para manejar situaciones realmente nuevas, reutilizar habilidades entre dominios y explicar el razonamiento: capacidades que los modelos actuales solo igualan parcialmente.

Límites, fallos y confabulación

  • Ejemplos de imágenes (p. ej., un caballo con traje espacial) ilustran tanto la creatividad como inconsistencias “básicas” (el casco o el traje no encierra completamente el cuerpo), lo que genera dudas sobre si esa confabulación puede eliminarse por completo.
  • Algunos ven esto como artefactos menores comparados con la sofisticación general; otros lo toman como evidencia de la falta de un modelo del mundo o de estructura lógica.

Meta: recepción del artículo y cultura más amplia

  • Algunos consideran que el enfoque de “todo es una máquina de kernels” es exagerado o incluso “absurdo” en el sentido práctico, dado el kernel dependiente de los datos.
  • Se menciona una tensión continua entre los enfoques tipo kernel/SVM, la estadística clásica y las comunidades de deep learning, con algunos investigadores que detestan fuertemente el dominio del deep learning.