Entiende cómo funcionan los transformers desmitificando la matemática detrás de ellos
Los transformers, como arquitectura central detrás de los modelos de lenguaje grandes modernos, se perciben a la vez como engañosamente simples en código y abrumadoramente complejos en su comportamiento, lo que impulsa llamadas a explicaciones que conecten tutoriales intuitivos con matemática rigurosa. Los comentaristas comparten recursos sobre interpretabilidad mecanicista, codificaciones posicionales y atención, al tiempo que corrigen malentendidos sobre la retropropagación, la terminología de redes neuronales y problemas numéricos como la estabilidad del softmax. Junto con las aclaraciones técnicas, aparece repetidamente la cuestión de si escalar los actuales “predictores del siguiente token” podrá llegar a producir una “IA real”, o si harán falta nuevas arquitecturas con grafos de cómputo aprendibles y mejores capacidades de razonamiento.
Reacciones de alto nivel
- Muchos consideran que los transformers son difíciles de “entender” de verdad: los modelos simples son interpretables pero no útiles, mientras que los modelos útiles se sienten demasiado grandes como para abarcarlos.
- Comparaciones con “tutoriales de mónadas”: hay que pelearse con ellos, y una vez que los entiendes, se vuelve difícil explicarlos con claridad.
- Algunos agradecen el artículo; otros creen que el enfoque de “la matemática detrás” exagera el nivel de profundidad matemática.
Transformers, atención y grafos de cómputo
- Una postura: el “misterio” consiste sobre todo en sustituir los pesos estáticos de capa por matrices Q/K/V aprendidas y una fuerte paralelización; la atención se ve como estructuralmente simple pero rígida.
- Réplica: lo especial es el acceso completo y sin pérdidas a todos los tokens previos, a diferencia de los RNN, que comprimen el historial.
- Debate sobre si el progreso futuro requiere hacer que el propio grafo de cómputo sea aprendible; se señalan problemas como la discreción del espacio de grafos y el entrenamiento basado en gradientes.
- Entre las sugerencias aparecen algoritmos genéticos, búsqueda de arquitecturas diferenciables y mecanismos tipo Hebb para vincular subgrafos.
Progreso, “IA real” y uso de herramientas
- Algunos argumentan que los LLM actuales se estancan alrededor de GPT‑3.5/4 y sobre todo proporcionan “compresión de información” eficiente, no “IA real”.
- Otros sostienen que la funcionalidad ha mejorado claramente y que el aprendizaje de conceptos y el razonamiento multietapa (por ejemplo, con ReAct/Tree-of-Thoughts) ya van más allá de la simple búsqueda.
- “IA real” se define de distintas maneras: razonamiento robusto sobre problemas no vistos, construcción autónoma de planes o sistemas capaces de diseñar artefactos complejos de principio a fin.
- Hay un fuerte apoyo a ampliar los LLM con herramientas externas y simuladores, en lugar de intentar emular CPUs/NAND gates dentro de la red.
Relación con el cerebro y las redes neuronales
- Hay opiniones mixtas sobre si el cerebro “usa transformers”: algunos dicen que no; otros señalan trabajos que muestran representaciones parecidas a transformers, similares a las células de rejilla/lugar del hipocampo.
- Se aclara que los transformers son redes neuronales entrenadas con backpropagation, a pesar de cierta confusión en el hilo al respecto.
- Se mencionan los algoritmos forward-forward y otros esquemas de aprendizaje más plausibles biológicamente como inspiraciones alternativas.
Matemática, embeddings y codificación posicional
- Varios comentarios piden un tratamiento más profundo de:
- Tokenización frente a embeddings y “decuantización”.
- Codificaciones posicionales, por qué sen/cos, elecciones de frecuencia y codificaciones aprendibles frente a fijas.
- Roles detallados de los productos punto, softmax, escalado y residuales en la atención.
- Algunos elogian una hoja de “Transformer in equations” de una sola página como el tipo de matemática concisa que querían.
Preocupaciones de implementación y problemas numéricos
- Los lectores señalan posibles problemas de código en las conexiones residuales del decodificador y la ausencia de layer norms.
- Se critica una sección que atribuye los NaN a “gradient explosion”; el problema real se describe como activaciones grandes y un softmax numéricamente inestable.
- Hay una pequeña confusión sobre las fórmulas de codificación posicional y la indexación; se observan variaciones respecto al código del artículo original, aunque se considera que no son críticas.
Predicción del siguiente token y generalización
- Pregunta: ¿cómo pueden los predictores de “solo” siguiente token manejar identificadores nunca vistos o seguir nuevos ejemplos en contexto?
- Las respuestas enfatizan:
- Conceptos latentes de alta dimensión aprendidos (incluido “gibberish/placeholder”) a los que se mapean nuevas cadenas de tokens.
- Aprendizaje en contexto y reconocimiento de patrones sobre secuencias de tokens.
- Punto teórico: una distribución correcta de siguiente token condicional define implícitamente una distribución sobre secuencias completas, capaz de representar comportamientos ricos.