Jeff Dean: Tendencias en aprendizaje automático [video]
Las afirmaciones de la charla de Jeff Dean sobre “tendencias emocionantes” en aprendizaje automático provocan debate sobre cuánto de la IA moderna es realmente teoría nueva frente a convolución rebautizada, y muchos argumentan que los LLMs basados en transformers y las leyes de escala dominan la práctica mientras el entendimiento fundamental va rezagado. Los comentaristas se dividen entre el entusiasmo por grandes modelos multimodales como Gemini de Google y el escepticismo de que las arquitecturas actuales, hambrientas de cómputo, hayan alcanzado un techo o estén demasiado moldeadas por incentivos corporativos y casos de uso publicitarios. Un tema práctico importante es el auge de herramientas de IA para resumir videos y textos largos, que algunos ven como un verdadero impulso de productividad y otros como atajos superficiales y propensos a errores que arriesgan a aplanar la profundidad y los matices en la forma en que la gente aprende.
Debate: “Todo el aprendizaje automático es convolución”
- Algunos sostienen que cualquier multiplicación de matrices (incluidas las de Transformers y MLPs) puede verse como una convolución o transformación integral, así que “todo es convolución”.
- Otros discrepan: solo cuentan las capas de convolución explícitas; los productos punto en espacios de alta dimensión no suelen llamarse convoluciones, y las no linealidades rompen la equivalencia estricta.
- Un trabajo enlazado afirma que las arquitecturas convolucionales son universales, pero los comentaristas señalan que “puede expresar” ≠ “es”.
DermAssist y herramientas médicas de IA
- La charla menciona DermAssist de Google como un producto en funcionamiento, pero los usuarios se encuentran con listas de espera y errores 404; la disponibilidad en EE. UU. está explícitamente limitada.
- Los comentaristas ven promesas excesivas y entregas insuficientes repetidas por parte de las IA para dermatología en entornos clínicos reales y piden escepticismo.
- Se comparten otros ejemplos de IA médica como más exitosos, junto con una herramienta dermatológica de código abierto.
Flujos de trabajo de resumen de video basados en IA
- Muchos usan LLMs para resumir charlas largas antes de verlas, citando ahorro de tiempo y valor para priorizar.
- Otros prefieren descripciones de video, echar un vistazo rápido o leer libros directamente, argumentando que los resúmenes de IA se sienten superficiales y homogeneizados.
- Se comparten múltiples herramientas y proyectos personales (resumidores centrados en YouTube, mapas temáticos con marcas de tiempo, generadores de tarjetas de memoria).
- Algunos informan que los resúmenes de LLM a menudo omiten ideas clave incluso con transcripciones completas.
Preocupaciones sobre la precisión de los LLM y la sobredependencia
- Las experiencias de respuestas fácticamente incorrectas (p. ej., horarios de negocio) reducen la confianza.
- Se hace una distinción entre resumir documentos estáticos y responder consultas factuales efímeras, pero los usuarios señalan que la interfaz no lo comunica con claridad.
- Preocupaciones filosóficas: externalizar “qué merece mi tiempo” y la adquisición de conocimiento a sistemas opacos; riesgo de que todo converja hacia el centro de la curva de campana.
Reacciones a la charla
- Varios la ven como una visión general pulida y de alto nivel, potencialmente dirigida a estudiantes de grado, con un fuerte énfasis en el propio trabajo y productos de Google.
- Otros la critican por estar demasiado centrada en marketing y ofrecer poca teoría, detalles arquitectónicos o una explicación genuina de “por qué funciona”.
- Algunos señalan el énfasis relativamente bajo en avances al estilo ChatGPT y enmarcan las diferencias entre laboratorios como ejecución, no como dirección de investigación.
Estado y dirección de la investigación en ML
- Una postura: el paradigma actual de redes neuronales + enorme cómputo está llegando a un techo; harán falta enfoques nuevos, menos hambrientos de datos/cómputo.
- Otra postura: los Transformers se están convirtiendo en el transistor MOS fundamental del ML, con probabilidades de dominar en todas las modalidades, y el trabajo futuro se centrará en la eficiencia (p. ej., costos cuadráticos reducidos, atención tipo base de datos, cuantización) más que en nuevas arquitecturas.
- Comentarios escépticos argumentan que la investigación en ML está fuertemente impulsada por incentivos corporativos, dominada por casos de uso de visión por computadora y recuperación de información (anuncios, video de formato corto, paneles de conocimiento).
Negocio y competencia
- Algunos sugieren que para las startups de IA/AGI es una fase de “esperar y ver”: los incumbentes forman un oligopolio y las startups prometedoras probablemente serán objetivos de adquisición.
- Otros piensan que Google seguirá comprometido y que la búsqueda web tradicional por palabras clave disminuirá con el tiempo.