Jeff Dean: Tendencias en aprendizaje automático [video]

Las afirmaciones de la charla de Jeff Dean sobre “tendencias emocionantes” en aprendizaje automático provocan debate sobre cuánto de la IA moderna es realmente teoría nueva frente a convolución rebautizada, y muchos argumentan que los LLMs basados en transformers y las leyes de escala dominan la práctica mientras el entendimiento fundamental va rezagado. Los comentaristas se dividen entre el entusiasmo por grandes modelos multimodales como Gemini de Google y el escepticismo de que las arquitecturas actuales, hambrientas de cómputo, hayan alcanzado un techo o estén demasiado moldeadas por incentivos corporativos y casos de uso publicitarios. Un tema práctico importante es el auge de herramientas de IA para resumir videos y textos largos, que algunos ven como un verdadero impulso de productividad y otros como atajos superficiales y propensos a errores que arriesgan a aplanar la profundidad y los matices en la forma en que la gente aprende.

Debate: “Todo el aprendizaje automático es convolución”

  • Algunos sostienen que cualquier multiplicación de matrices (incluidas las de Transformers y MLPs) puede verse como una convolución o transformación integral, así que “todo es convolución”.
  • Otros discrepan: solo cuentan las capas de convolución explícitas; los productos punto en espacios de alta dimensión no suelen llamarse convoluciones, y las no linealidades rompen la equivalencia estricta.
  • Un trabajo enlazado afirma que las arquitecturas convolucionales son universales, pero los comentaristas señalan que “puede expresar” ≠ “es”.

DermAssist y herramientas médicas de IA

  • La charla menciona DermAssist de Google como un producto en funcionamiento, pero los usuarios se encuentran con listas de espera y errores 404; la disponibilidad en EE. UU. está explícitamente limitada.
  • Los comentaristas ven promesas excesivas y entregas insuficientes repetidas por parte de las IA para dermatología en entornos clínicos reales y piden escepticismo.
  • Se comparten otros ejemplos de IA médica como más exitosos, junto con una herramienta dermatológica de código abierto.

Flujos de trabajo de resumen de video basados en IA

  • Muchos usan LLMs para resumir charlas largas antes de verlas, citando ahorro de tiempo y valor para priorizar.
  • Otros prefieren descripciones de video, echar un vistazo rápido o leer libros directamente, argumentando que los resúmenes de IA se sienten superficiales y homogeneizados.
  • Se comparten múltiples herramientas y proyectos personales (resumidores centrados en YouTube, mapas temáticos con marcas de tiempo, generadores de tarjetas de memoria).
  • Algunos informan que los resúmenes de LLM a menudo omiten ideas clave incluso con transcripciones completas.

Preocupaciones sobre la precisión de los LLM y la sobredependencia

  • Las experiencias de respuestas fácticamente incorrectas (p. ej., horarios de negocio) reducen la confianza.
  • Se hace una distinción entre resumir documentos estáticos y responder consultas factuales efímeras, pero los usuarios señalan que la interfaz no lo comunica con claridad.
  • Preocupaciones filosóficas: externalizar “qué merece mi tiempo” y la adquisición de conocimiento a sistemas opacos; riesgo de que todo converja hacia el centro de la curva de campana.

Reacciones a la charla

  • Varios la ven como una visión general pulida y de alto nivel, potencialmente dirigida a estudiantes de grado, con un fuerte énfasis en el propio trabajo y productos de Google.
  • Otros la critican por estar demasiado centrada en marketing y ofrecer poca teoría, detalles arquitectónicos o una explicación genuina de “por qué funciona”.
  • Algunos señalan el énfasis relativamente bajo en avances al estilo ChatGPT y enmarcan las diferencias entre laboratorios como ejecución, no como dirección de investigación.

Estado y dirección de la investigación en ML

  • Una postura: el paradigma actual de redes neuronales + enorme cómputo está llegando a un techo; harán falta enfoques nuevos, menos hambrientos de datos/cómputo.
  • Otra postura: los Transformers se están convirtiendo en el transistor MOS fundamental del ML, con probabilidades de dominar en todas las modalidades, y el trabajo futuro se centrará en la eficiencia (p. ej., costos cuadráticos reducidos, atención tipo base de datos, cuantización) más que en nuevas arquitecturas.
  • Comentarios escépticos argumentan que la investigación en ML está fuertemente impulsada por incentivos corporativos, dominada por casos de uso de visión por computadora y recuperación de información (anuncios, video de formato corto, paneles de conocimiento).

Negocio y competencia

  • Algunos sugieren que para las startups de IA/AGI es una fase de “esperar y ver”: los incumbentes forman un oligopolio y las startups prometedoras probablemente serán objetivos de adquisición.
  • Otros piensan que Google seguirá comprometido y que la búsqueda web tradicional por palabras clave disminuirá con el tiempo.