Pasé una semana con Gemini Pro 1.5: es fantástico

Gemini Pro 1.5 de Google, un nuevo modelo de lenguaje grande con una ventana de contexto de un millón de tokens, está llamando la atención por su capacidad para ingerir libros completos o grandes bases de código y ofrecer respuestas aparentemente coherentes y ricas en contexto. Los comentaristas están entusiasmados con casos de uso como lectores electrónicos más inteligentes, herramientas legales y de investigación, y la combinación de contexto largo con técnicas de recuperación, pero cuestionan el coste, la escalabilidad y si la calidad se degradará bajo carga real. Muchos también se preocupan por las alucinaciones, las barandillas ideológicas y el impacto ambiental, señalando que incluso usuarios sofisticados ya están tratando como hechos salidas inventadas.

Capacidades del modelo y ventana de contexto

  • La discusión corrige el artículo: GPT‑4 Turbo tiene 128k de contexto vía API, 16–32k en web/app; el contexto de 1M–10M de Gemini 1.5 sigue viéndose como un verdadero salto.
  • Algunos especulan que Google usa escalado bruto más trucos de sistemas; otros mencionan técnicas como LongRoPE, Mamba, FlashAttention, PagedAttention, pero nadie lo sabe con certeza.
  • Varios señalan que, según informes, Gemini 1.5 usa mejor el contexto largo que los modelos actuales, no solo lo acepta.

Casos de uso para contexto enorme

  • Gran entusiasmo por alimentar libros enteros, bases de código y grandes conjuntos de documentos:
    • Ayudantes para lectores electrónicos (búsqueda de personajes, resúmenes sin spoilers, recordatorios de acrónimos, análisis de motivaciones).
    • Apoyos de estudio en profundidad y síntesis tipo “grupo de asesores” a partir de muchos manuales/libros de consejos.
    • Sugerencias de características a nivel de toda la base de código y herramientas de programación más conscientes del contexto.
    • Síntesis de investigación a gran escala o metaanálisis a través de muchos artículos.
  • Algunos señalan Kindle X‑Ray y funciones similares como precedentes parciales.

Coste, acceso y escalabilidad

  • Preocupa que hoy las llamadas con contexto largo sean extremadamente caras; quienes hacen flujos de trabajo de resumen de chats o de Telegram ven cómo los costes de GPT‑4 se disparan rápidamente.
  • Hay opiniones mixtas sobre los costes futuros: algunos esperan precios cercanos a cero con el tiempo (analogía con los mainframes), otros responden que Gemini puede ser más caro que alternativas y temen un acceso selectivo.
  • El rendimiento bajo carga completa a escala Google sigue siendo incierto; incluso el artículo señala que la latencia actual es alta.

Alucinaciones, precisión y confianza

  • Múltiples ejemplos de alucinaciones graves (anécdota inventada de una biografía; donantes inventados en un PDF de financiación de campaña; métodos falsos en código).
  • La gente se preocupa de que incluso usuarios sofisticados estén publicando contenido de IA no verificado y de que los lectores traten cada vez más la salida de los LLM como autoritativa.
  • Consenso: los modelos pueden ser potentes, pero cualquier cosa factual o de alto riesgo debe comprobarse, idealmente por expertos humanos.

Sesgo, barandillas y “wokeness”

  • Debate intenso sobre los fallos anteriores de Gemini en generación de imágenes y sobre el tema más amplio de “DEI/barandillas”:
    • Algunos ven un sesgo sistemático, impulsado ideológicamente, y temen que afecte a la búsqueda y a las salidas de texto.
    • Otros sostienen que la mayor parte del problema es un prompt de sistema demasiado agresivo, más que datos de entrenamiento depurados.
    • Una minoría aprecia una fuerte inclusividad, prefiriéndola a lo contrario; otros se niegan a usar sistemas “abiertamente racistas” o políticamente sesgados.
  • Escepticismo sobre que las versiones “pro” o privadas vayan a ser significativamente distintas en este aspecto.

RAG frente a contexto largo

  • Algunos afirman que el contexto largo reducirá la necesidad de RAG con mucho troceado; simplemente se pueden meter documentos completos.
  • Otros sostienen que RAG sigue siendo crucial:
    • El cuello de botella principal es la selección inteligente del material relevante, no el tamaño bruto de la ventana.
    • Para aplicaciones continuas, no volverías a enviar toda una biblioteca cada vez; el coste y la eficiencia siguen importando.
  • Muchos están entusiasmados con combinar RAG + contexto gigante: RAG para elegir fragmentos relevantes, una ventana grande para mantener evidencia amplia y de múltiples fuentes para una síntesis más fiable.

Privacidad, RA y vigilancia

  • El contexto largo junto con la RA despierta visiones de “etiquetas con nombres sobre todo el mundo” y superposiciones tipo CRM personal:

    • Se ve como muy útil para personas que tienen problemas con nombres/caras, y análogo a los “Farley files” políticos y a los sistemas CRM.
    • Otros lo llaman una pesadilla de privacidad: la memoria conductual completa erosiona el beneficio social de olvidar e invita al acoso, al chantaje y a las trampas.
    • Algunos creen que las normas sociales acabarían adaptándose; otros temen que la gente se vuelva ultracauta o parecida a un político en público.
  • Un hilo aparte imagina a agencias de inteligencia (por ejemplo, la NSA) usando LLMs de contexto largo para consultar enormes archivos de vigilancia:

    • Algunos afirman que el almacenamiento de la NSA es más limitado de lo que la gente supone en comparación con las nubes de las grandes tecnológicas.
    • Otros citan el centro de datos de Utah y grandes contratos con la nube, dudan de esas tranquilizaciones y esperan datos extensos más análisis con IA.

Energía, clima y preocupaciones de recursos

  • Varios se preocupan por el consumo eléctrico de los centros de datos y por la contribución de la IA al cambio climático, especialmente si gran parte del uso es trivial (por ejemplo, fotos de gatos, chats de poco valor).
  • Otros señalan que el cómputo es actualmente una pequeña fracción de las emisiones globales comparado con la construcción o los viajes, y que las grandes empresas de IA están siendo relativamente agresivas con las renovables.
  • Hay escepticismo sobre las afirmaciones de “carbono neutral” y sobre las compensaciones de carbono; algunos insisten en que seguimos necesitando minimizar emisiones y no depender de trucos contables.
  • Hay acuerdo en que la demanda de IA va al alza y que quizá necesitemos mejores formas de evaluar si sus beneficios netos justifican el coste en recursos.

Calidad del producto, degradación y Google frente a OpenAI

  • Algunos temen que el despliegue público degrade la calidad de Gemini (como los percibidos “nerfs” de ChatGPT), y piden a Google que priorice la consistencia aunque eso signifique precios más altos o acceso limitado.
  • Otros cuestionan si la “degradación” es real o mayormente una percepción más algunas salidas malas ocasionales.
  • Unos pocos probadores informan que Gemini Ultra decepciona para programación; otros dicen que Gemini 1.5 Pro se siente rápido y capaz, pero actualmente lento y con poca carga.
  • Una minoría descarta Gemini por completo debido al supuesto declive de Google en la calidad de la búsqueda o a su inclinación ideológica percibida.

Impactos sociales y laborales

  • Sentimientos encontrados sobre el rápido avance de la IA:
    • Algunos están entusiasmados por los aumentos de productividad (programación, derecho, resumir).
    • Otros están inquietos por que las élites capturen la mayor parte de los beneficios y por que las personas de menores ingresos queden aún más marginadas, incluso hasta una “eliminación suave” mediante presión económica.
  • Una visión contraria espera reducciones amplias de precios y posibles respuestas de política pública (por ejemplo, estímulo, quizá RBU), aunque se reconoce que los resultados son inciertos.
  • Debates de analogía: ¿será la IA como las cajas de ritmos (ampliando, no reemplazando, a los humanos) o como los coches frente a los carruajes (borrando roles antiguos)? Muchos esperan un trabajo más complejo asistido por IA en lugar de la desaparición total de todos los empleos.