Google Imagen 2

El anuncio de Google de su modelo de generación de imágenes Imagen 2 en Vertex AI está recibiendo críticas por sus políticas de acceso confusas: se promociona como de “disponibilidad general”, pero en la práctica parece estar limitado a clientes de nube incluidos en una allowlist o del “Trusted Tester Program”, con un proceso de incorporación opaco. Los comentaristas cuestionan si el modelo supera de forma significativa a sistemas existentes como DALL·E 3, Midjourney y Stable Diffusion, señalando la falta de benchmarks, resultados iniciales mixtos y ejemplos muy seleccionados. El lanzamiento se percibe ampliamente como emblemático de los problemas más amplios de Google en IA y cloud, incluidos documentación fragmentada, flujos de trabajo engorrosos, restricciones regionales y la sensación de que las herramientas de código abierto ahora ofrecen más valor práctico y flexibilidad.

Confusión sobre acceso y documentación

  • Muchos comentaristas no consiguen averiguar cómo usar realmente Imagen 2, pese a que el blog afirma “disponibilidad general”.
  • La documentación y las pantallas de la consola mezclan “GA”, “restricted GA”, “allowlist” y “Trusted Tester Program”, creando ambigüedad sobre quién tiene acceso de verdad.
  • Algunos usuarios informan que la API funciona sin permisos especiales usando los endpoints imagegeneration@00x; otros se encuentran con formularios de “solicitar acceso”, errores 404 o mensajes de “solo para clientes limitados”.
  • La navegación por la consola de Google Cloud (Vertex AI → Model Garden → Imagen) se describe como enrevesada y mal documentada.
  • No hay un simple playground público (como una página de demostración alojada) disponible; muchos consideran esto un gran fracaso del lanzamiento.
  • En Canadá, los servicios relacionados con Imagen están actualmente no disponibles debido a “incertidumbre regulatoria”, lo que aumenta la frustración.

Calidad del modelo y comparaciones

  • Varias personas dicen que esto habría sido impresionante hace dos años, pero ahora compite con DALL·E 3, Midjourney, SDXL, etc.
  • Algunos evaluadores tempranos consideran que Imagen 2 es claramente peor que DALL·E 3 y solo “aceptable” en prompts simples, con artefactos visibles y una calidad “de hace años”.
  • Otros creen que supera a Stable Diffusion específicamente en la representación de texto y logotipos.
  • El escepticismo es alto debido al historial de Google de demos muy seleccionadas y a la reciente controversia de Gemini; la falta de benchmarks o de un paper amplifica las dudas.
  • Pruebas basadas en ejemplos (p. ej., escenas complejas de abrazos, animales específicos como ardillas voladoras) sugieren que el razonamiento composicional y multientidad sigue siendo una debilidad general, no algo resuelto de forma única aquí.

Open source vs. servicios en la nube

  • Un sector sostiene que Stable Diffusion (junto con herramientas de la comunidad como AUTOMATIC1111, ControlNet, LoRA) ha “ganado” de hecho para flujos de trabajo serios o profesionales: más control, sin filtros de contenido duros e inferencia barata o local.
  • Otro sector replica que las APIs cerradas (OpenAI, Google, Adobe, Canva) dominan en usabilidad, integraciones, indemnización y accesibilidad para no expertos, aunque los modelos abiertos sean más flexibles.
  • El coste se debate: ~$0.02/image en la nube se considera caro para algunos en comparación con autoalojamiento; otros prefieren pagar por imagen para evitar comprar GPU y configurar todo.

Estrategia de producto de Google y problemas organizativos

  • Muchos ven esto como otro ejemplo de Google convirtiéndose en una empresa lenta, burocrática y muy centrada en el marketing, “a lo IBM”: anuncios llamativos de IA, acceso confuso y plataformas difíciles de usar.
  • Hay una amplia discusión meta sobre la hinchazón interna, los ingenieros que se acomodan frente a una capa intermedia de gestión disfuncional, y cómo esta cultura puede explicar productos de IA lentos y a medio terminar.
  • Algunos argumentan que Google está priorizando las relaciones públicas y la apariencia en el mercado de valores por encima de lanzar herramientas robustas y claramente accesibles.