Stable Cascade
Stable Cascade, el nuevo modelo de Stability AI de texto a imagen basado en la arquitectura Würstchen, promete una adherencia mucho mejor a los prompts y una generación más rápida que SDXL al operar en un espacio latente fuertemente comprimido (alrededor de 42x de compresión espacial). Los comentaristas sopesan las ventajas y desventajas entre calidad de imagen, requisitos de hardware y uso de memoria, señalando que, aunque puede ejecutarse en CPU y en GPU modestas, el uso local serio sigue beneficiándose de tarjetas con mucha VRAM y trucos de descarga/carga. El lanzamiento también reaviva el debate sobre la licencia no comercial de Stability AI para los pesos del modelo, su sostenibilidad como negocio financiado por capital de riesgo y la rapidez con que interfaces populares como ComfyUI y los servicios web pueden integrar el nuevo modelo.
Rendimiento y requisitos de hardware
- Muchos usuarios informan que Stable Cascade es 2–3x más rápido que SDXL no turbo y lo bastante “rápido” para bots y uso casual.
- El seguimiento de prompts es ampliamente elogiado; la calidad visual general se considera por ahora ligeramente por debajo de los mejores modelos SDXL.
- Los requisitos de VRAM se debaten: una nota filtrada mencionó ~20GB para la configuración más grande; otros dicen ~6GiB por etapa en FP16, pero el código actual no está optimizado para RAM.
- Se sugiere cargar/descargar las etapas secuencialmente (C → B → A) para encajarlo en 8–12GB de VRAM, y el ancho de banda PCIe hace que el coste de intercambio sea modesto.
- La inferencia solo con CPU es posible, pero a menudo tarda de muchos minutos a horas por imagen; algunos informan que incluso con una optimización intensa (BLAS, jemalloc, ajuste de hilos) sigue estando limitada por el ancho de banda de memoria.
- Las GPU antiguas o con poca VRAM (2–4GB) se consideran marginales; las GPU integradas con mucha RAM compartida a veces pueden ser más prácticas.
Arquitectura, compresión y capacidades
- Construido sobre Würstchen: opera en un espacio latente altamente comprimido (~42x de compresión espacial), lo que permite un entrenamiento e inferencia más rápidos.
- La discusión aclara que esto es una “abstracción” con pérdida y no una compresión clásica de imágenes; las etapas del decodificador se comportan como un códec avanzado que alucina.
- La gente especula sobre aplicaciones a códecs de vídeo y upscaling, y señala un comportamiento sólido con tamaños de batch más altos.
- Se proponen flujos de trabajo para el seguimiento de prompts y el “adherence-fix” encadenado (por ejemplo, Cascade → SDXL/refiner).
- Persisten limitaciones conocidas: los modelos siguen teniendo dificultades con el conteo y con objetos estructurados (teclados de piano, número correcto de bolas).
Licencias, modelo de negocio y ética
- El código tiene licencia MIT; los pesos del modelo están bajo una licencia no comercial como “tech preview”.
- Un commit temprano mostró brevemente una licencia MIT para todo el repositorio, lo que desencadenó debate:
- Una postura: ese snapshot sigue siendo usable bajo MIT; las licencias no pueden revocarse retroactivamente.
- Postura contraria: las licencias erróneas pueden retirarse; los tribunales podrían tratarlo como un error administrativo, y no hay una jurisprudencia clara.
- Los términos no comerciales se vinculan a la necesidad de un modelo de ingresos y a evitar que grandes actores comerciales se aprovechen gratis.
- Algunos abogan por un marco “tipo GPL” o Creative Commons adaptado a modelos y conjuntos de datos.
- El hilo señala un fuerte gasto de capital de riesgo, rentabilidad incierta y estrategias emergentes como membresías, modelos personalizados y servicios alojados.
Ecosistema y herramientas
- Los usuarios mencionan soporte rápido o planificado en ComfyUI, Auto1111, fal.ai, Hugging Face Spaces y otros frontends.
- Existe soporte para AMD, pero el rendimiento y la estabilidad van por detrás de NVIDIA; algunos ven AMD como un posible rival futuro en relación precio-rendimiento.