Stable Diffusion 3

Stable Diffusion 3, a mais recente versão do gerador de imagens aberto da Stability AI, está a ser elogiado pela renderização nítida de texto, pelo raciocínio espacial complexo e pelo output fotorealista construído sobre uma nova arquitetura diffusion-transformer semelhante ao Sora da OpenAI. Os comentadores estão ansiosos por um eventual lançamento de open-weights e debatem se isso irá deslocar o amplamente usado, mas mais antigo, SD 1.5, tendo em conta os compromissos entre exigências de hardware, licenciamento e facilidade de fine-tuning (especialmente para NSFW e estilos de nicho). Uma grande parte da conversa centra-se nas salvaguardas de “segurança”: alguns veem-nas como necessárias para limitar deepfakes, abuso e risco legal, enquanto outros argumentam que servem sobretudo para proteger reputações corporativas, censurar em excesso conteúdo benigno e arriscar transformar ferramentas poderosas de uso geral em serviços rigidamente controlados.

Qualidade de imagem, texto e capacidades

  • Muitos comentadores consideram as imagens de exemplo “deslumbrantes”, com renderização de texto notavelmente melhor (sinalização legível, títulos, etc.), vista como um grande avanço em relação aos modelos SD anteriores e ao Midjourney/DALL‑E.
  • Um exemplo partilhado (“esfera vermelha em cubo azul, triângulo verde, gato/cão esquerda/direita”) impressiona as pessoas: as relações espaciais, a iluminação e a iluminação global parecem muito mais precisas do que nos modelos antigos.
  • Alguns notam oddidades ocasionais de composição (por exemplo, a perspetiva do autocarro) e sublinham que a fiabilidade ao longo de muitos prompts ainda é desconhecida.

Arquitetura, desempenho e hardware

  • O SD3 usa diffusion transformers (DiT) mais flow matching, numa linha semelhante à do Sora.
  • Os tamanhos do modelo variam atualmente entre 800M–8B parâmetros; os menores para mobile/edge, os maiores para GPUs de topo. As pessoas discutem quantização e batching, e se GPUs de consumo (por exemplo, placas de 12 GB) continuam viáveis.
  • Há expectativa de que a mesma arquitetura possa estender-se a vídeo e 3D com dados de treino e GPUs suficientes.

Segurança, censura e uso indevido

  • A linguagem do anúncio é fortemente orientada para “segurança”, desencadeando um debate extenso.
  • Uma corrente: segurança = proteção da empresa/organização (PR, processos judiciais, reguladores, processadores de pagamento), não segurança do utilizador. Esperam-se guardrails sobretudo para evitar CSAM, pornografia deepfake sem consentimento, uso indevido político/de celebridades e resultados racistas.
  • Outros argumentam que a segurança é genuinamente necessária para prevenir assédio (por exemplo, deepfakes em contexto escolar), fraude (documentos falsos) e deepfakes relacionados com eleições.
  • Vários criticam “segurança” como uma fixação puritana na nudez e um vetor para um controlo ideológico mais amplo ou “crime de pensamento”.
  • Outros observam que, para embedders (apps, intranets), é realmente útil ter modelos que nunca gerem pornografia ou gore de forma inesperada.

NSFW, fine-tuning e lançamento aberto

  • História: o SD 1.5 gerou rapidamente powerful NSFW fine-tunes; o SD 2.x foi amplamente detestado, em parte devido à censura mais forte e a alterações no CLIP; o SDXL é popular, mas continua a ser visto como mais “puritano”.
  • Alguns utilizadores da API relatam blur excessivo (por exemplo, retratos de personagens inofensivos), tornando o SaaS menos utilizável do que modelos locais.
  • Expectativa consensual: quando os pesos do SD3 forem lançados, surgirão fine-tunes da comunidade (incluindo NSFW), embora as técnicas de segurança possam ser mais difíceis de “desfazer”.

Licenciamento, abertura e negócio

  • O SD3 é prometido como “open” após uma fase de preview, mas a licença exata não é clara; modelos recentes (por exemplo, Stable Cascade) limitam a revenda comercial, algo que alguns chamam “restritivo” e outros veem como razoável.
  • A discussão nota a necessidade de a Stability monetizar (API, enterprise) e a tensão entre pesos totalmente abertos e um negócio sustentável.

Comparações com outros modelos

  • Comparado com Gemini: o SD3 é visto como tecnicamente mais restrito (apenas imagens), mas provavelmente menos limitado politicamente; as falhas de “diversidade” do Gemini são um ponto de referência frequente.
  • Comparado com Midjourney e DALL‑E 3: o SD é elogiado pela controlabilidade local e pelo ecossistema (ComfyUI, LoRAs, controlnets), enquanto alguns ainda sentem que o Midjourney entrega uma arte “out of the box” mais esteticamente agradável.