Stable Diffusion 3
Stable Diffusion 3, a mais recente versão do gerador de imagens aberto da Stability AI, está a ser elogiado pela renderização nítida de texto, pelo raciocínio espacial complexo e pelo output fotorealista construído sobre uma nova arquitetura diffusion-transformer semelhante ao Sora da OpenAI. Os comentadores estão ansiosos por um eventual lançamento de open-weights e debatem se isso irá deslocar o amplamente usado, mas mais antigo, SD 1.5, tendo em conta os compromissos entre exigências de hardware, licenciamento e facilidade de fine-tuning (especialmente para NSFW e estilos de nicho). Uma grande parte da conversa centra-se nas salvaguardas de “segurança”: alguns veem-nas como necessárias para limitar deepfakes, abuso e risco legal, enquanto outros argumentam que servem sobretudo para proteger reputações corporativas, censurar em excesso conteúdo benigno e arriscar transformar ferramentas poderosas de uso geral em serviços rigidamente controlados.
Qualidade de imagem, texto e capacidades
- Muitos comentadores consideram as imagens de exemplo “deslumbrantes”, com renderização de texto notavelmente melhor (sinalização legível, títulos, etc.), vista como um grande avanço em relação aos modelos SD anteriores e ao Midjourney/DALL‑E.
- Um exemplo partilhado (“esfera vermelha em cubo azul, triângulo verde, gato/cão esquerda/direita”) impressiona as pessoas: as relações espaciais, a iluminação e a iluminação global parecem muito mais precisas do que nos modelos antigos.
- Alguns notam oddidades ocasionais de composição (por exemplo, a perspetiva do autocarro) e sublinham que a fiabilidade ao longo de muitos prompts ainda é desconhecida.
Arquitetura, desempenho e hardware
- O SD3 usa diffusion transformers (DiT) mais flow matching, numa linha semelhante à do Sora.
- Os tamanhos do modelo variam atualmente entre 800M–8B parâmetros; os menores para mobile/edge, os maiores para GPUs de topo. As pessoas discutem quantização e batching, e se GPUs de consumo (por exemplo, placas de 12 GB) continuam viáveis.
- Há expectativa de que a mesma arquitetura possa estender-se a vídeo e 3D com dados de treino e GPUs suficientes.
Segurança, censura e uso indevido
- A linguagem do anúncio é fortemente orientada para “segurança”, desencadeando um debate extenso.
- Uma corrente: segurança = proteção da empresa/organização (PR, processos judiciais, reguladores, processadores de pagamento), não segurança do utilizador. Esperam-se guardrails sobretudo para evitar CSAM, pornografia deepfake sem consentimento, uso indevido político/de celebridades e resultados racistas.
- Outros argumentam que a segurança é genuinamente necessária para prevenir assédio (por exemplo, deepfakes em contexto escolar), fraude (documentos falsos) e deepfakes relacionados com eleições.
- Vários criticam “segurança” como uma fixação puritana na nudez e um vetor para um controlo ideológico mais amplo ou “crime de pensamento”.
- Outros observam que, para embedders (apps, intranets), é realmente útil ter modelos que nunca gerem pornografia ou gore de forma inesperada.
NSFW, fine-tuning e lançamento aberto
- História: o SD 1.5 gerou rapidamente powerful NSFW fine-tunes; o SD 2.x foi amplamente detestado, em parte devido à censura mais forte e a alterações no CLIP; o SDXL é popular, mas continua a ser visto como mais “puritano”.
- Alguns utilizadores da API relatam blur excessivo (por exemplo, retratos de personagens inofensivos), tornando o SaaS menos utilizável do que modelos locais.
- Expectativa consensual: quando os pesos do SD3 forem lançados, surgirão fine-tunes da comunidade (incluindo NSFW), embora as técnicas de segurança possam ser mais difíceis de “desfazer”.
Licenciamento, abertura e negócio
- O SD3 é prometido como “open” após uma fase de preview, mas a licença exata não é clara; modelos recentes (por exemplo, Stable Cascade) limitam a revenda comercial, algo que alguns chamam “restritivo” e outros veem como razoável.
- A discussão nota a necessidade de a Stability monetizar (API, enterprise) e a tensão entre pesos totalmente abertos e um negócio sustentável.
Comparações com outros modelos
- Comparado com Gemini: o SD3 é visto como tecnicamente mais restrito (apenas imagens), mas provavelmente menos limitado politicamente; as falhas de “diversidade” do Gemini são um ponto de referência frequente.
- Comparado com Midjourney e DALL‑E 3: o SD é elogiado pela controlabilidade local e pelo ecossistema (ComfyUI, LoRAs, controlnets), enquanto alguns ainda sentem que o Midjourney entrega uma arte “out of the box” mais esteticamente agradável.