Los generadores de arte con IA pueden ser engañados para crear imágenes NSFW
Los investigadores han mostrado que los generadores de imágenes con IA y filtros de seguridad integrados aún pueden ser inducidos a producir contenido NSFW u otro contenido restringido, incluso mediante palabras “secretas” sin sentido que eluden tanto los controles de entrada como los de salida. Los comentaristas debaten si estos controles son deseables o simplemente “security theater” corporativo y regulatorio, planteando cuestiones más amplias sobre censura, seguridad infantil, riesgo legal, presiones de anunciantes y tiendas de apps, y los límites de las técnicas actuales de alineación. Muchos señalan que estas vulnerabilidades importan más allá del porno: si los sistemas no pueden bloquear de forma fiable la desnudez, probablemente tampoco se les pueda confiar plenamente en aplicaciones de mayor riesgo.
Qué significan “seguridad” y NSFW
- Varios comentarios aclaran que “seguridad” aquí significa NSFW, “trust and safety” y “brand safety”, no peligro físico.
- Algunos argumentan que la desnudez no es inherentemente insegura; “inseguro” se refiere principalmente a que te despidan o a violar normas sociales.
- Otros replican que la gente puede encontrar razonablemente ofensiva la desnudez pública y querer límites.
Arquitecturas de filtrado y sus fallos
- Muchos asumen que los principales generadores de imágenes usan tanto filtros de entrada como filtros de salida.
- Los usuarios informan:
- Los prompts pasan los filtros de entrada, pero las salidas se bloquean, incluidos falsos positivos (p. ej., ropa beige en personas jóvenes, la palabra “breast pocket”).
- Distintas plataformas (Bing, DALL·E, APIs de OpenAI) se comportan de forma similar, a veces cobrando incluso cuando el resultado se bloquea.
- Las APIs más pequeñas/indie a menudo no tienen filtrado o tienen uno mínimo.
Prompts adversarios y tokens “sin sentido”
- La contribución del artículo se percibe como la generación algorítmica de prompts adversarios que eluden tanto los clasificadores de NSFW basados en prompts como los basados en imágenes, incluso mediante tokens “sin sentido”.
- A algunos les interesa cómo surgen estos embeddings de tokens y por qué se mapean a conceptos NSFW.
- Otros señalan que esto socava afirmaciones más amplias sobre la alineación: si no puedes bloquear porno de forma fiable, probablemente tampoco puedas bloquear de forma fiable comportamientos más dañinos.
Debate entre censura y capacidad
- Un bando: limitar los modelos (80% de funcionalidad) para evitar abusos y satisfacer a plataformas, anunciantes, tiendas de apps y reguladores.
- Otro bando: preferir la capacidad completa y dejar la responsabilidad en los usuarios; ven las restricciones como paternalistas, puritanas o “security theater”.
- Los modelos locales / autoalojados se presentan como la ruta “Linux vs Windows” para eludir los filtros corporativos.
Niños, productos y responsabilidad legal
- Algunos enfatizan la protección de niños y escuelas: se necesita un generador “seguro” para que las aplicaciones educativas no muestren porno inesperadamente.
- Otros sostienen que los niños siempre encontrarán una forma de ver material NSFW, y que sobrerrefinar la seguridad es principalmente PR corporativa, no daño real.
Casos límite legales y éticos
- Se plantea la distinción entre NSFW en general y “NSFLE” (contenido ilegal como abuso infantil sintético), que puede tener consecuencias legales graves aunque sea generado por IA.
- El debate sobre si ese contenido ilegal puramente artificial debería criminalizarse se marca como polémico y sin resolver.
Reacciones más amplias a la investigación y la cobertura
- Algunos ven el estudio como obvio o trivial (“por supuesto que puedes romper restricciones si te esfuerzas lo suficiente”).
- Otros lo comparan con hackear o forzar coches autónomos: una prueba de resistencia necesaria, no algo inútil.
- Unos pocos critican que la explicación del artículo de IEEE sobre los LLM sea demasiado simplificada, y que centrarse en la desnudez resulte algo juvenil dadas cuestiones de alineación más serias.