Purple Llama: Hacia la confianza y la seguridad abiertas en la IA generativa
La nueva iniciativa “Purple Llama” de Meta, que incluye el modelo de seguridad Llama Guard y benchmarks de seguridad, busca ayudar a las organizaciones a desplegar IA generativa con filtros de contenido y evaluaciones de seguridad de código similares a la capa de moderación de OpenAI, pero con pesos descargables. Los comentaristas están muy divididos entre verlo como barreras necesarias para empresas preocupadas por la responsabilidad y los resultados dañinos, y considerarlo una “lobotomización” excesiva que censura modelos y protege más a las corporaciones que a los usuarios. Otros señalan que riesgos clave como la inyección de prompts siguen en gran medida sin resolverse, y cuestionan el branding de “abierto” de Meta dada su licencia no–open source y su historial más amplio de moderación de contenido.
Problemas del sitio y de la UX
- Varios usuarios informan que la página de Meta rompe el historial del navegador (especialmente en Firefox en macOS), mientras que otros en Safari/Edge no ven ningún problema.
- El flujo de inicio de sesión / cuenta de Meta (Meta frente a Facebook frente a Instagram frente a restricciones regionales) se describe como confuso y similar al de Microsoft.
Seguridad, censura y modelos “lobotomizados”
- Hay un intenso debate sobre los modelos “ajustados para la seguridad”: algunos ven las barreras como una castración de las capacidades (“problema de la mayonesa picante”), mientras que otros las aceptan como necesarias para despliegues comerciales y riesgo legal.
- La gente señala que los derivados de LLaMA sin restricciones o NSFW a menudo se sienten más naturales y menos “como atención al cliente”, incluso para usos benignos.
- Los trucos para sortear las barreras (anteponer “Claro…” o prompts estructurados) son ampliamente conocidos; los modelos más grandes a veces resisten, pero a menudo aún pueden ser dirigidos.
Abierto vs. código abierto y la estrategia de Meta
- Varios comentarios recalcan que LLaMA no es código abierto en el sentido de la OSI; su licencia restringe el uso (por ejemplo, modelos competidores, bases de usuarios muy grandes).
- Se acusa a Meta de difuminar “abierto” frente a “código abierto” por relaciones públicas, pero también se le reconoce un sólido historial de FOSS.
- Especulación de que LLaMA y Purple Llama ayudan a Meta: rehabilitación de marca, influencia en estándares y “comoditizar complementos” en lugar de vender modelos directamente.
Componentes de Purple Llama y uso previsto
- Llama Guard se describe como similar en función a la API de moderación de OpenAI, pero como un modelo compartible.
- Su taxonomía se centra en violencia/odio, contenido sexual, armas, drogas, autolesión y planificación de delitos; los críticos señalan que no aborda cosas como malos consejos médicos o inyección de prompts.
- Algunos ven los conjuntos de datos y benchmarks de seguridad de código como genuinamente útiles para modelos de generación de código más seguros.
Inyección de prompts y preocupaciones de seguridad
- Un largo subhilo sostiene que la inyección de prompts es el principal riesgo de despliegue sin resolver, especialmente cuando los LLM tienen acceso a herramientas o ven contenido no confiable junto con datos privados.
- Analogías con inyección SQL/XSS: texto de terceros puede anular instrucciones, exfiltrar datos o provocar acciones no deseadas.
- Mitigaciones propuestas: alcance estricto de capacidades, patrones de “doble LLM”, intervención humana para acciones sensibles y no ejecutar automáticamente operaciones sugeridas por el LLM. Consenso: todavía no hay una solución general robusta.
Moderación, humor y falsos positivos
- Múltiples anécdotas de moderación al estilo Facebook que clasifican erróneamente bromas o sarcasmo obvios como amenazas o incitación.
- Algunos prefieren la moderación por IA frente a moderadores humanos sesgados; otros argumentan que tanto los sistemas de IA actuales como los humanos fallan con el contexto, la cultura y el humor.