¿Puedo excluir mis datos de entrada o salida de que se usen para entrenamiento?
El cambio de Mistral para entrenar con los prompts de los usuarios por defecto en los niveles no empresariales ha generado preocupación entre clientes de pago que esperaban garantías de privacidad más sólidas, especialmente de un proveedor europeo. Los comentaristas debaten la confusa terminología de “opt-in” frente a “opt-out”, la eliminación de un conmutador de privacidad a nivel de organización en el plan Team y cuánta confianza pueden depositar realmente los usuarios en las promesas de cualquier proveedor de IA de no usar datos para entrenamiento. El hilo sitúa el enfoque de Mistral junto al de competidores como Anthropic, Google y Grok, y destaca un cambio más amplio hacia el uso local o mediante proxies de LLM para quienes desean un control más estricto sobre datos sensibles.
Cambio de política y valores predeterminados de entrenamiento
- La discusión se centra en que Mistral ahora usa por defecto la entrada/salida del usuario para entrenamiento en los niveles no empresariales, con un mecanismo de exclusión.
- Para Vibe (consumer/Team): los usuarios están “dentro” por defecto y deben desactivar el entrenamiento por cuenta.
- Para Enterprise: el entrenamiento está desactivado por defecto y los administradores pueden gestionarlo de forma centralizada.
- Algunos participantes ven esto como una reversión respecto a documentación anterior que afirmaba que Team estaba excluido por defecto.
Controles de la organización y confusión sobre los conmutadores
- Varios usuarios informan que antes tenían un conmutador de administrador a nivel de organización para desactivar el entrenamiento; las cuentas Team más nuevas supuestamente no lo tienen.
- Un comentarista dice que soporte confirmó que el conmutador a nivel de organización se trasladó solo a Enterprise.
- Otros todavía ven conmutadores globales, lo que sugiere que el comportamiento difiere entre cuentas antiguas y nuevas, y eso es una fuente de confusión.
- Al parecer, la documentación y la interfaz iban por detrás del cambio de política, lo que llevó a entrenamiento no intencionado en algunos prompts de prueba.
Terminología de opt-in frente a opt-out
- Un largo subhilo debate el significado de “opt in by default”.
- Consenso entre muchos:
- “Opt-in” = desactivado por defecto; el usuario debe elegir activarlo.
- “Opt-out” = activado por defecto; el usuario debe elegir desactivarlo.
- Algunos sostienen que el marketing corporativo ha enturbiado estos términos de formas hostiles para el usuario.
Comparaciones con otros proveedores de IA
- Claude Team/Enterprise: se cita que desactiva el entrenamiento sobre prompts por defecto; personas informan de valores predeterminados opuestos en planes personales.
- Grok: elogiado por tener el entrenamiento desactivado por defecto, pero se critica que sus ToS son extremadamente amplios.
- Google/Microsoft/Anthropic/OpenAI: muchos comentaristas dicen que patrones similares de “activado por defecto, opción de exclusión disponible” son comunes.
Confianza, privacidad y aspectos legales
- Hay fuerte escepticismo sobre que cualquier gran proveedor realmente se abstenga de entrenar con datos excluidos; otros argumentan que el riesgo contractual y de GDPR hace poco probable un entrenamiento secreto.
- Se menciona el GDPR como algo que hace que el uso secundario no autorizado de datos sea explícitamente ilegal, aunque algunos dudan de la fuerza de su aplicación.
- Se plantean preocupaciones sobre PII en los prompts, duraciones de retención, filtraciones y la irreversibilidad una vez que los datos entran en un modelo.
Por qué usar o evitar Mistral
- Argumentos a favor de Mistral: jurisdicción de la UE, soberanía de datos, modelos locales, buen OCR/modelos pequeños, capacidad de servir modelos abiertos de terceros como GLM.
- Sentimiento en contra de Mistral: percibida “enshittification”, valores predeterminados hostiles a la privacidad, asociaciones con Arabia Saudí, patentes y la sensación de que imitan el comportamiento de las grandes tecnológicas estadounidenses.
- Varios concluyen que los modelos locales/autohospedados son, en última instancia, la única forma fiable de evitar que se entrene con los propios datos.