Mis costos de IA pasaron de $100 a menos de $1/día: afinando Mixtral con GPT4
Un fundador de IA describe cómo redujo los costos diarios de unos $100 a menos de $1 usando GPT‑4 para generar datos de entrenamiento y luego afinando un modelo abierto (Mixtral) para reemplazar en producción la API de OpenAI. Los comentaristas debaten si esto viola los términos de servicio de OpenAI y qué riesgos legales o prácticos enfrentan realmente las pequeñas empresas, especialmente dada la controvertida procedencia de datos de OpenAI. Otros cuestionan los compromisos técnicos y éticos, señalando que los modelos destilados suelen rendir peor que GPT‑4, pueden ser hostiles al usuario si se sustituyen en silencio, y que para tareas estrechas quizá sea más barato crear datos de entrenamiento de alta calidad a mano.
Términos de servicio de OpenAI y legalidad
- Varios comentaristas sostienen que el flujo de trabajo descrito (usar la salida de GPT‑4 para afinar Mixtral) va explícitamente en contra de los ToS de OpenAI, que prohíben usar la salida para desarrollar modelos de IA competidores, salvo para ciertos casos de uso internos específicos.
- Otros cuestionan si un modelo de nicho, específico de una aplicación, realmente “compite” con los productos de OpenAI, sugiriendo que la cláusula podría apuntar a APIs generales de LLM y servicios al estilo de ChatGPT.
- Algunos señalan que el trabajo académico o no comercializado probablemente sea más seguro, pero una vez que se comercializa se vuelve más vulnerable a acciones por ToS.
Riesgo de aplicación y incertidumbre legal
- Muchos creen que el principal recurso realista de OpenAI es cortar el acceso a la API en lugar de demandar, especialmente a usuarios pequeños.
- Varios señalan que los desafíos judiciales (por ejemplo, demandas mediáticas en curso) podrían decidir eventualmente si las restricciones de entrenamiento o de salida son aplicables en absoluto.
- Otros subrayan que, incluso si uno se siente moralmente justificado, ser el caso de prueba en un tribunal o perder el acceso a la API podría arruinar un negocio o complicar las perspectivas de adquisición.
Ética, equidad y “piratería”
- Un tema fuerte: se alega que OpenAI entrenó con contenido en contra de los ToS de otras plataformas y sin consentimiento, así que algunos ven “robar a un ladrón” como moralmente aceptable.
- Otros replican, distinguiendo entre “espíritu hacker” y comportamiento poco ético, y enfatizando las obligaciones contractuales, aunque no gusten.
- Hay tensión entre quienes priorizan la libertad de la información y quienes priorizan la prudencia legal/contractual.
Enfoque técnico y calidad del modelo
- Algunos elogian el método como una forma inteligente y barata de aproximar el comportamiento de GPT‑4 para un dominio estrecho.
- Los escépticos argumentan que los modelos pequeños afinados seguirán siendo notablemente más débiles bajo presión, y que para dominios limitados se podría simplemente crear o etiquetar datos manualmente.
- Se discute que los datos sintéticos de LLM se usan en exceso y que los datos etiquetados manualmente a veces pueden ser más rápidos, más baratos y más consistentes.
Modelos de negocio, costos y “bait-and-switch”
- Los comentaristas señalan que muchas empresas ya destilan GPT‑4 en modelos abiertos, los presentan como propietarios y afirman liderazgo en IA.
- Algunos ven el patrón como: lanzar sobre GPT‑4 y luego cambiar en silencio a un modelo interno más barato una vez que los usuarios están enganchados, llamándolo “enshittification” hostil para el usuario.
- Otros discuten la economía: los precios de OpenAI pueden subir; los modelos alojados por uno mismo o abiertos podrían volverse necesarios para los márgenes, pero el afinado y la infraestructura no son gratis y pueden requerir experiencia.
Preocupaciones específicas de la aplicación
- La app mostrada es criticada por carecer de ToS, política de privacidad y transparencia de precios mientras recopila datos personales detallados, lo que algunos califican de “sospechoso”.
- El creador reconoce estos problemas y está de acuerdo en que necesitan políticas más claras y transparencia.