Meus custos com IA passaram de US$100 para menos de US$1/dia: Fine-tuning do Mixtral com GPT4
Um fundador de IA descreve cortar os custos diários de cerca de US$100 para menos de US$1 usando o GPT‑4 para gerar dados de treinamento e, em seguida, fazer fine-tuning de um modelo aberto (Mixtral) para substituir a API da OpenAI em produção. Comentadores debatem se isso viola os termos de serviço da OpenAI e quais riscos legais ou práticos pequenas empresas realmente enfrentam, especialmente considerando a própria origem controversa dos dados usados pela OpenAI. Outros questionam os trade-offs técnicos e éticos, observando que modelos destilados frequentemente têm desempenho inferior ao GPT‑4, podem ser hostis ao usuário se trocados silenciosamente, e que, para tarefas restritas, talvez seja mais barato criar dados de treinamento de alta qualidade manualmente.
Termos de Serviço da OpenAI e Legalidade
- Vários comentaristas argumentam que o fluxo de trabalho descrito (usar a saída do GPT‑4 para fazer fine-tuning do Mixtral) está explicitamente em desacordo com os ToS da OpenAI, que proíbem usar a saída para desenvolver modelos de IA concorrentes, exceto para casos internos específicos de uso.
- Outros questionam se um modelo de nicho, específico para uma aplicação, realmente “compete” com os produtos da OpenAI, sugerindo que a cláusula pode mirar APIs genéricas de LLM e serviços no estilo ChatGPT.
- Alguns observam que trabalho acadêmico ou não transformado em produto provavelmente é mais seguro, mas, uma vez comercializado, fica mais vulnerável a ação com base nos ToS.
Risco de Execução e Incerteza Jurídica
- Muitos acreditam que o principal recurso realista da OpenAI é cortar o acesso à API, em vez de processar, especialmente para usuários pequenos.
- Vários apontam que contestações judiciais (por exemplo, processos em andamento envolvendo mídia) podem eventualmente decidir se restrições de treinamento ou de saída são aplicáveis ou não.
- Outros ressaltam que, mesmo que alguém se sinta moralmente justificado, ser o caso-teste no tribunal ou perder o acesso à API pode arruinar um negócio ou complicar perspectivas de aquisição.
Ética, Justiça e “Pirataria”
- Um tema forte: supostamente a OpenAI treinou com conteúdo contra os ToS de outras plataformas e sem consentimento, então alguns veem “roubar de um ladrão” como moralmente aceitável.
- Outros rebatem, distinguindo “espírito hacker” de comportamento antiético e enfatizando obrigações contratuais, mesmo quando não se gosta delas.
- Há tensão entre pessoas que priorizam a liberdade de informação e aquelas que priorizam prudência legal/contratual.
Abordagem Técnica e Qualidade do Modelo
- Alguns elogiam o método como uma forma inteligente e barata de aproximar o comportamento do GPT‑4 em um domínio restrito.
- Céticos argumentam que modelos menores fine-tuned ainda serão visivelmente mais fracos sob pressão, e que, para domínios limitados, seria possível simplesmente criar ou rotular dados manualmente.
- Há discussão de que dados sintéticos de LLMs são usados em excesso e que dados rotulados manualmente às vezes podem ser mais rápidos, baratos e consistentes.
Modelos de Negócio, Custos e “Isca e Troca”
- Comentaristas observam que muitas empresas já fazem distillation do GPT‑4 em modelos abertos, dão branding como se fossem proprietários e alegam liderança em IA.
- Alguns veem o padrão como: lançar com GPT‑4 e depois trocar silenciosamente para um modelo interno mais barato quando os usuários já estão presos, chamando isso de “enshittification” hostil ao usuário.
- Outros discutem a economia: os preços da OpenAI podem subir; modelos self-hosted ou abertos podem se tornar necessários para as margens, mas fine-tuning e infraestrutura não são gratuitos e podem exigir experiência.
Preocupações Específicas do App
- O app apresentado é criticado por não ter ToS, política de privacidade e transparência de preços, enquanto coleta dados pessoais detalhados, o que alguns classificam como “duvidoso”.
- O criador reconhece esses problemas e concorda que precisa de políticas e transparência mais claras.