Ollama agora está disponível no Windows em pré-visualização

A nova pré-visualização do Ollama no Windows está despertando interesse renovado em executar modelos de linguagem grandes localmente, com muitos usuários elogiando como ele transforma facilmente PCs de consumo — especialmente máquinas gamer — em estações de trabalho práticas para IA. Grande parte do debate se concentra no suporte fragmentado a GPU (NVIDIA vs. AMD, ROCm vs. Vulkan/OpenCL), em escolhas arquiteturais como expor modelos por meio de servidores HTTP locais e em como front-ends como Open-WebUI, LM Studio e Msty se integram ao Ollama. Os comentaristas também comparam a qualidade dos modelos para idiomas não ingleses, descrevem usos reais que vão de auto-completar código a assistência de escrita e destacam o potencial de reduzir custos de IA na nuvem ao descarregar prompts “fáceis” para modelos locais.

Disponibilidade da plataforma e pré-visualização no Windows

  • O Ollama já era popular no macOS e no Linux; o suporte nativo ao Windows remove a necessidade de WSL, que alguns consideravam poderoso, mas inconveniente.
  • Os usuários apreciam que agora ele roda tão bem no Windows quanto no macOS, incluindo suporte a GPU onde disponível.

Suporte a GPU e drivers (especialmente AMD)

  • Frustração repetida com a falta de suporte polido a GPUs AMD, especialmente no Windows; muitos se arrependem de ter comprado AMD para cargas de trabalho de IA.
  • Alguns relatam que o ROCm funciona bem em placas AMD recentes no Linux; outros descrevem pânicos de kernel, perda de suporte para GPUs de consumo e instalações dolorosas.
  • Alternativas mencionadas: backends OpenCL e Vulkan via llama.cpp; OpenCL muitas vezes “funciona”, mas com desempenho misto em relação ao ROCm.
  • Os mantenedores dizem que o suporte a GPU AMD está no roadmap e já está sendo trabalhado com hardware Radeon de ponta; o suporte ao ROCm no Windows é acompanhado separadamente.
  • A NVIDIA é vista como mais confiável para IA no geral, embora alguns usuários de Linux não gostem da situação dos seus drivers em distribuições com ciclo de atualização rápido.

Frontends, ferramentas e integração com editores

  • Open-WebUI (anteriormente ollama-webui) é destacado como uma interface de chat em rápida evolução, com busca em conversas.
  • Outro aplicativo de desktop (Msty) fornece uma interface unificada para modelos locais e online, agora no Windows, com Linux planejado e suporte a AMD em exploração.
  • Integrações com VS Code: Continue.dev e Cody podem usar o Ollama para auto-completar abas e (em breve) chat/refatoração.

Capacidades de idioma e escolha de modelo

  • Llama 2 (especialmente o chat 13B) tem desempenho ruim em chinês e japonês; mistura idiomas e alucina sobre suas próprias capacidades.
  • Outros recomendam modelos focados em chinês ou multilíngues (por exemplo, Qwen, Yi) da biblioteca do Ollama, ou variantes raw/base que podem preservar melhor a capacidade em idiomas não ingleses.

Arquitetura: servidor vs. em processo

  • Debate sobre por que ferramentas locais rodam como servidores HTTP em vez de embutir modelos diretamente nas interfaces.
  • Argumentos pró-servidor: evitar carregamento repetido de modelos, compartilhar um único modelo entre vários clientes e máquinas, empacotamento mais fácil (contêineres), APIs compatíveis com OpenAI e uso remoto/sem interface gráfica.
  • Críticos não gostam de serviços locais sempre ativos e de ouvintes sem autenticação, mas muitas vezes usam máquinas potentes que poderiam incorporar modelos diretamente.

Estabilidade, desempenho e problemas de instalação

  • Relatos de pânicos de kernel no macOS ao usar memória próxima do máximo e com AMD ROCm no Linux.
  • Algumas GPUs (por exemplo, NVIDIA Quadro P3000) não são detectadas; os mantenedores afirmam que o suporte deveria existir e pedem logs.
  • Instaladores do Windows e apps de IA frequentemente acionam falsos positivos de antivírus; assinatura de código e ferramentas de empacotamento são sugeridas como mitigação.

Ferramentas alternativas e comparações

  • O LM Studio é elogiado pela configuração simples e pelos downloads de modelos com um clique, mas criticado pelo uso opaco de cache, busca fraca e importação restritiva de modelos.
  • Os usuários valorizam a simplicidade do Ollama, sua natureza de código aberto e a capacidade de descarregar prompts “fáceis” localmente enquanto reservam modelos em nuvem para tarefas mais difíceis.