O Chat with RTX da Nvidia é um chatbot de IA que roda localmente no seu PC

A nova demonstração tecnológica “Chat with RTX” da Nvidia oferece um chatbot de IA local que executa Mistral ou Llama 2 em PCs Windows com GPUs RTX série 30/40 recentes, indexando documentos e conteúdo da web dos usuários via RAG para que eles possam consultar seus próprios dados. Os comentaristas a veem tanto como uma vitrine da aceleração TensorRT-LLM da Nvidia quanto como uma tentativa de prender cargas de trabalho de IA a hardware mais novo, gerando reclamações sobre requisitos artificiais de GPU e VRAM e comparações com ferramentas de código aberto existentes que são mais difíceis de configurar para não especialistas. Também há debate sobre privacidade, censura e se instaladores com marca e um clique levarão os LLMs locais a um público muito mais amplo do que as soluções DIY atuais.

Requisitos de Hardware e Limitações

  • Requisitos oficiais: Windows 11, 16GB de RAM, GPU RTX série 30/40 ou GPU RTX Ampere/Ada com ≥8GB de VRAM, driver recente.
  • Muitos reclamam que as RTX da série 20 (por exemplo, 2080 Ti com 11GB) foram excluídas e veem isso como uma limitação artificial, impulsionada por branding.
  • Alguns argumentam que isso se deve à falta de suporte, ou suporte ruim, a formatos de menor precisão (por exemplo, bf16) e aos tensor cores de primeira geração; outros observam que o próprio TensorRT-LLM lista Turing como compatível, então a restrição parece arbitrária.
  • O mínimo de 8GB de VRAM também exclui placas como a mais nova RTX 3050 de 6GB, o que os usuários consideram frustrante.

Modelos, Desempenho e Stack de Tecnologia

  • O instalador tem cerca de 35GB e inclui LLaMA 13B e Mistral/Ministral 7B em quantização int4; em placas de 8GB, parece usar Mistral 7B por padrão.
  • O backend é TensorRT-LLM mais um wrapper RAG para Windows; a UI é uma frente fina baseada em Gradio com um ambiente Conda incluído.
  • O desempenho relatado é muito rápido (por exemplo, “mais rápido do que consigo ler”, centenas de tokens/s em placas topo de linha), ao custo de baixa variabilidade e contexto conversacional limitado.
  • Vários comentaristas observam que o TensorRT-LLM é um dos motores de inferência mais rápidos em comparação com alternativas como llama.cpp, embora seja mais difícil de configurar manualmente.

Objetivo, Público e Valor em Relação às Ferramentas Existentes

  • Alguns têm dificuldade em ver o propósito em comparação com ferramentas como text-generation-webui, Ollama (em sistemas não Windows), LM Studio etc.
  • Outros argumentam que o valor é:
    • Branding e suporte oficiais da Nvidia.
    • Instalador com um clique e interface simples para usuários Windows não especialistas.
    • Escolha automática do modelo com base na VRAM.
  • Comparação: stacks de código aberto são vistas como mais flexíveis, mas intimidadoras (GitHub, scripts de terminal, interfaces cheias de jargões).

RAG e “Chat com Seus Arquivos”

  • O recurso diferencial destacado é o RAG embutido sobre dados locais (documentos, URLs do YouTube).
  • Alguns observam que a qualidade do RAG é mista: respostas corretas, mas às vezes citações de arquivo incorretas.
  • As pessoas veem forte apelo em um assistente pessoal local que indexa toda a atividade e documentos, mas reconhecem que isso ainda não está totalmente realizado.

Local vs. Nuvem, Privacidade e Censura

  • Os usuários gostam de ser local e potencialmente menos censurado do que IAs em nuvem, mas se preocupam com a possibilidade de a Nvidia ainda coletar dados.
  • O código-fonte (menos o instalador) está disponível para inspeção; alguns recomendam monitorar/bloquear o tráfego de rede se houver preocupação.
  • Risco legal/de PR é citado como motivo para a Nvidia ainda incluir guardrails de conteúdo.

Mercado e Ecossistema

  • Visto como uma demonstração tecnológica para o TensorRT-LLM e uma forma de a Nvidia promover a RTX como marca de “IA”, não apenas de ray tracing.
  • Alguns lamentam a falta de uma versão para Linux; outros apontam para o repositório subjacente do TensorRT-LLM para usuários de Linux.