Chat with RTX de Nvidia es un chatbot de IA que se ejecuta localmente en tu PC

La nueva demo tecnológica “Chat with RTX” de Nvidia ofrece un chatbot de IA local que ejecuta Mistral o Llama 2 en PCs con Windows y GPU RTX serie 30/40 recientes, indexando documentos y contenido web de los usuarios mediante RAG para que puedan consultar sus propios datos. Los comentaristas lo ven tanto como una muestra de la aceleración TensorRT-LLM de Nvidia como un intento de vincular las cargas de trabajo de IA al hardware más nuevo, lo que ha provocado quejas sobre requisitos artificiales de GPU y VRAM y comparaciones con herramientas de código abierto ya existentes que son más difíciles de configurar para no expertos. También hay debate sobre privacidad, censura y si los instaladores con la marca oficial y de un solo clic llevarán los LLM locales a una audiencia mucho más amplia que las soluciones caseras actuales.

Requisitos de hardware y limitaciones

  • Requisitos oficiales: Windows 11, 16 GB de RAM, serie RTX 30/40 o GPU RTX Ampere/Ada con ≥8 GB de VRAM, controlador reciente.
  • Muchos se quejan de que las RTX de la serie 20 (p. ej., una 2080 Ti con 11 GB) quedan excluidas y ven esto como una limitación artificial, impulsada por el branding.
  • Algunos argumentan que se debe a la falta de soporte o a un soporte deficiente para formatos de menor precisión (p. ej., bf16) y a los tensor cores de primera generación; otros señalan que TensorRT-LLM en sí mismo enumera Turing como compatible, por lo que la restricción parece arbitraria.
  • El mínimo de 8 GB de VRAM también excluye tarjetas como la más reciente RTX 3050 de 6 GB, lo que a los usuarios les resulta frustrante.

Modelos, rendimiento y pila tecnológica

  • El instalador ocupa ~35 GB e incluye LLaMA 13B y Mistral/Ministral 7B en cuantización int4; en tarjetas de 8 GB parece usar por defecto Mistral 7B.
  • El backend es TensorRT-LLM más un envoltorio RAG para Windows; la UI es un front-end ligero basado en Gradio con un entorno Conda incluido.
  • El rendimiento reportado es muy rápido (por ejemplo, “más rápido de lo que puedo leer”, cientos de tokens/s en tarjetas de gama alta), a costa de una baja variabilidad y un contexto conversacional limitado.
  • Varios comentaristas señalan que TensorRT-LLM es uno de los motores de inferencia más rápidos frente a alternativas como llama.cpp, aunque es más difícil de configurar manualmente.

Propósito, público y valor frente a herramientas existentes

  • A algunos les cuesta ver el punto frente a herramientas como text-generation-webui, Ollama (en sistemas que no son Windows), LM Studio, etc.
  • Otros sostienen que el valor está en:
    • La marca oficial y el soporte de Nvidia.
    • Instalación con un clic y una UI sencilla para usuarios de Windows no expertos.
    • Selección automática del modelo según la VRAM.
  • Comparación: las pilas de código abierto se ven como más flexibles pero intimidantes (GitHub, scripts de terminal, UIs cargadas de jerga).

RAG y “Chat con tus archivos”

  • La característica distintiva destacada: RAG integrado sobre datos locales (documentos, URLs de YouTube).
  • Algunos señalan que la calidad del RAG es mixta: respuestas correctas pero a veces citas de archivos equivocadas.
  • La gente ve un gran atractivo en un asistente personal local que indexe toda su actividad y documentos, pero reconoce que eso aún no está del todo conseguido.

Local vs nube, privacidad y censura

  • A los usuarios les gusta que sea local y potencialmente menos censurado que las IA en la nube, pero les preocupa que Nvidia aún pueda recopilar datos.
  • El código fuente (menos el instalador) está disponible para inspección; algunos recomiendan vigilar o bloquear el tráfico de red si les preocupa.
  • El riesgo legal/de relaciones públicas se cita como la razón por la que Nvidia seguirá incluyendo barandillas de contenido.

Mercado y ecosistema

  • Se ve como una demo tecnológica para TensorRT-LLM y una forma de que Nvidia impulse RTX como una marca de “IA”, no solo de ray tracing.
  • Algunos lamentan la falta de una versión para Linux; otros señalan el repositorio subyacente de TensorRT-LLM para usuarios de Linux.