Nvidia 的 Chat with RTX 是一款可在你的 PC 上本地运行的 AI 聊天机器人

Nvidia 新推出的“Chat with RTX”技术演示提供了一个本地 AI 聊天机器人,可在配备较新 RTX 30/40 系列 GPU 的 Windows PC 上运行 Mistral 或 Llama 2,并通过 RAG 为用户的文档和网页内容建立索引,从而查询自己的数据。评论者认为,它既展示了 Nvidia 的 TensorRT-LLM 加速能力,也试图把 AI 工作负载锁定到更新的硬件上,因此引发了对人为 GPU 和显存要求的抱怨,以及与现有开源工具相比的对照——后者虽然更难让非专家设置,但更灵活。围绕隐私、审查,以及这种由品牌背书的一键安装程序是否会把本地 LLM 带给比当前 DIY 方案更广泛的受众,也存在争论。

硬件要求与限制

  • 官方要求:Windows 11、16GB 内存、RTX 30/40 系列或 RTX Ampere/Ada GPU,且显存 ≥8GB,并需较新的驱动程序。
  • 许多人抱怨 20 系列 RTX(例如配备 11GB 的 2080 Ti)被排除在外,并认为这是人为的、由品牌驱动的限制。
  • 有人认为这是因为对较低精度格式(例如 bf16)以及第一代 Tensor Core 的支持缺失或不佳;另一些人指出 TensorRT-LLM 本身列出了 Turing 作为受支持架构,因此这一限制显得武断。
  • 8GB 显存下限也把像更新的 6GB RTX 3050 这样的显卡排除在外,这让用户感到沮丧。

模型、性能与技术栈

  • 安装程序约 35GB,包含以 int4 量化的 LLaMA 13B 和 Mistral/Ministral 7B;在 8GB 显卡上,它似乎默认使用 Mistral 7B。
  • 后端是 TensorRT-LLM 加上一个 Windows RAG 封装;UI 是一个基于 Gradio 的轻量前端,并捆绑了一个 Conda 环境。
  • 据称性能非常快(例如,“比我读得还快”,在高端显卡上可达每秒数百 token),代价是变化性较低且对话上下文有限。
  • 几位评论者指出,与 llama.cpp 等替代方案相比,TensorRT-LLM 是更快的推理引擎之一,但手动安装配置更困难。

用途、受众,以及与现有工具相比的价值

  • 有些人很难看出它相对于 text-generation-webui、Ollama(在非 Windows 平台上)、LM Studio 等工具的意义。
  • 另一些人认为其价值在于:
    • 官方 Nvidia 品牌与支持。
    • 面向非专家 Windows 用户的一键安装程序和简单 UI。
    • 根据显存自动选择模型。
  • 对比来看:开源栈被认为更灵活,但也更吓人(GitHub、终端脚本、术语密集的界面)。

RAG 与“与你的文件聊天”

  • 被强调的区别特性:对本地数据(文档、YouTube URL)的内置 RAG。
  • 有人指出 RAG 质量参差不齐:答案正确,但文件引用有时会错。
  • 人们看好一个能索引你所有活动和文档的本地个人助手,但也承认这一点还没有完全实现。

本地 vs 云端、隐私与审查

  • 用户喜欢它是本地运行的,并且可能比云端 AI 更少审查,但担心 Nvidia 仍可能收集数据。
  • 源代码(不含安装程序)可供检查;如果担心,有些人建议监控/阻止网络流量。
  • 法律/公关风险被认为是 Nvidia 仍会加入内容护栏的原因。

市场与生态系统

  • 被视为 TensorRT-LLM 的技术演示,也是 Nvidia 将 RTX 推广为“AI”品牌而不仅仅是光线追踪品牌的一种方式。
  • 有人遗憾缺少 Linux 版本;另一些人则指出,Linux 用户可以直接使用底层的 TensorRT-LLM 仓库。