Ollama 现已在 Windows 上提供预览版

Ollama 新推出的 Windows 预览版重新激发了人们对在本地运行大语言模型的兴趣,许多用户称赞它能轻松把消费级电脑——尤其是游戏主机——变成实用的 AI 工作站。讨论的焦点主要集中在分散的 GPU 支持(NVIDIA 对 AMD、ROCm 对 Vulkan/OpenCL)、将模型通过本地 HTTP 服务器暴露出来之类的架构选择,以及 Open-WebUI、LM Studio 和 Msty 等前端如何与 Ollama 集成。评论者还比较了非英语语言下的模型质量,描述了从代码自动补全到写作辅助等实际用途,并强调了通过将“简单”提示词交给本地模型来降低云端 AI 成本的潜力。

平台可用性与 Windows 预览版

  • Ollama 之前在 macOS 和 Linux 上就已经很受欢迎;原生 Windows 支持消除了对 WSL 的需求,而有些人觉得 WSL 虽然强大但不太方便。
  • 用户很高兴它现在在 Windows 和 macOS 上都能以类似的良好方式运行,包括在可用时提供 GPU 支持。

GPU 与驱动支持(尤其是 AMD)

  • 对 AMD GPU 缺乏完善支持的挫败感反复出现,尤其是在 Windows 上;许多人后悔为了 AI 工作负载购买 AMD。
  • 一些人反馈 ROCm 在 Linux 下的新款 AMD 显卡上表现良好;另一些人则描述了内核崩溃、对消费级 GPU 的支持被移除,以及痛苦的安装过程。
  • 提到的替代方案包括:通过 llama.cpp 使用 OpenCL 和 Vulkan 后端;OpenCL 往往“能用”,但与 ROCm 相比性能喜忧参半。
  • 维护者表示,AMD GPU 支持在路线图上,而且已经在使用高端 Radeon 硬件进行开发;Windows 上的 ROCm 支持则单独跟踪。
  • NVIDIA 被普遍认为在 AI 方面整体更可靠,不过一些 Linux 用户不喜欢其在快速迭代发行版上的驱动状况。

前端、工具与编辑器集成

  • Open-WebUI(前身为 ollama-webui)被强调为一个快速演进的聊天界面,带有会话搜索功能。
  • 另一个桌面应用 Msty 提供了本地与在线模型的统一 UI,现已支持 Windows,Linux 计划中,AMD 支持也在探索中。
  • VS Code 集成:Continue.dev 和 Cody 可以使用 Ollama 做标签自动补全,并且很快也将支持聊天/重构。

语言能力与模型选择

  • Llama 2(尤其是 13B chat)在中文和日语上的表现很差;会混用语言,并对自己的能力产生幻觉。
  • 其他人推荐使用 Ollama 库中更偏向中文或多语言的模型(例如 Qwen、Yi),或者原始/基础版本,它们可能更能保留非英语能力。

架构:服务端 vs 进程内

  • 讨论的重点是,为什么本地工具要作为 HTTP 服务器运行,而不是把模型直接嵌入到 UI 中。
  • 支持服务端的理由包括:避免反复加载模型、让多个客户端和机器共享同一个模型、打包更容易(容器)、兼容 OpenAI 的 API,以及便于远程/无头使用。
  • 批评者不喜欢始终运行的本地服务和未认证的监听器,但他们往往使用性能很强的机器,完全可以直接把模型嵌入进去。

稳定性、性能与安装问题

  • 有报告称在 macOS 上接近最大内存使用时会出现内核崩溃,在 Linux 上使用 AMD ROCm 也会出现类似问题。
  • 一些 GPU(例如 NVIDIA Quadro P3000)未被检测到;维护者表示应该支持,并要求提供日志。
  • Windows 安装程序和 AI 应用经常触发杀毒软件误报;有人建议通过代码签名和安装器工具来缓解。

替代工具与比较

  • LM Studio 因设置简单和一键下载模型而受到称赞,但也被批评缓存使用不透明、搜索功能薄弱,以及模型导入限制较多。
  • 用户看重 Ollama 的简洁、开源特性,以及它能够把“简单”的提示词本地化处理,同时把更难的任务留给云模型。