Perplexity Labs Playground

Perplexity Labs 的新网页 Playground 让用户可以试用一系列开源大语言模型,凭借其速度、极简界面以及能够运行本地难以托管的强大模型,给许多人留下深刻印象。不过,用户报告称质量并不稳定:较小或非指令模型经常产生幻觉,处理像“what is this?”或基础数学这样的简单问题时也会出错,而且尽管表面上有安全规则,仍然很容易被引导生成错误信息或不道德内容。与此同时,大家也对它究竟是聊天机器人还是带搜索增强的回答引擎感到困惑,并批评其 UX 设计、审查行为以及幕后基础设施的不透明。

总体印象与性能

  • 许多人称赞这个 Playground 快速、响应灵敏、极简,并且无需设置即可方便地尝试多个开源 LLM。
  • 也有人觉得质量不稳定:速度令人印象深刻,但答案常常错误、浅薄,或奇怪地偏题。
  • 有些人认为它不如 ChatGPT 3.5;另一些人则发现某些模型(例如 Mixtral、CodeLlama)表现很强。

模型行为与回答质量

  • 默认的 pplx-7b-online 模型经常表现怪异:会误认自己(Google Lens、Alexa、IBM Watson、随机人物),并把通用提示词当作网页搜索。
  • 指令微调模型(例如 Mixtral-instruct、pplx-70b-chat、Mistral-7B-instruct)通常会给出更好、更连贯的回答。
  • 用户在基础算术、物理、特定调试问题以及多语言查询上都看到明显失败;有些模型会顽固地为错误答案辩护。

搜索集成与偏差

  • 在线模型会大量整合网页搜索/RAG。对于像“what is this”或“what’s your name”这样非常通用的提示,它们会复述 Google 搜索结果靠前的内容(例如 Google Lens、Eminem)。
  • 这导致它们对搜索排名最高的内容表现出强烈的表面偏向,包括小众博客文章和谜语网站。

安全性、护栏与滥用

  • 护栏似乎并不均衡:有些模型会拒绝色情内容,但却会自由描述有害内容(例如种族灭绝、危险指令),或者在被包装成“思想实验”时帮助论证地平说或种族主义立场。
  • 一些用户喜欢这种不“管教”的风格;另一些人则认为这会带来严重的错误信息与伦理风险。

UX 与产品定位

  • 对 Playground 到底是什么存在困惑:有些人期待一个直接的聊天机器人;但实际上默认模型更像一个由搜索驱动的问答引擎。
  • 无需注册即可使用以及方便切换模型受到称赞;但也有人认为初始体验是一次 UX 失败,因为缺乏解释,而且默认模型选择很弱。

本地模型与托管模型及基础设施

  • 多位用户将 Playground 中的模型与通过 ollama/llama.cpp 在本地运行 Mistral/Llama 进行比较,讨论量化、VRAM、tokens/sec 以及硬件差异。
  • 大家也认可以大规模服务大型模型所需的隐藏工程和成本优化,并对 Perplexity 的基础设施和自定义搜索索引感到好奇。