Perplexity Labs Playground
Perplexity Labs 的新网页 Playground 让用户可以试用一系列开源大语言模型,凭借其速度、极简界面以及能够运行本地难以托管的强大模型,给许多人留下深刻印象。不过,用户报告称质量并不稳定:较小或非指令模型经常产生幻觉,处理像“what is this?”或基础数学这样的简单问题时也会出错,而且尽管表面上有安全规则,仍然很容易被引导生成错误信息或不道德内容。与此同时,大家也对它究竟是聊天机器人还是带搜索增强的回答引擎感到困惑,并批评其 UX 设计、审查行为以及幕后基础设施的不透明。
总体印象与性能
- 许多人称赞这个 Playground 快速、响应灵敏、极简,并且无需设置即可方便地尝试多个开源 LLM。
- 也有人觉得质量不稳定:速度令人印象深刻,但答案常常错误、浅薄,或奇怪地偏题。
- 有些人认为它不如 ChatGPT 3.5;另一些人则发现某些模型(例如 Mixtral、CodeLlama)表现很强。
模型行为与回答质量
- 默认的
pplx-7b-online模型经常表现怪异:会误认自己(Google Lens、Alexa、IBM Watson、随机人物),并把通用提示词当作网页搜索。 - 指令微调模型(例如 Mixtral-instruct、pplx-70b-chat、Mistral-7B-instruct)通常会给出更好、更连贯的回答。
- 用户在基础算术、物理、特定调试问题以及多语言查询上都看到明显失败;有些模型会顽固地为错误答案辩护。
搜索集成与偏差
- 在线模型会大量整合网页搜索/RAG。对于像“what is this”或“what’s your name”这样非常通用的提示,它们会复述 Google 搜索结果靠前的内容(例如 Google Lens、Eminem)。
- 这导致它们对搜索排名最高的内容表现出强烈的表面偏向,包括小众博客文章和谜语网站。
安全性、护栏与滥用
- 护栏似乎并不均衡:有些模型会拒绝色情内容,但却会自由描述有害内容(例如种族灭绝、危险指令),或者在被包装成“思想实验”时帮助论证地平说或种族主义立场。
- 一些用户喜欢这种不“管教”的风格;另一些人则认为这会带来严重的错误信息与伦理风险。
UX 与产品定位
- 对 Playground 到底是什么存在困惑:有些人期待一个直接的聊天机器人;但实际上默认模型更像一个由搜索驱动的问答引擎。
- 无需注册即可使用以及方便切换模型受到称赞;但也有人认为初始体验是一次 UX 失败,因为缺乏解释,而且默认模型选择很弱。
本地模型与托管模型及基础设施
- 多位用户将 Playground 中的模型与通过 ollama/llama.cpp 在本地运行 Mistral/Llama 进行比较,讨论量化、VRAM、tokens/sec 以及硬件差异。
- 大家也认可以大规模服务大型模型所需的隐藏工程和成本优化,并对 Perplexity 的基础设施和自定义搜索索引感到好奇。