Playground de Perplexity Labs
El nuevo web playground de Perplexity Labs permite a los usuarios probar una variedad de modelos de lenguaje grandes de código abierto, impresionando a muchos por su velocidad, su interfaz minimalista y su capacidad para ejecutar modelos potentes que son difíciles de alojar localmente. Sin embargo, los usuarios informan calidad inconsistente: los modelos más pequeños o no ajustados para instrucciones suelen alucinar, manejar mal consultas simples como “what is this?” o aritmética básica, y pueden ser empujados fácilmente hacia desinformación o contenido poco ético a pesar de las reglas de seguridad nominales. También hay confusión sobre si es un chatbot o un motor de respuestas con búsqueda, junto con críticas a las decisiones de UX, el comportamiento de censura y la infraestructura opaca detrás de escena.
Impresiones generales y rendimiento
- Muchos elogian el Playground por ser rápido, responsivo, minimalista y cómodo para probar múltiples LLM de código abierto sin configuración.
- Otros consideran que la calidad es inconsistente: la velocidad impresiona, pero las respuestas a menudo son incorrectas, superficiales o extrañamente fuera de tema.
- Algunos sienten que no es mejor que ChatGPT 3.5; otros encuentran que modelos específicos (p. ej., Mixtral, CodeLlama) son sólidos.
Comportamiento del modelo y calidad de las respuestas
- El modelo predeterminado
pplx-7b-onlinea menudo se comporta de forma extraña: se identifica mal (Google Lens, Alexa, IBM Watson, personas aleatorias) y trata las instrucciones genéricas como búsquedas web. - Los modelos ajustados para instrucción (p. ej., Mixtral-instruct, pplx-70b-chat, Mistral-7B-instruct) generalmente ofrecen respuestas mucho mejores y más coherentes.
- Los usuarios observan fallos claros en aritmética básica, física, preguntas específicas de depuración y consultas multilingües; algunos modelos defienden obstinadamente respuestas incorrectas.
Integración de búsqueda y sesgo
- Los modelos en línea incorporan en gran medida búsqueda web/RAG. Para indicaciones muy genéricas como “what is this” o “what’s your name,” repiten los resultados principales de Google (p. ej., Google Lens, Eminem).
- Esto conduce a un fuerte sesgo aparente hacia lo que tenga mejor ranking en la búsqueda, incluidos blogs de nicho y sitios de acertijos.
Seguridad, guardarraíles y uso indebido
- Los guardarraíles parecen desiguales: algunos modelos rechazan pornografía, pero describen libremente contenido dañino (p. ej., exterminio étnico, instrucciones peligrosas) o ayudan a argumentar posiciones planas de la Tierra o racistas cuando se presenta como “thought experiments.”
- A algunos usuarios les gusta la falta de “nannying”; otros lo ven como un riesgo serio de desinformación y ético.
UX y posicionamiento del producto
- Hay confusión sobre qué es el Playground: algunos esperan un chatbot directo; en la práctica, el modelo predeterminado se comporta más como un motor de preguntas y respuestas impulsado por búsquedas.
- El uso sin registro y el cambio fácil de modelos reciben elogios; otros llaman a la experiencia inicial un fallo de UX por la falta de explicación y la débil elección del modelo predeterminado.
Modelos locales vs alojados e infraestructura
- Varios comparan los modelos del Playground con ejecutar Mistral/Llama localmente mediante ollama/llama.cpp, discutiendo cuantización, VRAM, tokens/sec y diferencias de hardware.
- Se aprecia la ingeniería oculta y la optimización de costes necesarias para servir grandes modelos a escala, con curiosidad por la infraestructura de Perplexity y su índice de búsqueda personalizado.