Playground de Perplexity Labs

El nuevo web playground de Perplexity Labs permite a los usuarios probar una variedad de modelos de lenguaje grandes de código abierto, impresionando a muchos por su velocidad, su interfaz minimalista y su capacidad para ejecutar modelos potentes que son difíciles de alojar localmente. Sin embargo, los usuarios informan calidad inconsistente: los modelos más pequeños o no ajustados para instrucciones suelen alucinar, manejar mal consultas simples como “what is this?” o aritmética básica, y pueden ser empujados fácilmente hacia desinformación o contenido poco ético a pesar de las reglas de seguridad nominales. También hay confusión sobre si es un chatbot o un motor de respuestas con búsqueda, junto con críticas a las decisiones de UX, el comportamiento de censura y la infraestructura opaca detrás de escena.

Impresiones generales y rendimiento

  • Muchos elogian el Playground por ser rápido, responsivo, minimalista y cómodo para probar múltiples LLM de código abierto sin configuración.
  • Otros consideran que la calidad es inconsistente: la velocidad impresiona, pero las respuestas a menudo son incorrectas, superficiales o extrañamente fuera de tema.
  • Algunos sienten que no es mejor que ChatGPT 3.5; otros encuentran que modelos específicos (p. ej., Mixtral, CodeLlama) son sólidos.

Comportamiento del modelo y calidad de las respuestas

  • El modelo predeterminado pplx-7b-online a menudo se comporta de forma extraña: se identifica mal (Google Lens, Alexa, IBM Watson, personas aleatorias) y trata las instrucciones genéricas como búsquedas web.
  • Los modelos ajustados para instrucción (p. ej., Mixtral-instruct, pplx-70b-chat, Mistral-7B-instruct) generalmente ofrecen respuestas mucho mejores y más coherentes.
  • Los usuarios observan fallos claros en aritmética básica, física, preguntas específicas de depuración y consultas multilingües; algunos modelos defienden obstinadamente respuestas incorrectas.

Integración de búsqueda y sesgo

  • Los modelos en línea incorporan en gran medida búsqueda web/RAG. Para indicaciones muy genéricas como “what is this” o “what’s your name,” repiten los resultados principales de Google (p. ej., Google Lens, Eminem).
  • Esto conduce a un fuerte sesgo aparente hacia lo que tenga mejor ranking en la búsqueda, incluidos blogs de nicho y sitios de acertijos.

Seguridad, guardarraíles y uso indebido

  • Los guardarraíles parecen desiguales: algunos modelos rechazan pornografía, pero describen libremente contenido dañino (p. ej., exterminio étnico, instrucciones peligrosas) o ayudan a argumentar posiciones planas de la Tierra o racistas cuando se presenta como “thought experiments.”
  • A algunos usuarios les gusta la falta de “nannying”; otros lo ven como un riesgo serio de desinformación y ético.

UX y posicionamiento del producto

  • Hay confusión sobre qué es el Playground: algunos esperan un chatbot directo; en la práctica, el modelo predeterminado se comporta más como un motor de preguntas y respuestas impulsado por búsquedas.
  • El uso sin registro y el cambio fácil de modelos reciben elogios; otros llaman a la experiencia inicial un fallo de UX por la falta de explicación y la débil elección del modelo predeterminado.

Modelos locales vs alojados e infraestructura

  • Varios comparan los modelos del Playground con ejecutar Mistral/Llama localmente mediante ollama/llama.cpp, discutiendo cuantización, VRAM, tokens/sec y diferencias de hardware.
  • Se aprecia la ingeniería oculta y la optimización de costes necesarias para servir grandes modelos a escala, con curiosidad por la infraestructura de Perplexity y su índice de búsqueda personalizado.