Fable y el fin del almuerzo gratis

A medida que los modelos de IA de frontera como Fable de Anthropic y Sol de OpenAI se vuelven más inteligentes pero también más caros y fuertemente restringidos, muchos desarrolladores se están orientando hacia alternativas más baratas y “suficientemente buenas”, como DeepSeek, GLM y otros modelos abiertos o de bajo costo. Los comentaristas debaten si nos estamos acercando a una meseta en las capacidades de la IA —donde las mejoras provienen sobre todo del costo y la eficiencia, más que de la inteligencia bruta— o si seguimos en una fase de mejora rápida, con el valor futuro desplazándose hacia modelos especializados, mejores herramientas y armazones que eligen automáticamente el modelo adecuado para cada tarea. El hilo también destaca fricciones prácticas: sistemas de seguridad demasiado agresivos, salidas verbosas y cognitivamente pesadas, e incertidumbre sobre quién capturará finalmente el valor económico en un mercado donde los modelos potentes se convierten rápidamente en commoditis.

Costo vs capacidad e inteligencia “suficientemente buena”

  • Muchos ven el verdadero cambio en modelos baratos y “suficientemente buenos” (Deepseek v4 Flash, GPT 5.6 Luna, muse/mimo, GLM, Qwen, etc.) que son rápidos y económicos, suficientes para codificación rutinaria y asistencia cotidiana.
  • Otros sostienen que el último 10–20% de capacidad de los modelos de frontera (Fable, Sol, niveles Opus) es desproporcionadamente valioso: mejor arquitectura, menos errores, mayor autonomía y una visión estratégica superior.
  • Algunos usuarios mezclan niveles: usan los mejores modelos para planificación, diseño y revisión; y delegan la implementación o los ejemplos a modelos más baratos. Hay desacuerdo sobre si esto realmente ahorra costos una vez que se incluyen el contexto y la sobrecarga de revisión.

¿Estamos alcanzando una curva en S?

  • Un sector cree que la inteligencia de los LLM está llegando a rendimientos decrecientes; los modelos de frontera más nuevos parecen solo marginalmente más inteligentes que generaciones anteriores de Opus/Claude, y los benchmarks parecen “amañados”.
  • Otros responden que las capacidades siguen mejorando rápido (por ejemplo, matemáticas, razonamiento, voz), y que las afirmaciones sobre un estancamiento han estado repetidamente equivocadas. Algunos califican la evidencia de una meseta como “poco clara”.

AGI, cerebros humanos e impacto económico

  • Debate sobre si escalar LLM junto con mejor entrenamiento podría alcanzar una inteligencia “superhumana” o de nivel AGI, frente a la necesidad de arquitecturas parecidas al cerebro o diferentes.
  • Algunos sostienen que los LLM ya muestran capacidades “polihumanas” o superhumanas en ciertos dominios (demostraciones matemáticas, análisis de código); los críticos responden que carecen de comprensión real y de aprendizaje en línea, y fallan en aspectos básicos como los husos horarios.
  • Desacuerdo sobre quién “gana” económicamente: los accionistas de los primeros laboratorios de AGI, los fabricantes de chips/ASIC, los fabricantes de robótica o la sociedad mediante servicios más baratos. Algunos señalan la alta competencia y la probable comoditización.

Guardrails, censura y usabilidad

  • Fuerte frustración con las salvaguardas de Fable/Opus: comprobaciones de seguridad autodesencadenadas frecuentes, degradaciones y rechazos (incluida genética benigna, cocina o identificación de imágenes).
  • Algunos ven los modelos alineados con EE. UU. como más restrictivos que los modelos abiertos chinos; otros advierten que el hardware potente podría quedar restringido a hyperscalers, limitando la libertad de autoalojamiento.

Hardware, ley de Moore y silicio especializado

  • Desacuerdo sobre la analogía con la ley de Moore: el número de transistores siguió aumentando, pero el rendimiento monohilo se estancó, forzando eficiencia y paralelismo, visto como un paralelo entre el escalado de LLM y el costo de entrenamiento.
  • Muchos esperan que el abaratamiento y la aceleración lleguen con silicio personalizado (Cerebras, Etched, ASICs, chips de flujo de datos, modelos de 1 bit) y con el tiempo modelos de tamaño medio capaces de un millón de tokens por segundo; otros dudan de una reducción drástica de costes y citan los costos de servirlos.

Flujos de trabajo de desarrolladores y uso en el mundo real

  • Uso intensivo de LLM como programadores en pareja, revisores de especificaciones y asistentes de voz; algunos dicen que un Opus de siempre ya sería “suficiente” para sus vidas.
  • Otros informan que Fable sigue siendo “tonto” sin supervisión estrecha, excesivamente verboso, lento y propenso a bucles de autoverificación, lo que hace que modelos más baratos o rivales resulten más atractivos.