Fable y el fin del almuerzo gratis
A medida que los modelos de IA de frontera como Fable de Anthropic y Sol de OpenAI se vuelven más inteligentes pero también más caros y fuertemente restringidos, muchos desarrolladores se están orientando hacia alternativas más baratas y “suficientemente buenas”, como DeepSeek, GLM y otros modelos abiertos o de bajo costo. Los comentaristas debaten si nos estamos acercando a una meseta en las capacidades de la IA —donde las mejoras provienen sobre todo del costo y la eficiencia, más que de la inteligencia bruta— o si seguimos en una fase de mejora rápida, con el valor futuro desplazándose hacia modelos especializados, mejores herramientas y armazones que eligen automáticamente el modelo adecuado para cada tarea. El hilo también destaca fricciones prácticas: sistemas de seguridad demasiado agresivos, salidas verbosas y cognitivamente pesadas, e incertidumbre sobre quién capturará finalmente el valor económico en un mercado donde los modelos potentes se convierten rápidamente en commoditis.
Costo vs capacidad e inteligencia “suficientemente buena”
- Muchos ven el verdadero cambio en modelos baratos y “suficientemente buenos” (Deepseek v4 Flash, GPT 5.6 Luna, muse/mimo, GLM, Qwen, etc.) que son rápidos y económicos, suficientes para codificación rutinaria y asistencia cotidiana.
- Otros sostienen que el último 10–20% de capacidad de los modelos de frontera (Fable, Sol, niveles Opus) es desproporcionadamente valioso: mejor arquitectura, menos errores, mayor autonomía y una visión estratégica superior.
- Algunos usuarios mezclan niveles: usan los mejores modelos para planificación, diseño y revisión; y delegan la implementación o los ejemplos a modelos más baratos. Hay desacuerdo sobre si esto realmente ahorra costos una vez que se incluyen el contexto y la sobrecarga de revisión.
¿Estamos alcanzando una curva en S?
- Un sector cree que la inteligencia de los LLM está llegando a rendimientos decrecientes; los modelos de frontera más nuevos parecen solo marginalmente más inteligentes que generaciones anteriores de Opus/Claude, y los benchmarks parecen “amañados”.
- Otros responden que las capacidades siguen mejorando rápido (por ejemplo, matemáticas, razonamiento, voz), y que las afirmaciones sobre un estancamiento han estado repetidamente equivocadas. Algunos califican la evidencia de una meseta como “poco clara”.
AGI, cerebros humanos e impacto económico
- Debate sobre si escalar LLM junto con mejor entrenamiento podría alcanzar una inteligencia “superhumana” o de nivel AGI, frente a la necesidad de arquitecturas parecidas al cerebro o diferentes.
- Algunos sostienen que los LLM ya muestran capacidades “polihumanas” o superhumanas en ciertos dominios (demostraciones matemáticas, análisis de código); los críticos responden que carecen de comprensión real y de aprendizaje en línea, y fallan en aspectos básicos como los husos horarios.
- Desacuerdo sobre quién “gana” económicamente: los accionistas de los primeros laboratorios de AGI, los fabricantes de chips/ASIC, los fabricantes de robótica o la sociedad mediante servicios más baratos. Algunos señalan la alta competencia y la probable comoditización.
Guardrails, censura y usabilidad
- Fuerte frustración con las salvaguardas de Fable/Opus: comprobaciones de seguridad autodesencadenadas frecuentes, degradaciones y rechazos (incluida genética benigna, cocina o identificación de imágenes).
- Algunos ven los modelos alineados con EE. UU. como más restrictivos que los modelos abiertos chinos; otros advierten que el hardware potente podría quedar restringido a hyperscalers, limitando la libertad de autoalojamiento.
Hardware, ley de Moore y silicio especializado
- Desacuerdo sobre la analogía con la ley de Moore: el número de transistores siguió aumentando, pero el rendimiento monohilo se estancó, forzando eficiencia y paralelismo, visto como un paralelo entre el escalado de LLM y el costo de entrenamiento.
- Muchos esperan que el abaratamiento y la aceleración lleguen con silicio personalizado (Cerebras, Etched, ASICs, chips de flujo de datos, modelos de 1 bit) y con el tiempo modelos de tamaño medio capaces de un millón de tokens por segundo; otros dudan de una reducción drástica de costes y citan los costos de servirlos.
Flujos de trabajo de desarrolladores y uso en el mundo real
- Uso intensivo de LLM como programadores en pareja, revisores de especificaciones y asistentes de voz; algunos dicen que un Opus de siempre ya sería “suficiente” para sus vidas.
- Otros informan que Fable sigue siendo “tonto” sin supervisión estrecha, excesivamente verboso, lento y propenso a bucles de autoverificación, lo que hace que modelos más baratos o rivales resulten más atractivos.