Nvidia Nemotron 3.5 Lightning y NeMo Switchyard
El lanzamiento por parte de Nvidia del modelo Nemotron 3.5 Lightning y de la biblioteca de enrutamiento NeMo Switchyard está provocando un escrutinio sobre el “enrutamiento inteligente de modelos”, en particular en torno a cómo interactúa con la caché KV/prompt, el coste y la fiabilidad en flujos de trabajo con varios modelos. Los comentaristas comparan Nemotron con el nuevo Muse Glimmer 30B de Meta y con los modelos Qwen, y por lo general encuentran que el modelo MoE disperso de Nvidia es rápido pero más débil para tareas de codificación complejas que los modelos densos de tamaño similar. Un hilo más amplio analiza el futuro de los modelos locales pequeños y eficientes ante las limitaciones de RAM, con algunos viéndolos como la vía práctica a seguir y otros argumentando que los sistemas cada vez más grandes, de frontera, seguirán dominando, mientras que los modelos abiertos actuarán como un embudo hacia el ecosistema de GPU de Nvidia.
NeMo Switchyard y enrutamiento de modelos
- Switchyard es de código abierto, pero está etiquetado como “experimental”, lo que crea confusión sobre si está listo para producción.
- La documentación y el README apenas mencionan el caché, aunque el código sí lo hace, dejando poco claras las estrategias de enrutamiento–caché.
- Las estrategias de enrutamiento a veces llaman a LLM adicionales para elegir un modelo, lo que añade sobrecarga y parece más adecuado para tareas por lotes (clasificación, ASR) que para agentes conversacionales.
- Algunos ven el “enrutamiento inteligente de modelos” como algo demasiado promocionado, dadas las cuestiones de caché y complejidad; otros creen que es viable si está bien diseñado.
Caché de prompt / KV entre modelos
- Varios comentarios aclaran que “caché de prompt” significa reutilización de la caché KV, no reutilización de texto, y que las cachés KV son estrictamente específicas de cada modelo.
- Un patrón común: mantener cachés cálidas separadas por modelo; al cambiar de modelo, enviar solo el diff desde la última intervención de ese modelo y luego ampliar su caché.
- Cambiar entre dos modelos con caché reduce ligeramente la tasa de aciertos, pero no rompe fundamentalmente el caché.
- Desglose de costes a partir de la discusión:
- Tokens de entrada: se pagan en todos los modelos que ven el contexto.
- Tokens de salida: se pagan solo en el modelo que genera la respuesta (el coste dominante).
- Lecturas en caché: se pagan por turno; el uso de varios modelos no aumenta el número de turnos.
- Algunos sostienen que el principal reto es que un buen enrutador debe ser muy potente por sí mismo; de lo contrario, los errores de enrutamiento superan los ahorros.
MoE frente a modelos densos (Nemotron vs otros)
- Nemotron 3.5 Lightning es disperso/MoE; Muse Glimmer 30B de Meta y varios modelos densos Qwen/Gemma/Laguna de 27–35B se discuten como comparaciones.
- Los benchmarks y pruebas anecdóticas sugieren que Glimmer y los modelos densos Qwen modernos suelen ofrecer mayor calidad pero son más lentos; Lightning y otros MoE son mucho más rápidos debido a que activan menos parámetros.
- Para tareas de codificación/agénticas (p. ej., construir una pizarra colaborativa), varias personas informan que modelos MoE como Nemotron Lightning y Qwen 35B MoE rinden mal, mientras que modelos densos de ~30B funcionan de manera fiable.
- Se cita una regla práctica: calidad de MoE ≈ modelo denso con un número de parámetros alrededor de la media geométrica de los parámetros totales y los activos.
Hardware, RAM y tamaño de modelo
- La continua “ramapocalypse” se ve como un impulso hacia el interés en modelos más pequeños, más eficientes y autoalojables (26–35B, y hipotéticos MoE más pequeños para GPUs de 16GB).
- Otros argumentan que la historia favorece escalar modelos grandes y luego destilarlos/optimizarlos, y ven las estrategias de solo modelos pequeños como arriesgadas.
- La discusión cubre el uso de VRAM de las cachés KV en longitudes de contexto largas, los cuellos de botella de ancho de banda y los tokens por segundo prácticos en GPUs como la 3090.
Herramientas, nombres y fricción del ecosistema
- Es común la confusión entre variantes MoE y densas (por ejemplo, nombres de Qwen “AxB”); algunas interfaces de herramientas lo ocultan, lo que lleva a expectativas erróneas en los usuarios.
- Se enlaza un sitio de enrutamiento/benchmarks; algunos lo ven útil, otros como una especie de publicidad encubierta.
Otros desvíos
- Breves hilos laterales sobre la escritura minimalista como antídoto contra la sobrecarga de información impulsada por IA, y sobre la identidad mediante pruebas de conocimiento cero para redes sociales con el fin de mitigar la desinformación generada por LLM.