La era de los LLMs de 1 bit: parámetros ternarios para una computación rentable
Un nuevo artículo de investigación afirma que los modelos de lenguaje grandes pueden entrenarse con pesos ternarios (−1, 0, 1) —unos 1,58 bits por parámetro—, al tiempo que igualan o incluso superan a los modelos tradicionales de 16 bits en perplejidad, uso de memoria, latencia y consumo energético. Los comentaristas ven esto como un posible cambio importante tanto para la IA en la nube como en el borde, al permitir modelos mucho más grandes o más baratos y fomentar nuevos diseños de hardware optimizados para operaciones enteras de ultra baja precisión. Sin embargo, señalan que el enfoque parece requerir entrenar los modelos desde cero, que los benchmarks existentes se limitan a tamaños relativamente pequeños y que la replicación independiente será crucial antes de poder evaluar plenamente su impacto.
Terminología y representación
- A muchos les molesta llamar “1 bit” a un modelo {-1,0,1}; argumentan que es ternario / “1 trit” y más cercano a 1,58 bits (log₂ 3).
- Otros defienden “1 bit” como una abreviatura de marketing que significa “<2 bits por peso”.
- Se discuten varios esquemas de codificación: 2 bits físicos por peso con un estado sin usar, o empaquetar 5 trits en 1 byte (3⁵=243), con compensaciones entre densidad y coste de decodificación.
- Algunos conectan esto con el ternario equilibrado, argumentos de economía de radix y ordenadores ternarios históricos.
Afirmaciones del artículo
- Los pesos están restringidos a {-1,0,1}, y las activaciones siguen siendo enteros de baja precisión.
- A partir de ~3B de parámetros, la perplejidad reportada y el rendimiento en tareas posteriores igualan o superan ligeramente a las líneas base FP16 del mismo tamaño en los conjuntos de datos de los autores.
- Eficiencia reportada: ternario 13B ≈ o mejor que 3B FP16, 30B ≈ 7B FP16, 70B ≈ 13B FP16 en latencia/memoria/energía.
- La inferencia usa sumas y operaciones de signo en lugar de multiplicaciones completas, lo que sugiere implementaciones de hardware mucho más baratas.
Entrenamiento vs. cuantizar modelos existentes
- Esto no es cuantización a posteriori. Los modelos se entrenan desde cero con capas ternarias.
- El entrenamiento conserva una copia “latente” de alta precisión de los pesos; los pesos ternarios se usan en el pase hacia delante con estimadores straight-through para la retropropagación.
- La discusión en Hugging Face (citada en el hilo) sugiere que una conversión simple de modelos FP existentes no preserva la calidad; se propone la destilación desde modelos existentes como solución.
Implicaciones para hardware y el ecosistema
- Los comentaristas esperan beneficios importantes para aceleradores personalizados, FPGAs y posiblemente hardware óptico/analógico o ternario, ya que los multiplicadores pueden sustituirse por circuitos diminutos de suma/lógica.
- Algunos ven una oportunidad para desafiar el dominio de las GPU; otros creen que los incumbentes simplemente añadirán soporte para enteros de baja precisión y/o adquirirán startups.
- Si las afirmaciones se sostienen, las GPU de consumo o incluso los dispositivos en el borde podrían alojar modelos mucho más grandes y rápidos.
Escepticismo, limitaciones y trabajo previo
- Varios señalan métricas de calidad faltantes o incompletas para modelos más grandes (7B, 13B, 70B) y evaluaciones con relativamente pocos tokens o en conjuntos de datos específicos; piden replicación independiente.
- Se cita trabajo previo sobre redes binarias/ternarias, CNNs de baja precisión y AdderNets; algunos lo ven como una importante ampliación de ingeniería más que como una novedad conceptual.
- El sentimiento general mezcla entusiasmo por un posible aumento “transformador” de la eficiencia con cautela de que los resultados puedan estar sobreinterpretándose hasta que se publiquen más modelos y código.