A Era dos LLMs de 1 bit: parâmetros ternários para computação econômica
Um novo artigo de pesquisa afirma que grandes modelos de linguagem podem ser treinados com pesos ternários (−1, 0, 1) — cerca de 1,58 bits por parâmetro — enquanto igualam ou até superam modelos tradicionais de 16 bits em perplexidade, uso de memória, latência e consumo de energia. Os comentários veem isso como uma possível grande mudança tanto para IA em nuvem quanto na borda, permitindo modelos muito maiores ou mais baratos e estimulando novos projetos de hardware otimizados para operações inteiras de precisão ultrabaixa. No entanto, observam que a abordagem parece exigir treinamento do zero, que os benchmarks existentes são limitados a tamanhos relativamente pequenos e que a replicação independente será crucial antes que seu impacto possa ser totalmente avaliado.
Terminologia e Representação
- Muitos se opõem a chamar um modelo {-1,0,1} de “1 bit”; argumentam que ele é ternário / “1-trit” e mais próximo de 1,58 bits (log₂ 3).
- Outros defendem “1 bit” como um atalho de marketing que significa “<2 bits por peso”.
- São discutidos vários esquemas de codificação: 2 bits físicos por peso com um estado não utilizado, ou empacotar 5 trits em 1 byte (3⁵=243), com compensações entre densidade e custo de decodificação.
- Alguns conectam isso ao ternário equilibrado, a argumentos de economia de base e a computadores ternários históricos.
Alegações do Artigo
- Os pesos são restringidos a {-1,0,1}, e as ativações permanecem como inteiros de baixa precisão.
- A partir de ~3B de parâmetros, a perplexidade relatada e o desempenho em tarefas downstream igualam ou superam ligeiramente linhas de base FP16 do mesmo tamanho nos conjuntos de dados dos autores.
- Eficiência relatada: ternário 13B ≈ ou melhor que 3B FP16, 30B ≈ 7B FP16, 70B ≈ 13B FP16 em latência/memória/energia.
- A inferência usa adições e operações de sinal em vez de multiplicações completas, sugerindo implementações de hardware muito mais baratas.
Treinamento vs. Quantização de Modelos Existentes
- Isso não é quantização pós-hoc. Os modelos são treinados do zero com camadas ternárias.
- O treinamento mantém uma cópia “latente” de alta precisão dos pesos; os pesos ternários são usados na passagem direta com estimadores straight-through para backprop.
- Discussão no Hugging Face (citada no tópico) sugere que a simples conversão de modelos FP existentes não preserva a गुणवत्ता; a destilação a partir de modelos existentes é proposta como alternativa.
Implicações para Hardware e Ecossistema
- Comentadores esperam benefícios fortes para aceleradores personalizados, FPGAs e possivelmente hardware óptico/analógico ou ternário, já que multiplicadores podem ser substituídos por circuitos muito pequenos de adição/lógica.
- Alguns veem uma oportunidade de चुनौती a dominância das GPUs; outros acham que os incumbentes apenas adicionarão suporte a inteiros de baixa precisão e/ou comprarão startups.
- Se as alegações se confirmarem, GPUs de consumo ou até dispositivos de borda poderiam hospedar modelos muito maiores e mais rápidos.
Ceticismo, Limitações e Trabalhos Anteriores
- Vários observam métricas de qualidade ausentes ou incompletas para modelos maiores (7B, 13B, 70B) e avaliações em conjuntos de dados específicos ou com poucos tokens; pedem replicação independente.
- São citados trabalhos anteriores sobre redes binárias/ternárias, CNNs de baixa precisão e AdderNets; alguns veem isso como uma escala de engenharia significativa, e não como uma novidade conceitual.
- O sentimento geral mistura entusiasmo com o potencial de eficiência “transformadora” e cautela de que os resultados podem estar sendo interpretados de forma excessiva até que mais modelos e código sejam liberados.