Eu construí modelos de decisão não autoregressivos com RL há um ano
Um projeto open source chamado Laya afirma replicar a ideia central por trás de Jev, um modelo de decisão proprietário fortemente promovido e descrito como “System 1”, usado para tarefas rápidas e estruturadas de classificação que não precisam de um LLM generativo completo. Os comentaristas debatem o quanto Laya realmente se parece com Jev, apontando diferenças importantes em tamanho do modelo, janela de contexto, capacidade zero-shot e necessidade de fine-tuning, enquanto concordam amplamente que classificadores não autoregressivos no estilo BERT não são uma descoberta de pesquisa nova. A discussão se amplia para uma crítica ao hype em IA, à importância de branding e distribuição em vez de pura pesquisa, e a um interesse renovado no uso de modelos menores e especializados em vez de LLMs grandes e caros para tarefas rotineiras de decisão.
Relação entre Laya, Jev e trabalhos anteriores
- Laya é apresentada como um “modelo de decisão” open source, não autoregressivo, inspirado na mesma ideia geral de Jev: saídas estruturadas e tipadas, e probabilidades calibradas para classificação/roteamento.
- Vários comentaristas observam que ideias semelhantes já existiam antes de ambos, por exemplo classificadores no estilo BERT, GLiNER/GLiNER2, classificadores tabulares/“universais” e pontuação de múltipla escolha no estilo MMLU via logits.
- Há debate sobre se Jev “copiou” algo: alguns veem uma reinvenção provavelmente independente sobre uma base de trabalhos anteriores de longa data; outros acham que Jev deveria reconhecer mais trabalhos prévios, incluindo pesquisa aberta como o artigo precursor de Laya.
Características técnicas e limitações
- Laya usa backbones no estilo ModernBERT (~400M de parâmetros) com janelas de contexto relativamente pequenas (512–1024 tokens nos checkpoints, embora o ModernBERT base suporte 8k). Jev é anunciado com ~32k–64k de contexto.
- O artigo de Laya e o cartão no HF enfatizam aprendizado por reforço com recompensas de proper scoring rule para produzir probabilidades calibradas.
- Laya atualmente precisa de fine-tuning para ter bom desempenho no benchmark “typed-decisions”; as pontuações zero-shot ficam perto do acaso (~0,35) versus ~0,77 após o fine-tuning.
- Jev e modelos semelhantes são não autoregressivos, classificadores paralelos, às vezes contrastados com abordagens do tipo difusão; algumas implementações abertas “openjev” emulam o truque geral.
Zero-shot vs. fine-tuned e comparações de qualidade
- Vários comentaristas destacam uma distinção importante: Jev busca ser um classificador geral forte em zero-shot; Laya é melhor visto como uma base rápida para especialização via fine-tuning.
- Alguns usuários relatam que Jev supera substancialmente LLMs e Laya em tarefas reais (por exemplo, categorização de inventário, classificação de tickets de suporte), com grandes ganhos de custo e latência.
- Pelo menos uma pessoa relata Jev em ~95% contra Laya em ~48% de acurácia em um conjunto rotulado de suporte.
- Outros testam Laya em tarefas probabilísticas simples (caras ou coroas, lançamentos de dado) e consideram suas probabilidades sem sentido, levantando dúvidas sobre calibração e compreensão de raciocínio numérico.
Casos de uso e considerações práticas
- Tarefas-alvo comuns: roteamento, classificação, moderação, sentimento, triagem de tickets, marcação de inventário, categorização de logs/erros, políticas de decisão em agentes.
- Várias pessoas enfatizam que muitos fluxos de trabalho baseados em LLM poderiam ser mais baratos e rápidos com esses classificadores, especialmente em escala.
- Modelos pequenos (~400M) são vistos como viáveis em CPUs e hardware de consumo; alguns estão construindo servidores compatíveis com Jev, variantes para visão e sugerem complementos para planilhas.
Alucinações, “System 1” e alegações de segurança
- Jev divulga a ideia de que “não pode alucinar” e o enquadramento de “System 1”. Críticos argumentam que ele ainda pode errar; apenas fica restrito a um esquema e não é generativo.
- Alguns veem benefícios reais de segurança em saídas sempre estruturadas e validação de esquema (superfície reduzida para prompt injection), mas observam que o modelo ainda pode classificar incorretamente.
Marketing, hype e reconhecimento
- Tema forte: tecnologia versus branding. Muitos argumentam que o sucesso de Jev se deve a uma mensagem clara (“modelo System One”, API simples, boa experiência para desenvolvedores) e à distribuição movida por VC, não apenas à matemática nova.
- Outros veem o autor de Laya como pouco reconhecido porque o trabalho ficou apenas em arXiv/HF/Reddit, com um enquadramento acadêmico/saúde em vez de uma ferramenta productizada.
- Também há ceticismo: alguns acham o artigo original de Laya de baixa qualidade acadêmica, apontam problemas como vazamento em código antigo e descrevem o post no HN e o discurso ao redor como exagerados ou “vibe-coded”.
- Vários concluem que o prior art é denso, que a redescoberta independente é comum em ML, e que execução, embalagem e suporte/ferramentas contínuos importam mais do que ser o primeiro.