Por que tudo se baseia em verossimilhanças, mesmo que as verossimilhanças sejam tão pequenas?
Estatísticos e praticantes explicam por que as verossimilhanças em modelos estatísticos frequentemente assumem valores numéricos muito pequenos, especialmente ao multiplicar muitas probabilidades, mas ainda assim produzem inferências significativas. Eles enfatizam que a verossimilhança é tipicamente uma *densidade* de probabilidade (não uma probabilidade em si), que apenas as verossimilhanças relativas ou em log importam para tarefas como estimação de parâmetros e comparação de modelos, e que métodos de máxima verossimilhança funcionam bem sob condições amplas, embora possam ter dificuldades com distribuições multimodais ou mal comportadas. A troca também aborda interpretações bayesiana versus frequentista, o princípio da verossimilhança e como essas abstrações se conectam à tomada de decisão e ao risco no mundo real.
Papel conceitual da verossimilhança
- Verossimilhança é definida como a probabilidade (ou densidade) dos dados observados dado os parâmetros do modelo, não a probabilidade dos próprios parâmetros.
- A função de verossimilhança é uma função dos parâmetros com os dados fixos; ela não é uma distribuição de probabilidade sobre parâmetros e não integra para 1 no espaço dos parâmetros.
- Vários comentários observam que a pergunta original confunde verossimilhanças com probabilidades a posteriori e com “quão provável” é um valor de parâmetro.
Contínuo vs discreto e “números minúsculos”
- Para variáveis contínuas, a probabilidade de qualquer valor exato é 0; apenas intervalos têm probabilidade não nula. Densidades podem ser pequenas ou grandes e podem até exceder 1 dependendo da escala e da variância.
- Verossimilhanças conjuntas para muitas observações multiplicam muitos termos, então o produto quase sempre fica extremamente pequeno ou extremamente grande; esse é um comportamento esperado, não um problema.
- Como apenas as razões importam, log-verossimilhanças e razões de verossimilhança recebem mais destaque do que magnitudes absolutas.
Bayesiano, frequentista e o princípio da verossimilhança
- Uma linha de discussão: a estimação por máxima verossimilhança (MLE) aproxima a inferência bayesiana com priors fracos/regulares e tem boas propriedades de convergência.
- Outra linha enfatiza o princípio da verossimilhança: toda a informação sobre parâmetros, dado um modelo, está contida na função de verossimilhança; qualquer estimador admissível deve “fazer algo sensato” com essa função.
- Surge debate sobre se o tratamento frequentista de parâmetros é conceitualmente estranho, e como posteriors bayesianos, priors e estimativas MAP se relacionam com a verossimilhança.
Limitações, patologias e prática
- Métodos baseados em verossimilhança podem se comportar mal para distribuições multimodais ou mal comportadas e em espaços de alta dimensão, onde a massa está longe do MLE.
- A comparação de modelos via AIC, BIC, testes de razão de verossimilhança etc. é descrita como heurística e dependente da implementação; reproduzir resultados entre softwares pode ser difícil.
- Alguns argumentam que métodos estatísticos são frágeis e fortemente dependentes de aproximações; outros enfatizam que eles funcionam bem em muitos contextos práticos.
Intuição, risco e raciocínio no mundo real
- Múltiplas analogias (cara ou coroa, loterias, réguas, gotas de chuva, bolas de boliche) são usadas para mostrar que resultados exatos individuais são extremamente improváveis mesmo sob o modelo verdadeiro.
- A discussão se estende à tomada de decisão: importância de probabilidade × consequência, desafios ao raciocinar sobre riscos de cauda e bugs de “baixa probabilidade” que afetam cada usuário ao menos uma vez.