为什么一切都基于似然,尽管似然值如此之小?
统计学家和实践者解释了为什么统计模型中的似然值常常在数值上极小,尤其是在把许多概率相乘时,但这些值仍然可以导出有意义的推断。他们强调,似然通常是概率*密度*(而非概率本身),用于参数估计和模型比较时真正重要的是相对似然或对数似然,并且最大似然方法在广泛条件下表现良好,但在多峰或行为不良的分布中可能遇到困难。讨论还涉及贝叶斯与频率学派的解释、似然原则,以及这些抽象概念如何联系到现实中的决策与风险。
似然的概念角色
- 似然被定义为在给定模型参数时观测数据的概率(或密度),而不是参数本身的概率。
- 似然函数是以参数为自变量、数据固定的函数;它不是关于参数的概率分布,也不会在参数空间中积分为 1。
- 若干评论指出,原始问题把似然与后验概率混淆了,也混淆了参数值“有多大可能”。
连续与离散,以及“微小数字”
- 对于连续变量,任何精确值的概率都是 0;只有区间才有非零概率。密度可以很小或很大,甚至会因尺度和方差而超过 1。
- 多个观测的联合似然会把许多项相乘,因此乘积几乎总是极小或极大;这是一种正常现象,不是问题。
- 由于只有比值才重要,因此更强调对数似然和似然比,而不是绝对大小。
贝叶斯、频率学派与似然原则
- 一条讨论线认为:最大似然估计(MLE)在弱/常规先验下近似贝叶斯推断,并具有良好的收敛性质。
- 另一条讨论线强调似然原则:给定一个模型,关于参数的全部信息都包含在似然函数中;任何可接受的估计量都必须对这个函数“做出合理的处理”。
- 争论集中在频率学派对参数的处理是否在概念上别扭,以及贝叶斯后验、先验和 MAP 估计与似然之间如何关联。
局限性、病态情况与实践
- 基于似然的方法在多峰或行为不良的分布中,以及在概率质量远离 MLE 的高维空间里,可能表现很差。
- 使用 AIC、BIC、似然比检验等进行模型比较被描述为启发式且依赖实现;跨软件复现结果可能很困难。
- 有人认为统计方法脆弱且严重依赖近似;也有人强调它们在许多实际场景中表现良好。
直觉、风险与现实世界推理
- 文中使用了多种类比(抛硬币、彩票、码尺、雨滴、保龄球)来说明,即使在真实模型下,单个精确结果也极不可能。
- 讨论进一步延伸到决策:概率 × 后果的重要性,以及如何推理尾部风险和那些“低概率”但会至少影响每个用户一次的 bug。