给定随机变量的分布和未知参数,利用观测到的样本计算似然函数。
选择最大似然函数的参数作为参数的估计量。
最大似然估计的基本原理:极大化似然函数
假设样本{X1,X2,...Xn}服从概率密度函数fθ(x),其中θ=(θ1,θ2,....θk)是未知参数。
当固定x的时候,fθ(x)就是θ的函数,我们把这个函数称为似然函数,记做Lx(θ)
似然函数不是概率,是概率密度函数在x固定时候,θ的可能性的函数。
假设x=(x1,.....xn)是样本的观测值,那么整体样本的似然函数就是:
Lx(θ)=∐i=1nLxi(θ)
这是 一个关于θ的函数,选取使得Lx(θ)的最大化的θ′作为θ的估计量。
最大化 似然函数,相当于最大化似然函数的对数lx(θ)=ln(Lx(θ)),一般我们求解似然函数或者对数似然函数的驻点的方程
dθdlx(θ))=0或者dθdLx(θ))=0 由于Lx(θ)中包含连乘,转化对数好求解。
然后判断整个驻点是否是最大点(求解驻点可以采用牛顿法或者梯度下降法)。
如何利用极大似然估计法来求极大似然估计量呢?
首先我们来看一个例子:有一个抽奖箱,里面有若干红球和白球,除颜色外,其他一模一样。我们每次从中拿出一个后记录下来再放回去,重复十次操作后发现,有七次抽到了红球,三次是白球,请估计红球所占的比例。
从题目可以分析出本次例子满足二项分布,现在可以设事件 A 为"抽到红球",那可以得到一个式子:
P(A)=P(A)7∗(1−P(A))3 (1)
现在的目的就是为了求这个 P(A),那要怎么求才又快又准呢?如果用求导解驻点来寻找极值,7 次方好像也不是很大,那要是我们重复进行了一百、一千次操作呢?所以,优化算法势在必行,下面的骚操作就是先辈们经过不懈地探求总结出来的——先取对数再求导!
对(1)式取对数,得:
lnP(A)=7lnP(A)+3ln(1−P(A))
对上式求导,整理得:
dP(A)dln(P(A))=P(A)7−(1−P(A))3
令该导数为零,可得式子:
P(A)7=(1−P(A))3
解得P(A)=0.7
从这个例子中我们可以得到和《概率论与数理统计》一书中相匹配的抽象结果:设总体 X 为离散型随机变量,且它的概率分布为P{X=x}=p{xi;θ}, 其中 θ 为未知参数X1,X2,⋯,Xn和x1,x2,⋅⋅⋅,xn分别为 X 的一组样本和样本观察值。则参数 θ 的取值应该使得概率:
P{X1=x1,X2=x2,∗⋯,Xn=xn}=P{X1=x1}∗P{X2=x2}∗⋯P{Xn=xn}=i=1∏np{xi;θ}
达到最大值,今后我们称 θ 的函数:
L(θ)=∏i=1np{xi;θ}
为 θ 的似然函数,上式是其样本取对应观察值的概率。同时,如果有
∃θ^=θ^(X1,X2,⋯,Xn)
使得:
L(θ^)=maxθ∈ΘL(θ)=maxθ∈Θ∏i=1np{xi;θ}
则称 θ^为 θ 的极大似然估计量。从上述一般结果的抽象描述中,我们可以剥离出求解 θ^的一般步骤:
- 写出似然函数 L(θ)=L(x1,x2,⋯,xn;θ) ;
- 对似然函数取对数(视情况而定);
- 求对数似然函数对未知参数的导函数 dθdlnL(θ);x=y
- 令导函数为 0,方程的解即为极大似然解;