本章主要回顾数学分析的主要知识点。专题介绍机器学习中常用的一些方法。
导数定义
导数和微分的概念
f′(x0)=limΔx→0Δxf(x0+Δx)−f(x0) (1)
或者
f′(x0)=limx→x0x−x0f(x)−f(x0) (2)
函数的可导性与连续性之间的关系
**Th1: **函数f(x)在x0处可微⇔f(x)在x0处可导
**Th2: **若函数在点x0处可导,则y=f(x)在点x0处连续,反之则不成立。即函数连续不一定可导。
**Th3: **f′(x0)存在⇔f−′(x0)=f+′(x0)
平面曲线的切线和法线
切线方程 :y−y0=f′(x0)(x−x0)
法线方程:y−y0=−f′(x0)1(x−x0),f′(x0)=0
四则运算法则
设函数u=u(x), v=v(x)在点x可导:则
(1)(u±v)′=u′±v′ d(u±v)=du±dv
(2)(uv)′=uv′+vu′ d(uv)=udv+vdu
(3)(vu)′=v2vu′−uv′(v=0) d(vu)=v2vdu−udv
基本导数与微分表
- y=c y′=0 dy=0
- y=xα y′=αxα−1 dy=αxα−1dx
- y=ax y′=axlna dy=axlnadx 特例 (ex)′=ex d(ex)=exdx
- y=lnax y′=xlna1 dy=xlna1dx 特例 y=lnx (lnx)′=x1 d(lnx)=x1dx
- y=sinx y′=cosx d(sinx)=cosxdx
- y=cosx y′=−sinx d(cosx)=−sinxdx
- y=tanx y′=cos2x1=sec2x d(tanx)=sec2xdx
- y=cotx y′=−sin2x1=−csc2x d(cotx)=−csc2xdx
- y=secx y′=secxtanx d(secx)=secxtanxdx
- y=cscx y′=−cscxcotx d(cscx)=−cscxcotxdx
- y=arcsinx y′=1−x21 d(arcsinx)=1−x21dx
- y=arccosx y′=−1−x21 d(arccosx)=−1−x21dx
- y=arctanx y′=1+x21 d(arctanx)=1+x21dx
复合函数,反函数,隐函数以及参数方程所确定的函数的微分法
(1) 反函数的运算法则: 设y=f(x)在点x的某邻域内单调连续,在点x处可导且f′(x)=0,则其反函数在点x所对应的y处可导,并且有dxdy=dydx1
(2) 复合函数的运算法则:若μ=φ(x)在点x可导,而y=f(μ)在对应点μ(μ=φ(x))可导,则复合函数y=f(φ(x))在点x可导,且y′=f′(μ)⋅φ′(x)
(3) 隐函数导数dxdy的求法一般有三种方法:
1)方程两边对x求导,要记住y是x的函数,则y的函数是x的复合函数.例如y1,y2,lny,ey等均是x的复合函数. 对x求导应按复合函数连锁法则做.
2)公式法.由F(x,y)=0 知dxdy=−Fy′(x,y)Fx′(x,y),其中,Fx′(x,y),Fy′(x,y)分别表示F(x,y)对x和y的偏导数
3)利用微分形式不变性
常用高阶导数公式
- (ax)(n)=axlnna(a>0)
- (ex)(n)=ex
- (sinkx)(n)=knsin(kx+n⋅2π)
- (coskx)(n)=kncos(kx+n⋅2π)
- (lnx)(n)=(−1)(n−1)xn(n−1)!
- 莱布尼兹公式:若u(x),v(x)均n阶可导,则(uv)(n)=∑i=0ncniu(i)v(n−i),其中u(0)=u,v(0)=v
方向导数
∂l∂f=∂x∂fcosφ+∂y∂fsinφ
微分中值定理,泰勒公式
Th1:(费马定理)
若函数f(x)满足条件: (1)函数f(x)在x0的某邻域内有定义,并且在此邻域内恒有f(x)≤f(x0)或f(x)≥f(x0),
(2)f(x)在x0处可导,则有f′(x0)=0
Th2:(罗尔定理)
设函数f(x)满足条件:
(1)在闭区间[a,b]上连续;
(2)在(a,b)内可导;
(3)f(a)=f(b)
则在(a,b)内存在一个ξ,使f′(ξ)=0
Th3:(拉格朗日中值定理)
设f(x)函数满足条件:
(1)在[a,b]上连续;
(2)在(a,b)内可导;
则在(a,b)内存在一个ξ,使b−af(b)−f(a)=f′(ξ)
Th4:(柯西中值定理)
设函数f(x),g(x)满足条件:
(1) 在[a,b]上连续;
(2) 在(a,b)内可导且f′(x),g′(x)均存在,且g′(x)=0
则在(a,b)内存在一个ξ,使g(b)−g(a)f(b)−f(a)=g′(ξ)f′(ξ)
洛必达法则
法则Ⅰ (00**型) **
设函数f(x), g(x)满足条件:limx→x0f(x)=0,limx→x0g(x)=0;
f(x), g(x)在x0的邻域内可导,(在x0处可除外)且g′(x)=0;
limx→x0g′(x)f′(x)存在(或∞)。
则:limx→x0g(x)f(x)=limx→x0g′(x)f′(x)。
法则I′(00型)
设函数f(x),g(x)满足条件:limx→∞f(x)=0,limx→∞g(x)=0;
存在一个X>0,当∣x∣>X时,f(x),g(x)可导,且g′(x)=0;limx→x0g′(x)f′(x);存在(或∞)。
则:limx→x0g(x)f(x)=limx→x0g′(x)f′(x)
法则Ⅱ(∞∞**型) **
设函数f(x), g(x)满足条件:
limx→x0f(x)=∞,limx→x0g(x)=∞;f(x),g(x)在x0的邻域内可导(在x0处可除外)且g′(x)=0;
limx→x0g′(x)f′(x)存在(或∞)。则limx→x0g(x)f(x)=limx→x0g′(x)f′(x)
同理法则II′(∞∞型)仿法则I′可写出。
泰勒公式
设函数f(x)在点x0处的某邻域内具有n+1阶导数,则对该邻域内异于x0的任意点x,在x0与x之间至少存在 一个ξ,使得f(x)=f(x0)+f′(x0)(x−x0)+2!1f′′(x0)(x−x0)2+⋯+n!f(n)(x0)(x−x0)n+Rn(x):其中Rn(x)=(n+1)!f(n+1)(ξ)(x−x0)n+1称为f(x)在点x0处的n阶泰勒余项。
令x0=0,则n阶泰勒公式f(x)=f(0)+f′(0)x+2!1f′′(0)x2+⋯+n!f(n)(0)xn+Rn(x) .........(1)其中Rn(x)=(n+1)!f(n+1)(ξ)xn+1,ξ在0与x之间.式称为麦克劳林公式
常用五种函数在x0=0处的泰勒公式
- ex=1+x+2!1x2+⋯+n!1xn+(n+1)!xn+1eξ 或者 ex=1+x+2!1x2+⋯+n!1xn+o(xn)
- sinx=x−3!1x3+⋯+n!xnsin2nπ+(n+1)!xn+1sin(ξ+2n+1π) 或者 sinx=x−3!1x3+⋯+n!xnsin2nπ+o(xn)
- cosx=1−2!1x2+⋯+n!xncos2nπ+(n+1)!xn+1cos(ξ+2n+1π)
- ln(1+x)=x−21x2+31x3−⋯+(−1)n−1nxn+(n+1)(1+ξ)n+1(−1)nxn+1
- (1+x)m=1+mx+2!m(m−1)x2+⋯+n!m(m−1)⋯(m−n+1)xn+(n+1)!m(m−1)⋯(m−n+1)xn+1(1+ξ)m−n−1
函数单调性的判断
**Th1:**设函数f(x)在区间(a,b)内可导,如果对∀x∈(a,b),都有f′(x)>0(或f′(x)<0),则函数f(x)在(a,b)内是单调增加的(或单调减少)
Th2:(取极值的必要条件)设函数f(x)在x0处可导,且在x0处取极值,则f′(x0)=0。
Th3:(取极值的第一充分条件)设函数f(x)在x0的某一邻域内可微,且f′(x0)=0(或f(x)在x0处连续,但f′(x0)不存在。)
(1)若当x经过x0时,f(x)由“+”变“-”,则为极大值; (2)若当x经过x0时,由“-”变“+”,则为极小值; (3)若f′(x)经过x=x0的两侧不变号,则不是极值。
Th4:(取极值的第二充分条件)设f(x)在点x0处有f′′(x)=0,且f′(x0)=0,则f′′(x0)<0 当时,f(x0)为极大值; 当f′′(x0)>0时,f(x0)为极小值。 注:如果f′′(x0)=0,此方法失效。
函数凹凸性的判断
Th1:(凹凸性的判别定理)若在I上f′′(x)<0(或f′′(x)>0),则f(x)在I上是凸的(或凹的)。
Th2:(拐点的判别定理1)若在x0处f′′(x)=0,(或f′′(x)不存在),当x变动经过x0时,f′′(x)变号,则(x0,f(x0))为拐点。
Th3:(拐点的判别定理2)设f(x)在点x0的某邻域内有三阶导数,且f′′(x)=0,f′′′(x)=0,则(x0,f(x0))为拐点。
若f是凸函数
θ1,…,θk≥0,θ1+⋯+θk=1f(θ1x1+⋯+θkxk)≤θ1f(x1)+⋯+θkf(xk)
p(x)≥0 on S⊆domf,∫Sp(x)dx=1
f(∫Sp(x)xdx)≤∫Sf(x)p(x)dx
f(Ex)≤Ef(x)
弧微分
dS=1+y′2dx
曲率
曲线y=f(x)在点(x,y)处的曲率k=(1+y′)23∣y′′∣。 对于参数方程{x=φ(t)y=ψ(t),k=[φ′2(t)+ψ2(t)]23∣φ′(t)ψ′′(t)−φ′′(t)ψ′(t)∣
曲率半径
曲线在点M处的曲率k(k=0)与曲线在点M处的曲率半径ρ有如下关系:ρ=k1
微分应用
1, 已知函数f(x)=x^x,x>0,求f(x)的最小值
t(x)=xx⇒lnt=xlnx
两边对x求导 t1t′=lnx+1
令t′=0, lnx+1=0
⇒x=e−1⇒t=e−e1
积分应用
N→∞⇒lnN!→N(lnN−1)
lnN!=∑i=1Nlni≈∫1Nlnxdx=xlnx∣1N−∫1Nxdlnx=NlnN−∫1Nx⋅x1dx=NlnN−x∣1N=NlnN−N+1→NlnN−N
最优化
机器学习 = 模型 + 策略 + 算法
可以看得出,算法在机器学习中的 重要性。实际上,这里的算法指的就是优化算法.
最优化问题的数学描述
最优化的基本数学模型如下:
minf(x)
s.t. hi(x)=0gj(x)⩽0
它有三个基本要素,即:
- 设计变量:x是一个实数域范围内的n维向量,被称为决策变量或问题的解;
- 目标函数:f(x)为目标函数;
- 约束条件:hi(x)=0称为等式约束,gj(x)≤0为不等式约束,i=0,1,2,…
凸集与凸集分离定理
实数域R上(或复数C上)的向量空间中,如果集合S中任两点的连线上的点都在S内,则称集合S为凸集,如下图所示:
数学定义为:
设集合D⊂Rn,若对于任意两点x,y∈D,及实数λ(0≤λ≤1)都有:λx+(1−λ) y∈D则称集合D为凸集。
2、超平面和半空间
实际上,二维空间的超平面就是一条线(可以使曲线),三维空间的超平面就是一个面(可以是曲面)。其数学表达式如下:
超平面:H={x∈Rn∣a1+a2+…+an=b}
半空间:H+={x∈Rn∣a1+a2+…+an≥b}
3、凸集分离定理
所谓两个凸集分离,直观地看是指两个凸集合没有交叉和重合的部分,因此可以用一张超平面将两者隔在两边,如下图所示:

4、凸函数
凸函数就是一个定义域在某个向量空间的凸子集C上的实值函数。

数学定义为:
对于函数f(x),如果其定义域C是凸的,且对于∀x,y∈C,\0 \leq \alpha \leq 1$$,有:
f(θx+(1−θ)y)≤θf(x)+(1−θ)f(y)
则f(x)是凸函数。
**注:**如果一个函数是凸函数,则其局部最优点就是它的全局最优点。这个性质在机器学习算法优化中有很重要的应用,因为机器学习模型最后就是在求某个函数的全局最优点,一旦证明该函数(机器学习里面叫“损失函数”)是凸函数,那相当于我们只用求它的局部最优点了。