AI 参与0%

概率论基础

就是这篇,我把公式写的炉火纯青了。

目录

1基本概念

1.1随机事件

随机试验三要素:

  1. 可在同等条件下重复;
  2. 结果是可被事先预测的多种可能;
  3. 试验前结果不确定.

1.2样本空间

样本空间(Sample Space) :随机试验 EE 的所有可能结果的集合,记作Ω={ω}\Omega = \{ \omega \}.

样本点(Sample Point) :一个样本空间众多的每个元素.

  • 样本空间中样本点的个数为有限个或可列个的情况为离散样本空间(Discrete Sample Space) ;
  • 样本空间中样本点的个数为不可列无限个的情况为连续样本空间(Continuous Sample Space) ;

1.3事件运算

事件(Event) :某些基本事件构成的集合.为样本空间的子集.

德摩根定律(De Morgan’s Laws) :

  • A∪B‾=A‾∩B‾\overline{A \cup B} = \overline{A} \cap \overline{B};
  • A∩B‾=A‾∪B‾\overline{A \cap B} = \overline{A} \cup \overline{B};
  • ∪i=1nAi‾=∩i=1nAi‾\overline{ \cup_{i=1}^{n} A_i} = \cap_{i=1}^{n} \overline{A_i};
  • ∩i=1nAi‾=∪i=1nAi‾\overline{ \cap_{i=1}^{n} A_i} = \cup_{i=1}^{n} \overline{A_i} (n→+∞n \rightarrow + \infty也成立) .

1.4概率

古典概型(Classical Probability) :样本空间 SS 中有有限个等可能的两两互不相容的基本事件,个数记为#{S}\# \{ S \},事件 AA 发生的概率为P(A)=#{A}#{S}P(A) = \frac{\# \{ A \} }{\# \{ S \} }.

例:

  • 有重复的排列:
    • nn 个不同小球有放回取出rr次: nrn^r;
    • nn 个不同小球有放回放入rr个格子: rnr^n;
  • 有重复的组合:
    • nn 个相同小球放入 rr 个格子(可空) : Cn+r−1nC_{n+r-1}^{n};
    • nn 个相同小球放入 rr 个格子(不可空) : Cn−1r−1C_{n-1}^{r-1}.

几何概型(Geometric Probability) : P(Ag)=g的测度Ω的测度P(Ag) = \frac{g的测度}{\Omega的测度}.

频率(Frequency)的性质:

  1. 0≤fn(A)≤10 \leq f_n (A) \leq 1;
  2. fn(S)=1f_n (S) = 1;
  3. 若A1,A2,...,AkA_1, A_2, ..., A_k两两互斥, f(A1∪A2∪Ak)=fn(A1)+fn(A2)+...+fn(Ak)f(A_1 \cup A_2 \cup A_k) = f_n (A_1) + f_n (A_2) + ... + f_n (A_k).

例:蒲丰投针

Buffon

压线概率: P=1/2∫0πlsin⁡(ϕ) dϕ1/2aπn=2lπaP = \frac{1/2 \int_0^{\pi} l \sin(\phi) ~ d \phi}{1/2 a \pi} n= \frac{2l}{\pi a}.

事件 σ\sigma 域: F\mathcal{F}是由样本空间 Ω\Omega 的子集组成的集类,满足:

  1. Ω∈F\Omega \in \mathcal{F};
  2. 若A∈FA \in \mathcal{F},则A‾∈F\overline{A} \in \mathcal{F} ( “取补” 运算封闭) ;
  3. 若An∈FA_n \in \mathcal{F}, n=1,2,...n = 1, 2, ...,则∪n=1∞An∈F\cup_{n = 1}^{\infty} A_n \in \mathcal{F} ( “可列并” 运算封闭) .

则称 F\mathcal{F} 是 σ\sigma 域, F\mathcal{F}中的元素为事件.

一维Borel σ\sigma域:在全体实数 R1\mathbb{R}^1 中,由一切形为 [a,b)[a, b) 的有界左闭右开区间构成的集类所产生的 σ\sigma 域.记之为B1\mathcal{B}_1. B1\mathcal{B}_1中的集合为一维Borel点集. B1\mathcal{B}_1 包括了实数中(大概)所有感兴趣的集.

概率(Probability) :设 Ω\Omega 为一个样本空间, F\mathcal{F}为的某些子集组成的一个事件 σ\sigma 域.如果对任一事件A∈FA \in \mathcal{F},定义在 F\mathcal{F} 上的一个实值函数 P(A)P(A) 满足:

  1. 非负性: P(A)≥0,∀A∈FP(A) \geq 0, \forall A \in \mathcal{F};
  2. 规范性: P(Ω)=1P(\Omega) = 1;
  3. 可列可加性: Ai∈FA_i \in \mathcal{F}, i=1,2,...i = 1, 2, ...且两两互不相容,则P(A1+A2+...)=P(A1)+P(A2)+...P(A_1 + A_2 + ...) = P(A_1) + P(A_2) + ... ;

则称 P(A)P(A) 为事件 AA 的概率,称三元总体 (Ω,F,P)(\Omega, \mathcal{F}, \mathcal{P}) 为概率空间(Probability Space) . 所以概率PP是个集合函数,定义域为F\mathcal{F},值域为[0,1][0, 1].

概率的性质:

  1. P(∅)=0P(\emptyset) = 0 (由可列可加性) ;
  2. 有限可加性: P(A1+A2+...+An)=P(A1)+P(A2)+...P(An)P(A_1 + A_2 + ... + A_n) = P(A_1) + P(A_2) + ... P(A_n) (由可列可加性及性质1) ;
  3. P(A‾)=1−P(A)P(\overline{A}) = 1 - P(A);
  4. ∀A,B∈F\forall A, B \in \mathcal{F}, P(A−B)=P(A)−P(AB)P(A - B) = P(A) - P(AB);
  5. 若A⊂BA \subset B,则P(B−A)=P(B)−P(A)P(B - A) = P(B) - P(A);
  6. P(A∪B)=P(A)+P(B)−P(A∩B)P(A \cup B) = P(A) + P(B) - P(A \cap B);
  7. 容斥原理:
P(∪i=1nEi)=∑i=1nP(Ei)−∑i1<i2P(Ei1Ei2)+...+(−1)nP(E1E2...En).\begin{aligned} P(\cup_{i = 1}^{n}E_i) = &\sum_{i = 1}^{n} P(E_i) - \sum_{i_1 < i_2} P(E_{i_1}E_{i_2}) \\ &+ ... +(-1)^n P(E_1E_2...E_n). \end{aligned}

推论:

  1. 若A⊂BA \subset B,则P(A)≤P(B)P(A) \leq P(B);
  2. 布尔不等式: P(A∪B)≤P(A)+P(B)P(A \cup B) \leq P(A) + P(B);
  3. Bonferroni不等式: P(AB)≥P(A)+P(B)−1P(AB) \geq P(A) + P(B) - 1.

2条件概率与统计独立性

2.1条件概率

设 (Ω,F,P)(\Omega, \mathcal{F}, \mathcal{P}) 是一个概率空间, B∈FB \in \mathcal{F},且P(B)>0P(B) > 0,则∀A∈F\forall A \in \mathcal{F},记P(A∣B)=P(AB)P(B)P(A|B) = \frac{P(AB)}{P(B)}. 称 P(A∣B)P(A|B) 为在事件 BB 发生的条件下的事件 AA 发生的条件概率.

乘法公式:

  • P(AB)=P(A)P(A∣B)P(AB) = P(A)P(A|B);
  • P(ABC)=P(A)P(A∣B)P(C∣AB)P(ABC) = P(A)P(A|B)P(C|AB).

性质:

  1. 概率的所有性质;
  2. 若BC=∅BC = \emptyset,则P(BC)=0P(BC) = 0;
  3. P(B∣B)=1P(B|B) = 1,若C⊂BC \subset B,则P(B∣C)=1P(B|C) = 1;
  4. 若B⊂CB \subset C,则P(B∣C)=P(B)P(C)P(B|C) = \frac{P(B)}{P(C)};
  5. P(B∣Ω)=1P(B| \Omega) = 1,若P(C)=1P(C) = 1,则P(B∣C)=1P(B|C) = 1 (利用补集来证明).

2.2事件独立

A,B∈FA, B \in \mathcal{F},若P(AB)=P(A)P(B)P(AB) = P(A)P(B),则AA, BB独立.

A,B,C∈FA, B, C \in \mathcal{F},若

  • P(AB)=P(A)P(B)P(AB) = P(A)P(B);
  • P(AC)=P(A)P(C)P(AC) = P(A)P(C);
  • P(BC)=P(B)P(C)P(BC) = P(B)P(C);
  • P(ABC)=P(A)P(B)P(C)P(ABC) = P(A)P(B)P(C),

则AA, BB, CC相互独立.

性质:

  1. 若AA, BB独立, P(B)>0⇔P(A∣B)=P(A)P(B) > 0 \Leftrightarrow P(A|B) = P(A);
  2. 若AA, BB独立, P(B)>0⇔P(A∣B)=P(A∣B‾)⇔P(A∣B)+P(A‾∣B‾)=1P(B) > 0 \Leftrightarrow P(A|B) = P(A| \overline{B}) \Leftrightarrow P(A|B) + P(\overline{A} | \overline{B}) = 1;
  3. 若AA, BB独立,则{A,B‾}\{A, \overline{B} \}, {A‾,B}\{ \overline{A}, B \}, {A‾,B‾}\{ \overline{A}, \overline{B} \}各组事件独立;
  4. Ω\Omega 和 ∅\emptyset 与任何事件独立.

2.3全概率公式

设事件 E1,E2,...E_1, E_2, ... 是样本空间 Ω\Omega 的一个分割(完备事件组) ,即EiE_i, i=1,2,...i = 1, 2, ...两两互斥且∪i=1∞Ei=Ω\cup_{i = 1}^{\infty}E_i = \Omega,则P(A)=∑i=1∞P(A∣Ei)P(Ei)P(A) = \sum_{i=1}^{\infty} P(A|E_i)P(E_i). 分解复杂问题分布考虑.

贝叶斯(Bayesian)公式:

P(Ei∣A)⏞后验概率=P(A∣Ei)P(Ei)⏞先验概率P(A)=P(A∣Ei)P(Ei)∑j=1∞P(A∣Ej)P(Ej).\overbrace{P(E_i | A)}^{后验概率} = \frac{P(A|E_i)\overbrace{P(E_i)}^{先验概率}}{P(A)} = \frac{P(A|E_i)P(E_i)}{\sum_{j=1}^{\infty} P(A|E_j)P(E_j)}.

3随机变量与分布函数

3.1随机变量(Random Variable)

3.1.1随机变量定义

函数 X(e)X(e) 可称为随机变量,若满足:

  1. X(e)X(e) 是定义在样本空间 Ω\Omega 的关于 F\mathcal{F} 的单值实函数;
  2. 对于每个实数xx,集合 {e:X(e)≤x}\{e: X(e) \leq x \} 是一个事件. X=X(e)X = X(e)使样本空间 Ω\Omega 中的每个基本事件 ee 在实数轴 R1=(−∞,+∞)\mathbb{R}^1 = (- \infty, + \infty) 上有一点 XX 与之对应.

根据样本空间中基本事件是否有限/可数将随机变量分为连续型随机变量和离散型随机变量.

3.1.2分布函数(Distribution Function)

设 XX 为一个随机变量, xx为任意实数,则函数

F(x)=P{X≤x},   −∞≤x≤+∞F(x) = P \{ X \leq x \}, ~~~ - \infty \leq x \leq + \infty

为随机变量 XX 的分布函数.

性质:

  1. 单调性:单调不减;
  2. 非负有界: F(x)∈[0,1]F(x) \in [0, 1],      lim⁡x→−∞F(x)=0\displaystyle \lim_{x \rightarrow - \infty} F(x) = 0,      lim⁡x→+∞F(x)=1\displaystyle \lim_{x \rightarrow + \infty} F(x) = 1;
  3. 连续性: F(x)F(x)右连续,即lim⁡h→0F(x+h)=F(x)\displaystyle \lim_{h \rightarrow 0} F(x + h) = F(x).

若函数满足三条性质,则该函数一定是某个随机变量的分布函数.

3.2离散型随机变量(Discrete R.V.)

3.2.1离散型随机变量的分布率(Probability Distribution)

设离散型随机变量XX,其可能值为xkx_k (k=1,2,...k = 1, 2, ...),则

P(X=xk)=Pk,   k=1,2,...P(X = x_k) = P_k, ~~~ k = 1, 2, ...

称为 XX 的分布率.

PkP_k 满足: Pk≥0P_k \geq 0 (非负性);      ∑k=1∞Pk=1\sum_{k = 1}^{\infty} P_k = 1 (归一性).

3.2.2离散型随机变量的分布函数

随机变量 XX 的分布律为P(X=xk)=PkP(X = x_k) = P_k, (k=1,2,...k = 1, 2, ...) ,其分布函数为

F(X)=P{X≤x}=∑xk<xpk.F(X) = P \{ X \leq x \}= \sum_{x_k < x} p_k.

3.2.3常见离散型随机变量分布函数

  1. 单点分布

    P{X=c}=1.P \{ X = c \} = 1.
  2. 两点分布(Bernoulli Distribution,伯努利分布)

    P{X=0}=1−p,P{X=1}=p.P \{ X = 0 \} = 1-p, \qquad P \{ X = 1 \} = p.
  3. 二项分布(Binomial Distribution)

    nn 次伯努利试验中事件发生 XX 次,则

    X∼Bin⁡(n,p),X \sim \operatorname{Bin}(n,p), P{X=k}=(nk)pkqn−k,k=0,1,…,n,q=1−p.P \{ X = k \} = \binom{n}{k}p^kq^{n-k}, \qquad k=0,1,\ldots,n, \qquad q=1-p.

    最大值:k=(n+1)pk=(n+1)p.

  4. 几何分布(Geometric Distribution)

    伯努利试验一直进行到第 XX 次时事件第一次发生,则

    P{X=k}=qk−1p.P \{ X = k \} = q^{k-1}p.

    几何分布具有无记忆性。

  5. 泊松分布(Poisson Distribution)

    X∼Poi⁡(λ),X \sim \operatorname{Poi}(\lambda), P{X=k}=λke−λk!.P \{ X = k \} = \frac{\lambda^k e^{-\lambda}}{k!}.

当 n→∞n \rightarrow \infty、p→0p \rightarrow 0 且 np=λnp=\lambda 时,二项分布的极限为泊松分布:

lim⁡n→∞(nk)pkqn−k=λke−λk!,np=λ.\lim_{n \rightarrow \infty} \binom{n}{k}p^kq^{n-k} = \frac{\lambda^k e^{-\lambda}}{k!}, \qquad np=\lambda.

无记忆性(Memorylessness):后面事件发生的概率与前面已经过的时间无关,即

P{X=m+k∣X>m}=P{X=k}.P \{ X = m+k \mid X > m \} = P \{ X = k \}.

在离散型随机变量 X∈Z∗X \in \mathbb{Z}^* 中,也可写为

P{X=k+1∣X>k}=P{X=1}.P \{ X = k+1 \mid X > k \} = P \{ X = 1 \}.

例:几何分布无记忆性的证明

令

ak=P{X=k},bk=P{X>k}.a_k=P \{ X=k \}, \qquad b_k=P \{ X>k \}.

则

p=P{X=k+1∣X>k}=ak+1bk,ak+1=bk−bk+1.p=P \{ X=k+1 \mid X>k \}=\frac{a_{k+1}}{b_k}, \qquad a_{k+1}=b_k-b_{k+1}.

因此

pbk=bk−bk+1,bk=(1−p)k−1b1=(1−p)k−1(1−a1).pb_k=b_k-b_{k+1}, \qquad b_k=(1-p)^{k-1}b_1=(1-p)^{k-1}(1-a_1).

进一步得到

ak+1=p(1−p)k−1(1−a1).a_{k+1}=p(1-p)^{k-1}(1-a_1).

令 k=0k=0,有

a1=p(1−p)−1(1−a1),a_1=p(1-p)^{-1}(1-a_1),

可得 a1=pa_1=p,即

P{X=k+1∣X>k}=P{X=1}.P \{ X=k+1 \mid X>k \}=P \{ X=1 \}.

得证。

3.3连续型随机变量(Continuous R.V.)

对于随机变量XX,若 ∀x∈R\forall x \in \mathbb{R} 存在一个非负可积的函数f(x)f(x),有F(x)=∫−∞xf(t)dtF(x) = \int_{- \infty}^{x}f(t)dt,则称 XX 是一个连续型随机变量; f(x)f(x)为 XX 的密度函数.

性质:

  1. 非负性: f(x)≥0f(x) \geq 0.
  2. 规范性: ∫−∞+∞f(x)dx=1\int_{- \infty}^{+ \infty} f(x) dx = 1.
  3. ∀x1≤x2\forall x_1 \leq x_2, P{x1<x≤x2}=F(x2)−F(x1)=∫x1x2f(x1)dxP \{ x_1 < x \leq x_2 \} = F(x_2) - F(x_1) = \int_{x_1}^{x_2} f(x_1)dx.
  4. 若 f(x)f(x) 在 x0x_0 连续,则F′(x)=f(x)F'(x) = f(x).

若函数 f(x)f(x) 满足以上四条性质,则该函数一定是某个随机变量的密度函数.

3.3.1常见连续型随机变量分布函数

  1. 均匀分布(Uniform Distribution)

    X∼U(a,b).X \sim U(a,b). f(x)={1b−a,a<x<b,0,otherwise.f(x)= \begin{cases} \dfrac{1}{b-a}, & a<x<b, \\ 0, & \text{otherwise}. \end{cases} F(x)={0,x<a,x−ab−a,a≤x<b,1,x≥b.F(x)= \begin{cases} 0, & x<a, \\ \dfrac{x-a}{b-a}, & a\leq x<b, \\ 1, & x\geq b. \end{cases}
  2. 指数分布(Exponential Distribution)

    X∼Exp⁡(λ).X \sim \operatorname{Exp}(\lambda). f(x)={λe−λx,x>0,0,otherwise.f(x)= \begin{cases} \lambda e^{-\lambda x}, & x>0, \\ 0, & \text{otherwise}. \end{cases} F(x)={0,x≤0,1−e−λx,x>0.F(x)= \begin{cases} 0, & x\leq 0, \\ 1-e^{-\lambda x}, & x>0. \end{cases}

    指数分布具有无记忆性:

    P{X>s+t∣X>s}=P{X>t}.P \{ X>s+t \mid X>s \}=P \{ X>t \}.

    对于很小的 Δt\Delta t,也可写成

    P{t<X≤t+Δt∣X>t}=λΔt+o(Δt).P \{ t<X\leq t+\Delta t \mid X>t \} =\lambda\Delta t+o(\Delta t).

例:指数分布无记忆性的证明

由条件概率得

F(t+Δt)−F(t)1−F(t)=λΔt+o(Δt).\frac{F(t+\Delta t)-F(t)}{1-F(t)} =\lambda\Delta t+o(\Delta t).

整理为

F(t+Δt)−F(t)Δt=(λ+o(Δt)Δt)(1−F(t)).\frac{F(t+\Delta t)-F(t)}{\Delta t} =\left(\lambda+\frac{o(\Delta t)}{\Delta t}\right)(1-F(t)).

令 Δt→0\Delta t\rightarrow 0,则

dF(t)dt=λ(1−F(t)).\frac{dF(t)}{dt}=\lambda(1-F(t)).

分离变量并积分:

dF(t)1−F(t)=λ dt,−ln⁡(1−F(t))=λt+c.\frac{dF(t)}{1-F(t)}=\lambda\,dt, \qquad -\ln(1-F(t))=\lambda t+c.

因为 F(0)=0F(0)=0,所以 c=0c=0,最终得到

F(t)=1−e−λt.F(t)=1-e^{-\lambda t}.
  1. 正态分布(Gaussian Distribution)

    X∼N(μ,σ2).X \sim N(\mu,\sigma^2). f(x)=12πσexp⁡(−(x−μ)22σ2).f(x)=\frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right).

    性质:

    • 关于 x=μx=\mu 对称。

    • 密度函数的最大值为

      max⁡f(x)=f(μ)=12πσ.\max f(x)=f(\mu)=\frac{1}{\sqrt{2\pi}\sigma}.
    • 两个拐点为x=μ±σx=\mu\pm\sigma.

  2. 标准正态分布

    将正态分布标准化:

    Z=X−μσ∼N(0,1).Z=\frac{X-\mu}{\sigma}\sim N(0,1).

    其密度函数为

    ϕ(x)=12πe−x2/2.\phi(x)=\frac{1}{\sqrt{2\pi}}e^{-x^2/2}.

    性质:

    • Φ(−x)=1−Φ(x)\Phi(-x)=1-\Phi(x).

    • 当 x>0x>0 时,

      P{∣Z∣≤x}=2Φ(x)−1.P \{ |Z|\leq x \}=2\Phi(x)-1.
    • 若 zαz_\alpha 表示上侧 α\alpha 分位点,即

      P{Z>zα}=α,P \{ Z>z_\alpha \}=\alpha,

      则由对称性有

      z1−α=−zα.z_{1-\alpha}=-z_\alpha.

4随机向量,随机变量的独立性

4.1随机向量及分布函数

4.1.1随机向量

若随机变量 ξ1(ω),ξ2(ω),...,ξn(ω)\xi_1 ( \omega ), \xi_2 ( \omega ), ..., \xi_n( \omega ) 定义在同一概率空间 (Ω,F,P)( \Omega, \mathcal{F}, \mathcal{P} ) 上,则称

ξ⃗(ω)=(ξ1(ω),ξ2(ω),...,ξn(ω))\vec{\xi} (\omega) = \big( \xi_1 ( \omega ), \xi_2 ( \omega ), ..., \xi_n( \omega ) \big)

构成一个 nn 维随机向(变)量.

4.1.2 (联合)分布函数(Joint C.D.F)

ξ⃗(ω)∼F(x1,x2,...,xn)=P{ξ1(ω)≤x1,...,ξn(ω)≤xn}.\vec{\xi} (\omega) \sim F (x_1, x_2, ..., x_n) = P \{ \xi_1 ( \omega ) \leq x_1, ..., \xi_n ( \omega ) \leq x_n \}.

其中: F:Rn↦[0,1]F: \mathbb{R}^n \mapsto [0, 1]; {ω:ξi(ω)≤xi, i=1,2,...,n}∈F\{ \omega: \xi_i (\omega) \leq x_i, ~ i = 1, 2, ..., n \} \in \mathcal{F}; ∩i=1n{ξn−1(xi)}∈Borel Rn\cap_{i = 1}^n \{ \xi_n^{-1} (x_i) \} \in Borel ~ \mathbb{R}^n.

性质:

  1. F(x⃗)F(\vec{x}) 右连续;
  2. lim⁡xi→−∞F(x1,...,xn)=0\displaystyle \lim_{x_i \to - \infty} F(x_1, ..., x_n) = 0; ( ∵ ∀ i∈{1,2,...,n}, ∩j=1n{ξj≤xj}⊂{ξi≤xi}\because ~ \forall ~ i \in \{ 1, 2, ..., n \}, ~ \cap_{j = 1}^n \{ \xi_j \leq x_j \} \subset \{ \xi_i \leq x_i \},且lim⁡xi→−∞F(xi)=0\displaystyle \lim_{x_i \to - \infty} F(x_i) = 0 )
  3. lim⁡xi→+∞F(x1,...,xn)=Fn−1(x1,...,xi−1,xi+1,...xn)\displaystyle \lim_{x_i \to + \infty} F(x_1, ..., x_n) = F_{n-1} (x_1, ..., x_{i-1}, x_{i+1}, ...x_n). 即 (ξ1,...,ξi−1,ξi+1,...,ξn)(\xi_1, ..., \xi_{i-1}, \xi_{i+1}, ..., \xi_n) 的C.D.F. 特别地ξi∼Fi(xi)=lim⁡xj→+∞F(x1,...,xi,...,xn), j≠i\xi_i \sim F_i (x_i) = \displaystyle \lim_{x_j \to + \infty} F(x_1, ..., x_i, ..., x_n), ~ j \neq i, ;称为它的边际(Marginal)分布.
  4. 单调性:关于每个分量单调不减. 一元: ∀ x1<x2, P(x1<ξ≤x2)=F(x2)−F(x1)>0\forall ~ x_1 < x_2, ~ P(x_1 < \xi \leq x_2) = F(x_2) - F(x_1) > 0; 二元: ∀ x1′<x1, x2′<x2\forall ~ x_1' < x_1, ~ x_2' < x_2,
P(x1′<ξ1≤x1, x2′<ξ2≤x2)=F(x1,x2)−F(x1′,x2)−F(x1,x2′)+F(x1′,x2′).\begin{aligned} P(x_1' < \xi_1 \leq x_1, ~ x_2' < \xi_2 \leq x_2) = {}& F(x_1, x_2) - F(x_1', x_2) \\ &- F(x_1, x_2') + F(x_1', x_2'). \end{aligned}

nn 元: ∀ x1′<x1,..., xn′<xn\forall ~ x_1' < x_1, ..., ~ x_n' < x_n,

P(x1′<ξ1≤x1,..., xn′<ξn≤xn)=F(x1,...,xn)−∑F(含有1个’的)+∑F(含有2个’的)+...+(−1)n∑F(含有n个’的).\begin{aligned} P(x_1' < \xi_1 \leq x_1, ..., ~ x_n' < \xi_n \leq x_n) = {}& F(x_1, ..., x_n) - \sum F(\text{含有1个'}的) \\ &+ \sum F(\text{含有2个'}的) + ... \\ &+(-1)^n \sum F(\text{含有n个'}的). \end{aligned}

满足以上四条性质的函数必是某随机变量的分布函数.

4.2常见的多元随机变量

4.2.1离散型

  1. 多项分布: (Multinomial Distribution) nn次试验中AiA_i发生nin_i次, i=1,...,ri = 1, ..., r,即一次试验结果有 rr 种情况. P(Ai)=piP(A_i) = p_i, n=∑i=1rnin = \sum_{i = 1}^r n_i, ∑i=1rpi=1\sum_{i = 1}^r p_i = 1,
P{ξ1=n1,..., ξr=nr}=n!n1!...nr!p1n1...prnr.P \{ \xi_1 = n_1, ..., ~\xi_r = n_r \} = \frac{n!}{n_1!...n_r!} p_1^{n_1}...p_r^{n_r}.
  1. 超几何分布: (Hypergeometric Distribution) 袋中共有 NN 只球,第 ii 种球有 NiN_i 只,共取出 nn 只球,第 ii 种球取出了 nin_i 只. N=∑i=1rNiN = \sum_{i = 1}^r N_i, n=∑i=1rnin = \sum_{i = 1}^r n_i, i=1,...,ri = 1, ..., r,即共有 ii 种球.
P{ξ1=n1,..., ξr=nr}=(Nn)(N1n1)(N2n2)...(Nrnr).P \{ \xi_1 = n_1, ..., ~\xi_r = n_r \} = \frac{N \choose n}{ {N_1 \choose n_1} {N_2 \choose n_2}... {N_r \choose n_r} }.

4.2.2连续型

连续型随机变量密度函数 p(x1,...,xn)p(x_1, ..., x_n) 的定义:存在非负函数 p(x1,...,xn)p(x_1, ..., x_n) 使得

F(x1,...,xn)=∫−∞x1...∫−∞xnp(y1,...,yn) dy1...dyn.F(x_1, ..., x_n) = \int_{- \infty}^{x_1} ... \int_{- \infty}^{x_n} p(y_1, ..., y_n) ~ dy_1...dy_n.
  1. 均匀分布: (Uniform Distribution) x⃗∼N(μ⃗,Σ)\vec{x} \sim N(\vec{\mu}, \Sigma) 有限可测区域G∈RnG \in \mathbb{R}^n,其测度为SS.
p(x1,x2,...,xn)={1S,(x1,x2,...,xn)∈G,0,(x1,x2,...,xn)∉G.p(x_1, x_2, ..., x_n) = \begin{cases} \frac{1}{S}, & (x_1, x_2, ..., x_n) \in G, \\ 0, & (x_1, x_2, ..., x_n) \notin G. \end{cases}
  1. 多元正太分布: (Multivariate Normal Distribution)
p(x1,x2,...,xn)=p(x⃗)=1(2π)n2∣Σ∣12exp⁡{−12(x⃗−μ⃗)Σ−1(x⃗−μ⃗)}.p(x_1, x_2, ..., x_n) = p(\vec{x}) = \frac{1}{(2 \pi)^{\frac{n}{2}} |\Sigma|^{\frac{1}{2} } } \exp \left\{ - \frac{1}{2} (\vec{x} - \vec{\mu}) \Sigma^{-1} (\vec{x} - \vec{\mu}) \right\}.

其中μ⃗=(μ1,μ2,...,μn)\vec{\mu} = (\mu_1, \mu_2, ..., \mu_n), Σ=(σij)\Sigma = (\sigma_{ij})为 nn 阶正定对称矩阵.

  • n=1n = 1 时, μ∈R\mu \in \mathbb{R}, Σ=σ2>0\Sigma = \sigma^2 > 0;
  • n=2n = 2 时, (x,y)∼N(μ1,μ2,σ12,σ22,ρ)(x, y) \sim N(\mu_1, \mu_2, \sigma_1^2, \sigma_2^2, \rho),
μ⃗=(μ1,μ2),Σ=(σ12ρσ1σ2ρσ1σ2σ22).\vec{\mu} = (\mu_1, \mu_2), \qquad \Sigma = \begin{pmatrix} \sigma_1^2 & \rho \sigma_1 \sigma_2 \\\\ \rho \sigma_1 \sigma_2 & \sigma_2^2 \end{pmatrix}. p(x,y)=12πσ1σ21−ρ2⋅exp⁡{−12(1−ρ)2[(x−μ1)2σ12−2ρ(x−μ1)(y−μ2)σ1σ2+(y−μ2)2σ22]}.\begin{aligned} p(x, y) ={}& \frac{1}{2 \pi \sigma_1 \sigma_2 \sqrt{1 - \rho^2}} \\ &\cdot \exp \left\{ -\frac{1}{2(1 - \rho)^2} \left[ \frac{(x - \mu_1)^2}{\sigma_1^2} - 2 \rho \frac{(x - \mu_1)(y - \mu_2)}{\sigma_1 \sigma_2} + \frac{(y - \mu_2)^2}{\sigma_2^2} \right] \right\}. \end{aligned}

其典型分解为

p(x,y)=12πσ1exp⁡{−(x−μ1)22σ12}⋅12πσ21−ρ2exp⁡{−[y−(μ2+ρσ1σ2(x−μ1))]22σ22(1−ρ2)}.\begin{aligned} p(x, y) ={}& \frac{1}{\sqrt{2 \pi} \sigma_1} \exp \left\{- \frac{(x - \mu_1)^2}{2 \sigma_1^2}\right\} \\ &\cdot \frac{1}{\sqrt{2 \pi} \sigma_2 \sqrt{1 - \rho^2}} \exp \left\{ - \frac{ \left[ y - \left( \mu_2 + \rho \frac{\sigma_1}{\sigma_2} (x - \mu_1) \right) \right]^2 }{2 \sigma_2^2 (1 - \rho^2)} \right\}. \end{aligned}

4.3边际分布及条件分布(Conditional Distribution)

4.3.1边际分布

设多元随机变量x⃗∼F(x⃗)\vec{x} \sim F (\vec{x}),则 xjx_j 的边际分布为Fj(xj)=F(+∞,+∞,...,xj,...)F_j (x_j) = F (+ \infty, + \infty, ..., x_j, ...).

  • 离散型: n=2n = 2时, pij=P(x=xi,y=yj)p_{ij} = P(x = x_i, y = y_j), i,j=1,2,...i, j = 1, 2, .... xx 的边际分布为

    P(x=xi)=P(x=xi,∪j=1∞{y=yj})=∑j=1∞P(x=xi,y=yj)=∑j=1∞pij=pi..\begin{aligned} P(x = x_i) &= P(x = x_i, \cup_{j = 1}^{\infty} \{ y = y_j \}) \\ &= \sum_{j = 1}^{\infty} P(x = x_i, y = y_j) \\ &= \sum_{j = 1}^{\infty} p_{ij} = p_{i.}. \end{aligned}
  • 连续型:

    Ft(xt)=F(+∞,+∞,...,xt,...)=∫−∞xt[∫−∞+∞...∫−∞+∞f(y⃗) dy1dy2...dyt−1dyt+1...] dyt.\begin{aligned} F_t(x_t) &= F(+ \infty, + \infty, ..., x_t, ...) \\ &= \int_{- \infty}^{x_t} \left[ \int_{- \infty}^{+ \infty} ... \int_{- \infty}^{+ \infty} f(\vec{y}) ~ dy_1 dy_2 ... dy_{t-1} dy_{t+1} ... \right]~ dy_t. \end{aligned}
  • 混合型: eg. x∼N(0,1)x \sim N(0, 1),且

    y={−1,x<−1,x,−1≤x<1,1,x≥1.y = \begin{cases} -1, & x < -1, \\ x, & -1 \leq x < 1, \\ 1, & x \geq 1. \end{cases}

4.3.2条件分布

以二元条件分布为例F(x,y0)=P(X≤x ∣ Y=y0)F(x, y_0) = P(X \leq x ~ | ~ Y = y_0).

  • 离散型:

    P(x=xi ∣ y=yj)=P(x=xi,y=yi)P(y=yi)=pijp.j.P(x = x_{i} ~ | ~ y = y_{j}) = \frac{P(x = x_i, y = y_i)}{P(y = y_i)} = \frac{p_{ij}}{p_{.j}}.
  • 连续型:

    P(x≤X<x+△x ∣ y≤Y<y+△y)=P(x≤X<x+△x, y≤Y<y+△y)P(y≤Y<y+△y)=∫xx+△x∫yy+△yf(s,t) dtds∫−∞+∞∫yy+△yf(s,t) dtds.\begin{aligned} &P(x \leq X < x + \triangle x ~ | ~ y \leq Y < y + \triangle y) \\ ={}& \frac{P(x \leq X < x + \triangle x, ~ y \leq Y < y + \triangle y)}{P( y \leq Y < y + \triangle y)} \\ ={}& \frac{\int_x^{x + \triangle x} \int_{y}^{y + \triangle y} f(s, t) ~ dt ds}{\int_{- \infty}^{+ \infty} \int_{y}^{y + \triangle y} f(s, t) ~ dt ds}. \end{aligned} P(x ∣ y)=lim⁡△x→0△y→01△xP(x≤X<x+△x ∣ y≤Y<y+△y)=lim⁡△x→0△y→01△x△y∫xx+△x∫yy+△yf(s,t) dtds∫−∞+∞[1△y∫yy+△yf(s,t) dt]ds=f(x,y)∫−∞+∞f(s,y) ds=f(x,y)fy(y).\begin{aligned} P(x ~ | ~ y) &= \lim_{\substack{\triangle x \to 0 \\ \triangle y \to 0}} \frac{1}{\triangle x} P(x \leq X < x + \triangle x ~ | ~ y \leq Y < y + \triangle y) \\ &= \lim_{\substack{\triangle x \to 0 \\ \triangle y \to 0}} \frac{\frac{1}{\triangle x \triangle y} \int_x^{x + \triangle x} \int_{y}^{y + \triangle y} f(s, t) ~ dt ds}{\int_{- \infty}^{+ \infty} \left[ \frac{1}{\triangle y} \int_{y}^{y + \triangle y} f(s, t) ~ dt \right] ds} \\ &= \frac{f(x, y)}{\int_{- \infty}^{+ \infty} f(s, y) ~ ds} = \frac{f(x, y)}{f_y (y)}. \end{aligned}

若fy(y)=0f_{y}(y) = 0,则p(x ∣ y)=0p (x ~ | ~ y) = 0.

例:二元正态分布

设

(X,Y)∼N(μ1,μ2,σ12,σ22,ρ).(X,Y)\sim N(\mu_1,\mu_2,\sigma_1^2,\sigma_2^2,\rho).

其边际分布为

X∼N(μ1,σ12),Y∼N(μ2,σ22).X\sim N(\mu_1,\sigma_1^2), \qquad Y\sim N(\mu_2,\sigma_2^2).

条件分布为

Y∣X=x0∼N ⁣(μ2+ρσ2σ1(x0−μ1),σ22(1−ρ2)).Y\mid X=x_0 \sim N\!\left( \mu_2+\rho\frac{\sigma_2}{\sigma_1}(x_0-\mu_1), \sigma_2^2(1-\rho^2) \right).

当 ρ=0\rho=0(即 XX 与 YY 独立)时,上述条件分布即为 YY 的边际分布。

4.4随机变量的独立性

对于 R\mathbb{R} 上的任意Borel集AA, BB…

P(X∈A,Y∈B,...)=P(X∈A)P(Y∈B)...,P(X \in A, Y \in B, ...) = P(X \in A) P(Y \in B) ...,

则称AA, BB… 独立. 特别地, A=(−∞,x]A = (- \infty , x], B=(−∞,y]B = (- \infty , y]… 时,

P(X≤x,Y≤y,...)=P(X≤x)P(Y≤y)....P(X \leq x, Y \leq y, ...) = P(X \leq x) P(Y \leq y) ....

以两个变量为例,即 F(x,y)=Fx(x)Fy(y)F(x, y) = F_x (x) F_y (y) 对 ∀ x,y∈R\forall ~ x, y \in \mathbb{R} 成立. 即定义域中任意点满足:联合分布= ∏\prod边际分布.

  1. 离散型 (x1,x2,...xn)T(x_1, x_2, ... x_n)^T 对A1,...,AnA_1, ..., A_n, P(x1∈A1,...,xn∈An)=P(x1∈A1)...P(xn∈An)P(x_1 \in A_1, ... , x_n \in A_n) = P(x_1 \in A_1)... P(x_n \in A_n).
  2. 连续型
f(x1,...,xn)=∂nF(x1,...,xn)∂x1...∂xn=fx1(x1)...fxn(xn).f(x_1, ..., x_n) = \frac{\partial^n F(x_1, ..., x_n)}{\partial x_1 ... \partial x_n} = f_{x_1} (x_1)... f_{x_n} (x_n).

对于几乎处处 x⃗∈Rn\vec{x} \in \mathbb{R}^n 成立. eg.

f(s)={f(s0)+t,s=s0,f(s),s≠s0.f(s) = \begin{cases} f(s_0) + t, & s = s_0, \\ f(s), & s \neq s_0. \end{cases}
← 返回文章列表