自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

随机过程 I:随机系统、马尔可夫链与 Poisson 过程

  1. 01随机过程语言:状态、时间与路径
  2. 02离散时间 Markov 链:矩阵与多步概率
  3. 03状态分类与吸收链:首达、命中与停留时间
  4. 04平稳分布、周期性与遍历性
  5. 05连续时间 Markov 链:等待与生成矩阵
  6. 06Poisson 过程:从局部条件到计数分布
  7. 07更新过程:叠加、稀释与非指数间隔
  8. 08基础排队模型:M/M/1 与 Little 定律
  9. 09更新报酬与综合建模
  10. 10离散鞅直观:公平游戏与停止
正在加载课程章节内容
课程数学随机过程 I:随机系统、马尔可夫链与 Poisson 过程随机过程语言:状态、时间与路径

01 随机过程的语言:把随机变化写成一条时间线

一台设备每小时可能正常、降速或停机;一个账户每天可能增加、减少或保持余额;一个粒子每隔一秒向左或向右走一步。单独看某个时刻,这些都只是随机变量。可一旦把时刻排成顺序,问题就变了:今天的状态会不会影响明天?相隔很远的两个时刻还相关吗?我们观察到的这一条记录,和模型允许出现的其他记录有什么关系?

随机过程就是处理这条“随机时间线”的语言。本章先不急着套马尔可夫性质,而是把对象、索引、状态、样本路径和联合分布分开。后面谈离散时间链时,矩阵里的每一个元素都要回到这里的定义;如果这一步含糊,矩阵乘法很容易变成没有解释的算术。

一条过程包含哪些对象

设

(Ω,F,P) (\Omega,\mathcal F,\mathbb P)(Ω,F,P)

是概率空间,TTT 是索引集,SSS 是状态空间。状态空间还配有一族可测集合(σ\sigmaσ 代数)S\mathcal SS:有限或可数状态时取所有子集,实数状态时通常取 Borel 集。这样,询问“状态是否落在 AAA 中”就有明确的事件含义。一个随机过程写作

{Xt:t∈T}, \{X_t:t\in T\},{Xt​:t∈T},

其中对每个固定的 ttt,XtX_tXt​ 是从 Ω\OmegaΩ 到 SSS 的可测映射,即 A∈SA\in\mathcal SA∈S 时,{ω:Xt(ω)∈A}∈F\{\omega:X_t(\omega)\in A\}\in\mathcal F{ω:Xt​(ω)∈A}∈F;我们仍称它为随机变量。换句话说,随机结果 ω\omegaω 一旦确定,所有时刻的取值就同时确定了:

t⟼Xt(ω). t\longmapsto X_t(\omega).t⟼Xt​(ω).

这条确定的函数称为一条样本路径。

这里有两个容易混在一起的“变量”。固定 ttt,XtX_tXt​ 随随机结果变化,是随机变量;固定 ω\omegaω,Xt(ω)X_t(\omega)Xt​(ω) 随时间变化,是一条普通函数。随机过程不是“一个随机变量加上一个时间标签”,而是一族彼此可能相关的随机变量。

四个等可能结果按行组成路径,固定时间按列读取随机变量

把一个很小的模型摆在图里会更清楚:四个样本结果等可能,每行记录一条路径。沿着某一行向右读,你没有换样本结果;固定标作 n=2n=2n=2 的那一列向下读,才是在比较 X2X_2X2​ 的不同可能取值。图中 X2X_2X2​ 取 0、1 各占两行,所以各有 1/21/21/2 的概率。若四行并非等可能,就必须按各行的概率加权,不能直接数行数。

索引集决定“什么时候观察”

常见索引集有两类:

  • 离散时间:T={0,1,2,…}T=\{0,1,2,\ldots\}T={0,1,2,…} 或有限的整数集合。XnX_nXn​ 可以表示第 nnn 次交易、第 nnn 天或第 nnn 步后的状态。
  • 连续时间:T=[0,∞)T=[0,\infty)T=[0,∞)。XtX_tXt​ 可以表示任意时刻的设备状态、队列人数或粒子位置。

索引集不是状态空间。n=4n=4n=4 是时刻,X4=2X_4=2X4​=2 才是状态;“第四天处于状态 2”同时使用了这两个层次。状态空间也不一定是数字集,例如 S={正常,降速,停机}S=\{\text{正常},\text{降速},\text{停机}\}S={正常,降速,停机}。为了计算,常把这些状态编号,但编号本身没有概率意义。

左侧只在离散时刻记录状态,右侧展示一条连续时间路径的示意

图左只在选定时刻给出取值;图右画出时间连续变化的一种路径。右图中的光滑曲线只是例子:连续时间描述的是索引集,绝不保证路径连续,计数过程就可以在事件发生时跳跃。淡色线条不表示置信区间。

离散时间适合记录“每一步发生了什么”;连续时间适合记录“事件在什么时候发生”。同一个系统可以有两种建模:只看每天收盘状态是离散时间过程,记录每次故障和修复的确切时刻则可能是连续时间过程。选哪一种,要看问题需要保留的时间信息。

状态空间也决定问题的形状

状态空间可以是有限集、可数集,也可以是实数的一部分。有限状态过程适合用转移矩阵组织;实值过程常需要讨论密度、协方差函数或路径的连续性。不要因为两个过程都写成 XtX_tXt​,就假定它们能用同一种工具处理。

例如,令 YnY_nYn​ 表示第 nnn 天库存量,S={0,1,…,50}S=\{0,1,\ldots,50\}S={0,1,…,50}。令 ZnZ_nZn​ 表示第 nnn 天的温度,S=RS=\mathbb RS=R。它们都可以是离散时间过程,但第一个适合研究“何时缺货”,第二个可能更自然地研究均值、波动和相关性。

从路径回到分布

给定 ttt,随机变量 XtX_tXt​ 的分布回答“这个时刻可能在哪些状态”;而有限维分布回答“多个指定时刻的状态怎样联合出现”。对时刻 t1,…,tkt_1,\ldots,t_kt1​,…,tk​,有限维分布由所有可测集合 A1,…,AkA_1,\ldots,A_kA1​,…,Ak​ 对应的下列概率描述

P(Xt1∈A1,…,Xtk∈Ak). \mathbb P(X_{t_1}\in A_1,\ldots,X_{t_k}\in A_k).P(Xt1​​∈A1​,…,Xtk​​∈Ak​).

离散状态时可以写成点概率

P(Xt1=x1,…,Xtk=xk). \mathbb P(X_{t_1}=x_1,\ldots,X_{t_k}=x_k).P(Xt1​​=x1​,…,Xtk​​=xk​).

只知道每个 XtX_tXt​ 的边缘分布,通常不能确定过程。例如只抛一次公平硬币,记结果为 B∈{0,1}B\in\{0,1\}B∈{0,1}。模型 A 规定所有 nnn 都有 Xn=BX_n=BXn​=B;模型 B 规定偶数时刻 Yn=BY_n=BYn​=B,奇数时刻 Yn=1−BY_n=1-BYn​=1−B。每个固定时刻,两者都以 1/21/21/2 的概率取 0 或 1。可是模型 A 的路径永远不变,模型 B 的路径每步翻转,分别满足 P(X1=X0)=1\mathbb P(X_1=X_0)=1P(X1​=X0​)=1 与 P(Y1=Y0)=0\mathbb P(Y_1=Y_0)=0P(Y1​=Y0​)=0。

常值路径与交替路径有相同边缘分布,却有不同联合分布

因此,研究随机系统时,边缘分布只能告诉你“某一帧长什么样”,联合分布还要告诉你“帧与帧怎样接起来”。马尔可夫性质正是在联合分布层面提出一种特殊但非常有用的限制:给定现在,过去对未来不再提供额外信息。

条件概率是连接时间的桥

对离散状态,只在给定历史事件的概率为正时,才直接使用下面的比值型条件概率:

P(Xn+1=y∣X0=x0,…,Xn=xn). \mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n).P(Xn+1​=y∣X0​=x0​,…,Xn​=xn​).

条件中指定了当前和历史,它描述的是已知这些信息以后的预测;数值可能高于、低于或等于无条件概率。若过程具有马尔可夫性质,这个概率将只依赖当前状态 xnx_nxn​:

P(Xn+1=y∣X0=x0,…,Xn=xn)=P(Xn+1=y∣Xn=xn). \mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n) =\mathbb P(X_{n+1}=y\mid X_n=x_n).P(Xn+1​=y∣X0​=x0​,…,Xn​=xn​)=P(Xn+1​=y∣Xn​=xn​).

这个等式要求对所有正概率的历史都成立。把当前状态告诉我们以后,额外再告诉过去,下一步的条件分布没有改变;它没有宣称未来和过去无条件独立。概率为零的历史不能直接代入概率之比,在一般状态空间中应改用几乎处处成立的条件分布表述。

还要留意时刻 nnn:马尔可夫性允许今天和明天采用不同的转移规则。若从 xxx 到 yyy 的一步条件概率另外还不依赖 nnn,才称为时间齐次。后面的天气模型会同时作这两项假设。

两段不同历史结束于同一状态,马尔可夫模型给出相同的一步条件分布

“马尔可夫”不是“每个时刻都独立”。例如随机游走的相邻状态通常明显相关,但给定当前位置后,下一步不需要知道更早的路径。独立性比马尔可夫性强得多;把两者混为一谈,会错误地删掉条件概率中的当前状态。

过滤:在时刻 n 能知道什么

为了把“过去”写成一个对象,定义自然过滤

Fn=σ(X0,X1,…,Xn). \mathcal F_n=\sigma(X_0,X_1,\ldots,X_n).Fn​=σ(X0​,X1​,…,Xn​).

它表示只观察到 000 到 nnn 时刻的全部信息。随着时间增加,信息不会减少:

F0⊆F1⊆F2⊆⋯ . \mathcal F_0\subseteq\mathcal F_1\subseteq\mathcal F_2\subseteq\cdots.F0​⊆F1​⊆F2​⊆⋯.

若一个量在时刻 nnn 可以由这段历史确定,就说它对 Fn\mathcal F_nFn​ 可测。直观地说,不能用“明天才知道的硬币结果”来决定今天的下注规则。

以两次独立抛公平硬币为例,结果记作 HHH 或 TTT,样本空间为 {HH,HT,TH,TT}\{HH,HT,TH,TT\}{HH,HT,TH,TT}。抛之前,四种结果还无法区分;第一次见到 HHH,能确定结果属于 {HH,HT}\{HH,HT\}{HH,HT},却不能判断第二次是否为 HHH;第二次也看到以后,才能区分四个单独的结果。信息增加时,可区分的组变细,相应的事件集合反而增多。自然过滤记录的是整段已见历史,通常不同于只保留当前状态的 σ(Xn)\sigma(X_n)σ(Xn​)。

两次抛硬币逐步细分样本空间,信息对应的σ代数逐步增加

若未来的实值量 YYY 满足 E∣Y∣<∞\mathbb E|Y|<\inftyE∣Y∣<∞,E[Y∣Fn]\mathbb E[Y\mid\mathcal F_n]E[Y∣Fn​] 表示已知历史后的条件均值。在有限模型里,做法就是把与眼前历史相容的结果收在一起,用条件概率加权求平均。例如看到第一次为 HHH 后,第二次为 HHH 的指标变量仍以各 1/21/21/2 的概率取 0 和 1,条件均值是 1/21/21/2;两次都看到以后,这个指标本身已知,条件均值就是已见到的 0 或 1。

马尔可夫性也可以通过这些条件均值表达。对每个有界可测函数 g:S→Rg:S\to\mathbb Rg:S→R,有

E[g(Xn+1)∣Fn]=E[g(Xn+1)∣Xn]几乎处处. \mathbb E[g(X_{n+1})\mid\mathcal F_n] =\mathbb E[g(X_{n+1})\mid X_n] \quad\text{几乎处处}.E[g(Xn+1​)∣Fn​]=E[g(Xn+1​)∣Xn​]几乎处处.

取 g(x)=1{x∈A}g(x)=\mathbf 1_{\{x\in A\}}g(x)=1{x∈A}​,条件均值就变成下一步落入 AAA 的条件概率。对有限状态,这个等式也能直接验证:把每个下一步状态 yyy 的 g(y)g(y)g(y) 乘上条件概率,再求和;马尔可夫性让和式中的概率只通过 XnX_nXn​ 依赖历史。若用不受限的 ggg,还需检查 E∣g(Xn+1)∣<∞\mathbb E|g(X_{n+1})|<\inftyE∣g(Xn+1​)∣<∞,不能对任意函数不加条件地取期望。

一个完整的小模型:带记忆的天气记录

设 Xn∈{S,R}X_n\in\{S,R\}Xn​∈{S,R} 表示第 nnn 天的天气,SSS 为晴,RRR 为雨。初始日明确记作第 0 天,P(X0=S)=0.6\mathbb P(X_0=S)=0.6P(X0​=S)=0.6。假设天气满足时间齐次的马尔可夫模型:今天晴时,明天晴的概率是 0.80.80.8;今天雨时,明天晴的概率是 0.40.40.4。另外两个去向由概率和为 1 得到,分别是晴后雨 0.20.20.2、雨后雨 0.60.60.6。

要算“第 1 天雨且第 2 天晴”,得先知道第 1 天的分布。第 1 天的雨可能来自初始的晴,也可能来自初始的雨。这两个事件互斥,合起来覆盖全部初始状态,所以

P(X1=R)=0.6×0.2+0.4×0.6=0.36,P(X1=S)=0.6×0.8+0.4×0.4=0.64.\begin{aligned} \mathbb P(X_1=R)&=0.6\times0.2+0.4\times0.6=0.36,\\ \mathbb P(X_1=S)&=0.6\times0.8+0.4\times0.4=0.64. \end{aligned}P(X1​=R)P(X1​=S)​=0.6×0.2+0.4×0.6=0.36,=0.6×0.8+0.4×0.4=0.64.​

两数相加为 1,第一步分布没有遗漏去向。现在才使用相邻两天的条件概率:

P(X1=R,X2=S)=P(X1=R)P(X2=S∣X1=R)=0.36×0.4=0.144.\begin{aligned} \mathbb P(X_1=R,X_2=S) &=\mathbb P(X_1=R)\mathbb P(X_2=S\mid X_1=R)\\ &=0.36\times0.4=0.144. \end{aligned}P(X1​=R,X2​=S)​=P(X1​=R)P(X2​=S∣X1​=R)=0.36×0.4=0.144.​

它小于 0.360.360.36,因为在第 1 天下雨之外又加上了一个要求。若有人得到 0.4×0.4=0.160.4\times0.4=0.160.4×0.4=0.16,就把初始第 0 天的雨概率,误当成了第 1 天的雨概率。

“第 2 天晴”允许第 1 天是晴或雨,需要把两个互斥的联合事件相加:

P(X2=S)=P(X1=S,X2=S)+P(X1=R,X2=S)=0.64×0.8+0.36×0.4=0.512+0.144=0.656.\begin{aligned} \mathbb P(X_2=S) &=\mathbb P(X_1=S,X_2=S)+\mathbb P(X_1=R,X_2=S)\\ &=0.64\times0.8+0.36\times0.4\\ &=0.512+0.144=0.656. \end{aligned}P(X2​=S)​=P(X1​=S,X2​=S)+P(X1​=R,X2​=S)=0.64×0.8+0.36×0.4=0.512+0.144=0.656.​

单条完整路径又是另一回事。例如初始就雨、随后仍雨、再转晴这条 R→R→SR\to R\to SR→R→S 路径,概率为 0.4×0.6×0.4=0.0960.4\times0.6\times0.4=0.0960.4×0.6×0.4=0.096。它只是上面 0.1440.1440.144 的一部分,另一部分是 S→R→SS\to R\to SS→R→S 的 0.0480.0480.048。沿路径相乘,合并互斥路径时相加,是下一章矩阵递推的出发点。

第1天两种天气分布向第2天分支,四条联合事件概率相加为1

把一般参数记为 q=P(X0=S)q=\mathbb P(X_0=S)q=P(X0​=S)、a=P(S∣S)a=\mathbb P(S\mid S)a=P(S∣S)、b=P(S∣R)b=\mathbb P(S\mid R)b=P(S∣R),那么

q1=qa+(1−q)b,q2=q1a+(1−q1)b.q_1=qa+(1-q)b,\qquad q_2=q_1a+(1-q_1)b.q1​=qa+(1−q)b,q2​=q1​a+(1−q1​)b.

下方实验同时显示完整路径与合并后的边缘概率。保留 q=0.6,b=0.4q=0.6,b=0.4q=0.6,b=0.4,只提高 aaa,观察 q2q_2q2​ 和事件 {X1=R,X2=S}\{X_1=R,X_2=S\}{X1​=R,X2​=S} 是否朝同一方向改变。不要急着用“晴更容易持续”代替计算:后一事件必须先经过雨,第 1 天雨的概率会随 aaa 减少,因此其概率 b(1−q1)b(1-q_1)b(1−q1​) 反而下降。

恢复默认值,选择 R→R→SR\to R\to SR→R→S,应读到 0.0960.0960.096。改为筛选所有“第 2 天晴”的路径,看加总如何得到 0.6560.6560.656;切换到“第 1 天雨且第 2 天晴”,剩下的两条路径则加总为 0.1440.1440.144。有限次模拟的频率可能偏离这些数,精确概率来自模型的加法与乘法规则。

期望、协方差与时间结构

以下只讨论实值过程,并假设每个时刻都有 E[Xt2]<∞\mathbb E[X_t^2]<\inftyE[Xt2​]<∞。有限二阶矩保证均值与协方差有定义。均值函数和协方差函数分别记录单时刻水平与跨时刻联动:

m(t)=E[Xt],C(s,t)=Cov⁡(Xs,Xt). m(t)=\mathbb E[X_t],\qquad C(s,t)=\operatorname{Cov}(X_s,X_t).m(t)=E[Xt​],C(s,t)=Cov(Xs​,Xt​).

对实值过程,C(s,t)=E[(Xs−m(s))(Xt−m(t))]C(s,t)=\mathbb E[(X_s-m(s))(X_t-m(t))]C(s,t)=E[(Xs​−m(s))(Xt​−m(t))]。协方差为正,表示一个时刻偏高时另一个时刻倾向偏高;为负则倾向相反。协方差为零只表示线性关系消失,一般不等于独立。

若均值不随时间改变,并且协方差只依赖滞后 hhh,即

m(t)=μ,C(s,t)=γ(t−s), m(t)=\mu,\qquad C(s,t)=\gamma(t-s),m(t)=μ,C(s,t)=γ(t−s),

连同有限二阶矩,这些条件定义了弱平稳过程。对离散时间,常写成 γ(h)=Cov⁡(Xn,Xn+h)\gamma(h)=\operatorname{Cov}(X_n,X_{n+h})γ(h)=Cov(Xn​,Xn+h​)。等式只在涉及的时刻都属于索引集时要求成立;在 N0\mathbb N_0N0​ 上使用负滞后时也要留意这一点。特别地,令 s=ts=ts=t 可知方差 C(t,t)=γ(0)C(t,t)=\gamma(0)C(t,t)=γ(0) 必须恒定。

这让“第 3 天到第 4 天”和“第 103 天到第 104 天”在均值、协方差意义下可比较,但不能由此推出所有联合分布在平移后相同。后一个要求叫严格平稳,比只检查二阶统计量涉及的信息多;严格平稳若没有有限二阶矩,也不能直接称为弱平稳。

随机游走展示路径与统计量的区别

令 ξ1,ξ2,…\xi_1,\xi_2,\ldotsξ1​,ξ2​,… 独立,且

P(ξk=1)=p,P(ξk=−1)=1−p, \mathbb P(\xi_k=1)=p,\qquad \mathbb P(\xi_k=-1)=1-p,P(ξk​=1)=p,P(ξk​=−1)=1−p,

定义

X0=0,Xn=∑k=1nξk. X_0=0,\qquad X_n=\sum_{k=1}^n\xi_k.X0​=0,Xn​=k=1∑n​ξk​.

一条路径可能是 0,1,2,1,0,1,…0,1,2,1,0,1,\ldots0,1,2,1,0,1,…,另一条可能是 0,−1,−2,−1,0,−1,…0,-1,-2,-1,0,-1,\ldots0,−1,−2,−1,0,−1,…。它们都是同一个模型的可能结果。期望和方差可以从一步增量算起:E[ξk]=2p−1\mathbb E[\xi_k]=2p-1E[ξk​]=2p−1,又因 ξk2=1\xi_k^2=1ξk2​=1,有 Var⁡(ξk)=1−(2p−1)2=4p(1−p)\operatorname{Var}(\xi_k)=1-(2p-1)^2=4p(1-p)Var(ξk​)=1−(2p−1)2=4p(1−p)。期望对有限和具有线性;不同增量独立,交叉协方差为零,所以和的方差等于各项方差之和。这给出

E[Xn]=n(2p−1),Var⁡(Xn)=4np(1−p), \mathbb E[X_n]=n(2p-1),\qquad \operatorname{Var}(X_n)=4np(1-p),E[Xn​]=n(2p−1),Var(Xn​)=4np(1−p),

这些量描述许多路径合在一起的统计规律。第 nnn 步的位置只能取 −n,−n+2,…,n-n,-n+2,\ldots,n−n,−n+2,…,n,不仅必须是整数,还要与 nnn 同奇偶。公平游走的均值始终是 0,但第 1 步不可能停在 0,说明均值曲线也未必是一条允许的路径。

相隔两时刻的协方差也能用同一个分解得到。若 m≤nm\le nm≤n,把 XnX_nXn​ 写成 Xm+(ξm+1+⋯+ξn)X_m+(\xi_{m+1}+\cdots+\xi_n)Xm​+(ξm+1​+⋯+ξn​)。括号里的未来增量与 XmX_mXm​ 独立,故

Cov⁡(Xm,Xn)=Var⁡(Xm)=4mp(1−p)=4p(1−p)min⁡(m,n).\begin{aligned} \operatorname{Cov}(X_m,X_n) &=\operatorname{Var}(X_m)\\ &=4mp(1-p)=4p(1-p)\min(m,n). \end{aligned}Cov(Xm​,Xn​)​=Var(Xm​)=4mp(1−p)=4p(1−p)min(m,n).​

当 0<p<10<p<10<p<1 时,方差随 nnn 增长,因此这个从 0 出发的随机游走不是弱平稳过程。取 p=1/2p=1/2p=1/2 也无济于事:均值恒为 0 只满足了一部分条件。反过来,增量序列本身的均值恒定,协方差在滞后 0 时为 4p(1−p)4p(1-p)4p(1−p)、非零滞后时为 0,倒是弱平稳的。状态过程与增量过程要分开检查。

从增量表示可以看出,Xn+1=Xn+ξn+1X_{n+1}=X_n+\xi_{n+1}Xn+1​=Xn​+ξn+1​。给定当前 XnX_nXn​,下一步只需知道新的增量;更早的增量已经被当前总和压缩进当前位置。这是马尔可夫建模的典型动机:寻找一个足够描述当前的状态,而不是把全部历史原样带入。

状态里漏掉了什么

面对一个新的随机变化问题,可以把下面几件事写出来:

  1. 观察单位是什么,是每次交易、每个小时,还是事件发生的连续时刻?这决定索引集。
  2. 预测对象是什么,是一个有限状态标签、计数,还是实数测量?这决定状态空间。
  3. 一条路径怎样产生?要说明初始状态和状态之间的随机规则,而不是只列出几个可能序列。
  4. 题目需要边缘分布、联合分布、条件概率,还是期望与协方差?不同问题调用的对象不同。
  5. 当前状态是否保留了预测未来所需的信息?若没有,必须扩充状态,例如把“当前库存”和“尚未到货的订单”一起作为状态。

一个好状态的标准不是“看起来简单”,而是“给定它以后,未来问题所需的信息已经足够”。状态过少会让所谓转移概率依赖更长历史;状态过多则增加计算负担。后面学习马尔可夫链,本质上就是在一个合适状态空间上系统利用这个判断。

来看一个与前面两状态天气模型不同的假设系统。今天晴,明天下雨的概率是 0.20.20.2;今天是连续下雨的第一天,明天继续下雨的概率是 0.30.30.3;若已经连雨至少两天,明天继续下雨的概率是 0.80.80.8。这些是模型设定,用来检验状态选择,不是现实天气的经验定律。

取 X0=SX_0=SX0​=S,比较到第 2 天的两段正概率历史 S,S,RS,S,RS,S,R 与 S,R,RS,R,RS,R,R。它们今天都为雨,前者却是首个雨天,后者已有两天雨,于是

P(X3=R∣X0=S,X1=S,X2=R)=0.3,P(X3=R∣X0=S,X1=R,X2=R)=0.8.\begin{aligned} \mathbb P(X_3=R\mid X_0=S,X_1=S,X_2=R)&=0.3,\\ \mathbb P(X_3=R\mid X_0=S,X_1=R,X_2=R)&=0.8. \end{aligned}P(X3​=R∣X0​=S,X1​=S,X2​=R)P(X3​=R∣X0​=S,X1​=R,X2​=R)​=0.3,=0.8.​

若只保留 X2=RX_2=RX2​=R,两段历史就混在一起。任何一个单独的“雨后雨概率”都不可能同时等于 0.30.30.3 和 0.80.80.8,因此这个二状态记录不满足马尔可夫性。

不必把整段历史全带上。将状态改为 Zn∈{S,R1,R2+}Z_n\in\{S,R_1,R_{2+}\}Zn​∈{S,R1​,R2+​},分别表示晴、首个雨天、连雨至少两天,下一步规则就确定了:从 SSS 以 0.20.20.2 到 R1R_1R1​,否则留在 SSS;从 R1R_1R1​ 以 0.30.30.3 到 R2+R_{2+}R2+​,否则到 SSS;从 R2+R_{2+}R2+​ 以 0.80.80.8 留在 R2+R_{2+}R2+​,否则到 SSS。按设定,更长的连雨天数不会再改变概率,所以不必无限细分状态。

在实验里选这两段历史,比较下一天下雨的概率条。把“首日续雨”和“连日续雨”都设成 0.50.50.5,再观察扩充状态是否还给预测带来差别。在这个特定模型中,两类雨状态的下一步粗分类概率相同,晴雨标签已足够。恢复 0.30.30.3 与 0.80.80.8 后,调节两类雨天在混合记录中的比例:粗略的雨后雨概率随比例改变,却没有改变任何一类历史自己的转移规则。这说明在条件不足时,一个汇总数字会掩盖什么。

继续计算之前

随机过程把“随机”与“随时间变化”放在同一个对象里。固定时间看分布,固定结果看路径;多个时刻一起看联合分布;用过滤表示到某时刻为止可用的信息;用条件概率检验当前状态对未来是否足够。离散时间链的矩阵、首达事件和吸收时间,都只是沿着这条主线继续问得更具体。

自测与练习

1
固定一个样本结果 ω 后,t ↦ X_t(ω) 表示什么?
2
关于马尔可夫性质,下列哪些说法正确?
3
实值过程的均值恒定,就足以保证弱平稳。

巩固:识别对象与概率层次

  1. 某仓库每天记录库存量 InI_nIn​,其中 In∈{0,1,…,20}I_n\in\{0,1,\ldots,20\}In​∈{0,1,…,20}。请指出索引集、状态空间、I5=0I_5=0I5​=0 所描述的事件,并说明固定样本结果后得到的对象是什么。

索引集是离散时间集合 {0,1,2,…}\{0,1,2,\ldots\}{0,1,2,…},状态空间是有限集合 {0,1,…,20}\{0,1,\ldots,20\}{0,1,…,20}。I5=0I_5=0I5​=0 是“第 5 个记录时刻库存为 0”的事件。固定一个样本结果 ω\omegaω 后,n↦In(ω)n\mapsto I_n(\omega)n↦In​(ω) 是一条库存样本路径,而不是一个新的随机变量。

  1. 已知 P(X0=A)=0.7\mathbb P(X_0=A)=0.7P(X0​=A)=0.7,P(X1=B∣X0=A)=0.2\mathbb P(X_1=B\mid X_0=A)=0.2P(X1​=B∣X0​=A)=0.2,P(X1=B∣X0=C)=0.6\mathbb P(X_1=B\mid X_0=C)=0.6P(X1​=B∣X0​=C)=0.6,且 P(X0=C)=0.3\mathbb P(X_0=C)=0.3P(X0​=C)=0.3。计算 P(X1=B)\mathbb P(X_1=B)P(X1​=B),并解释为什么不能直接使用 0.2。

第 1 时刻到达 BBB 有两条按初始状态区分的路径,因此用全概率公式:P(X1=B)=0.7×0.2+0.3×0.6=0.14+0.18=0.32\mathbb P(X_1=B)=0.7\times0.2+0.3\times0.6=0.14+0.18=0.32P(X1​=B)=0.7×0.2+0.3×0.6=0.14+0.18=0.32。0.2 只是“初始为 A 时到 B”的条件概率,题目没有给定 X0=AX_0=AX0​=A,所以不能把它当作无条件概率。

变式:检查状态是否充分

  1. 某服务器仅在空闲时接收任务:每个空闲时刻,以 1/21/21/2 的概率在下一时刻开始一个新任务,否则继续空闲,各次机会独立。任务服务时间独立地以各 1/21/21/2 的概率取 1 步或 2 步;开始服务时记已服务 0 步,服务完成后先回到空闲,不立即替换任务。若只记录“忙/闲”,为什么一般不满足马尔可夫性?给出一种足够的扩充状态。

若当前都记为“忙”,刚开始服务时,下一步完成的概率为 1/21/21/2;已经服务 1 步仍忙时,已知服务时长必为 2,下一步完成的概率为 1。这两种可由历史区分的情形被压在同一状态内。因此只看“忙/闲”时,下一步规则仍依赖更早历史。可以把状态扩充为“闲、忙且已服务 0 步、忙且已服务 1 步”;若服务时间还有更多可能值,就记录足以判断剩余服务分布的信息。

  1. 设 X0X_0X0​ 以相等概率取 0 或 1,且 X1=X0X_1=X_0X1​=X0​。另一个过程 Y0Y_0Y0​ 同样以相等概率取 0 或 1,且 Y1=1−Y0Y_1=1-Y_0Y1​=1−Y0​。比较 X1,Y1X_1,Y_1X1​,Y1​ 的边缘分布与 P(X1=X0),P(Y1=Y0)\mathbb P(X_1=X_0),\mathbb P(Y_1=Y_0)P(X1​=X0​),P(Y1​=Y0​)。这个例子说明了什么?

两者的第 1 时刻边缘分布都满足取 0、1 各为 1/21/21/2,因为对 Y1Y_1Y1​ 来说翻转并不改变均匀分布。可是 P(X1=X0)=1\mathbb P(X_1=X_0)=1P(X1​=X0​)=1,而 P(Y1=Y0)=0\mathbb P(Y_1=Y_0)=0P(Y1​=Y0​)=0。所以边缘分布相同并不能确定时间之间的联合结构,更不能替代对依赖关系的建模。

迁移:把文字问题翻译成过程

  1. 一条生产线每小时可能处于“正常”“降速”“停机”三种状态。维修员只在停机后工作,且下一小时状态的概率据称只由当前状态决定。请写出过程的索引集与状态空间,给出一个可检验的马尔可夫性陈述,并指出至少一个需要实际检查的数据问题。

可以令 XnX_nXn​ 表示第 nnn 个小时的状态,索引集为 {0,1,2,…}\{0,1,2,\ldots\}{0,1,2,…},状态空间为 S={正常,降速,停机}S=\{\text{正常},\text{降速},\text{停机}\}S={正常,降速,停机}。对每个正概率历史 x0,…,xnx_0,\ldots,x_nx0​,…,xn​,应检查是否有 P(Xn+1=y∣X0=x0,…,Xn=xn)\mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n)P(Xn+1​=y∣X0​=x0​,…,Xn​=xn​) 与历史只通过 xnx_nxn​ 发生关系。数据上至少要检查:记录时间是否等长、状态定义是否一致、维修动作是否被遗漏,以及不同历史在同一当前状态下的下一小时频率是否明显不同。若维修员是否在场也影响未来,就应把“维修员状态”纳入状态。

  1. 令 XnX_nXn​ 为公平随机游走的位置,X0=0X_0=0X0​=0,每步以相等概率向左或向右。有人说“期望位置为 0,所以粒子一定会在原点附近”。请计算 E[X4]\mathbb E[X_4]E[X4​] 和 Var⁡(X4)\operatorname{Var}(X_4)Var(X4​),再解释这句话的问题。

这里 p=1/2p=1/2p=1/2,所以 E[X4]=4(2p−1)=0\mathbb E[X_4]=4(2p-1)=0E[X4​]=4(2p−1)=0,Var⁡(X4)=4×4×(1/2)(1/2)=4\operatorname{Var}(X_4)=4\times4\times(1/2)(1/2)=4Var(X4​)=4×4×(1/2)(1/2)=4。期望为 0 只说明许多路径的平均位置在原点,不表示每条路径都靠近原点;第 4 步的位置可能是 −4,−2,0,2,4-4,-2,0,2,4−4,−2,0,2,4,波动的标准差为 2。要判断“附近”的概率,还需要完整分布或至少方差等信息,不能只看均值。

延伸一步:用信息和协方差作判断

  1. 独立抛两次公平硬币,F1\mathcal F_1F1​ 表示只看过第一次的全部信息。令 A=1{第一次为 H}A=\mathbf1_{\{\text{第一次为 }H\}}A=1{第一次为 H}​,B=1{两次相同}B=\mathbf1_{\{\text{两次相同}\}}B=1{两次相同}​。哪个量在 F1\mathcal F_1F1​ 下可测?求 E[B∣F1]\mathbb E[B\mid\mathcal F_1]E[B∣F1​],并用样本空间分组解释。

AAA 可测:它在 {HH,HT}\{HH,HT\}{HH,HT} 上恒为 1,在 {TH,TT}\{TH,TT\}{TH,TT} 上恒为 0。BBB 在同一组内仍会变化,例如 HHHHHH 上为 1、HTHTHT 上为 0,所以 BBB 不可测。无论第一次为 HHH 还是 TTT,两次相同都只占相容结果的一半,故 E[B∣F1]=1/2\mathbb E[B\mid\mathcal F_1]=1/2E[B∣F1​]=1/2。这个条件均值在每个可辨认组内恒定,可以在时刻 1 确定;未来的实际 BBB 值还不能确定。

  1. 设 Z0,Z1,…Z_0,Z_1,\ldotsZ0​,Z1​,… 独立同分布,均值为 0、方差为 1,令 Un=Zn+Zn+1U_n=Z_n+Z_{n+1}Un​=Zn​+Zn+1​。求 UnU_nUn​ 的均值,以及滞后为 0、1 和至少 2 时的协方差,判断它是否弱平稳。为何相邻的 UnU_nUn​ 不能据此说成独立?

由线性性,E[Un]=0\mathbb E[U_n]=0E[Un​]=0;独立性使不同 ZZZ 的协方差为 0,故 Var⁡(Un)=2\operatorname{Var}(U_n)=2Var(Un​)=2。相邻两项 Un=Zn+Zn+1U_n=Z_n+Z_{n+1}Un​=Zn​+Zn+1​、Un+1=Zn+1+Zn+2U_{n+1}=Z_{n+1}+Z_{n+2}Un+1​=Zn+1​+Zn+2​ 共享一个 Zn+1Z_{n+1}Zn+1​,展开协方差后只留下 Var⁡(Zn+1)=1\operatorname{Var}(Z_{n+1})=1Var(Zn+1​)=1。相隔至少 2 时没有共享项,协方差为 0。因此 γ(0)=2\gamma(0)=2γ(0)=2、γ(1)=γ(−1)=1\gamma(1)=\gamma(-1)=1γ(1)=γ(−1)=1,其余滞后为 0;有限二阶矩、均值恒定和只依赖滞后三项都满足,所以弱平稳。相邻项协方差非零,在二阶矩有限的这里已经足以排除独立;平稳从来没有要求各时刻独立。

下一章离散时间 Markov 链:矩阵与多步概率