01 随机过程的语言:把随机变化写成一条时间线 一台设备每小时可能正常、降速或停机;一个账户每天可能增加、减少或保持余额;一个粒子每隔一秒向左或向右走一步。单独看某个时刻,这些都只是随机变量。可一旦把时刻排成顺序,问题就变了:今天的状态会不会影响明天?相隔很远的两个时刻还相关吗?我们观察到的这一条记录,和模型允许出现的其他记录有什么关系?
随机过程就是处理这条“随机时间线”的语言。本章先不急着套马尔可夫性质,而是把对象、索引、状态、样本路径和联合分布分开。后面谈离散时间链时,矩阵里的每一个元素都要回到这里的定义;如果这一步含糊,矩阵乘法很容易变成没有解释的算术。
一条过程包含哪些对象 设
( Ω , F , P ) (\Omega,\mathcal F,\mathbb P) ( Ω , F , P ) 是概率空间,T T T 是索引集,S S S 是状态空间。状态空间还配有一族可测集合(σ \sigma σ 代数)S \mathcal S S :有限或可数状态时取所有子集,实数状态时通常取 Borel 集。这样,询问“状态是否落在 A A A 中”就有明确的事件含义。一个随机过程写作
{ X t : t ∈ T } , \{X_t:t\in T\}, { X t : t ∈ T } , 其中对每个固定的 t t t ,X t X_t X t 是从 Ω \Omega Ω 到 S S S 的可测映射,即 A ∈ S A\in\mathcal S A ∈ S 时,{ ω : X t ( ω ) ∈ A } ∈ F \{\omega:X_t(\omega)\in A\}\in\mathcal F { ω : X t ( ω ) ∈ A } ∈ F ;我们仍称它为随机变量。换句话说,随机结果 ω \omega ω 一旦确定,所有时刻的取值就同时确定了:
t ⟼ X t ( ω ) . t\longmapsto X_t(\omega). t ⟼ X t ( ω ) . 这条确定的函数称为一条样本路径。
这里有两个容易混在一起的“变量”。固定 t t t ,X t X_t X t 随随机结果变化,是随机变量;固定 ω \omega ω ,X t ( ω ) X_t(\omega) X t ( ω ) 随时间变化,是一条普通函数。随机过程不是“一个随机变量加上一个时间标签”,而是一族彼此可能相关的随机变量。
把一个很小的模型摆在图里会更清楚:四个样本结果等可能,每行记录一条路径。沿着某一行向右读,你没有换样本结果;固定标作 n = 2 n=2 n = 2 的那一列向下读,才是在比较 X 2 X_2 X 2 的不同可能取值。图中 X 2 X_2 X 2 取 0、1 各占两行,所以各有 1 / 2 1/2 1/2 的概率。若四行并非等可能,就必须按各行的概率加权,不能直接数行数。
索引集决定“什么时候观察” 常见索引集有两类:
离散时间:T = { 0 , 1 , 2 , … } T=\{0,1,2,\ldots\} T = { 0 , 1 , 2 , … } 或有限的整数集合。X n X_n X n 可以表示第 n n n 次交易、第 n n n 天或第 n n n 步后的状态。
连续时间:T = [ 0 , ∞ ) T=[0,\infty) T = [ 0 , ∞ ) 。X t X_t X t 可以表示任意时刻的设备状态、队列人数或粒子位置。
索引集不是状态空间。n = 4 n=4 n = 4 是时刻,X 4 = 2 X_4=2 X 4 = 2 才是状态;“第四天处于状态 2”同时使用了这两个层次。状态空间也不一定是数字集,例如 S = { 正常 , 降速 , 停机 } S=\{\text{正常},\text{降速},\text{停机}\} S = { 正常 , 降速 , 停机 } 。为了计算,常把这些状态编号,但编号本身没有概率意义。
图左只在选定时刻给出取值;图右画出时间连续变化的一种路径。右图中的光滑曲线只是例子:连续时间描述的是索引集,绝不保证路径连续,计数过程就可以在事件发生时跳跃。淡色线条不表示置信区间。
离散时间适合记录“每一步发生了什么”;连续时间适合记录“事件在什么时候发生”。同一个系统可以有两种建模:只看每天收盘状态是离散时间过程,记录每次故障和修复的确切时刻则可能是连续时间过程。选哪一种,要看问题需要保留的时间信息。
状态空间也决定问题的形状 状态空间可以是有限集、可数集,也可以是实数的一部分。有限状态过程适合用转移矩阵组织;实值过程常需要讨论密度、协方差函数或路径的连续性。不要因为两个过程都写成 X t X_t X t ,就假定它们能用同一种工具处理。
例如,令 Y n Y_n Y n 表示第 n n n 天库存量,S = { 0 , 1 , … , 50 } S=\{0,1,\ldots,50\} S = { 0 , 1 , … , 50 } 。令 Z n Z_n Z n 表示第 n n n 天的温度,S = R S=\mathbb R S = R 。它们都可以是离散时间过程,但第一个适合研究“何时缺货”,第二个可能更自然地研究均值、波动和相关性。
从路径回到分布 给定 t t t ,随机变量 X t X_t X t 的分布回答“这个时刻可能在哪些状态”;而有限维分布回答“多个指定时刻的状态怎样联合出现”。对时刻 t 1 , … , t k t_1,\ldots,t_k t 1 , … , t k ,有限维分布由所有可测集合 A 1 , … , A k A_1,\ldots,A_k A 1 , … , A k 对应的下列概率描述
P ( X t 1 ∈ A 1 , … , X t k ∈ A k ) . \mathbb P(X_{t_1}\in A_1,\ldots,X_{t_k}\in A_k). P ( X t 1 ∈ A 1 , … , X t k ∈ A k ) . 离散状态时可以写成点概率
P ( X t 1 = x 1 , … , X t k = x k ) . \mathbb P(X_{t_1}=x_1,\ldots,X_{t_k}=x_k). P ( X t 1 = x 1 , … , X t k = x k ) . 只知道每个 X t X_t X t 的边缘分布,通常不能确定过程。例如只抛一次公平硬币,记结果为 B ∈ { 0 , 1 } B\in\{0,1\} B ∈ { 0 , 1 } 。模型 A 规定所有 n n n 都有 X n = B X_n=B X n = B ;模型 B 规定偶数时刻 Y n = B Y_n=B Y n = B ,奇数时刻 Y n = 1 − B Y_n=1-B Y n = 1 − B 。每个固定时刻,两者都以 1 / 2 1/2 1/2 的概率取 0 或 1。可是模型 A 的路径永远不变,模型 B 的路径每步翻转,分别满足 P ( X 1 = X 0 ) = 1 \mathbb P(X_1=X_0)=1 P ( X 1 = X 0 ) = 1 与 P ( Y 1 = Y 0 ) = 0 \mathbb P(Y_1=Y_0)=0 P ( Y 1 = Y 0 ) = 0 。
因此,研究随机系统时,边缘分布只能告诉你“某一帧长什么样”,联合分布还要告诉你“帧与帧怎样接起来”。马尔可夫性质正是在联合分布层面提出一种特殊但非常有用的限制:给定现在,过去对未来不再提供额外信息。
条件概率是连接时间的桥 对离散状态,只在给定历史事件的概率为正时,才直接使用下面的比值型条件概率:
P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) . \mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n). P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) . 条件中指定了当前和历史,它描述的是已知这些信息以后的预测;数值可能高于、低于或等于无条件概率。若过程具有马尔可夫性质,这个概率将只依赖当前状态 x n x_n x n :
P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) = P ( X n + 1 = y ∣ X n = x n ) . \mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n)
=\mathbb P(X_{n+1}=y\mid X_n=x_n). P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) = P ( X n + 1 = y ∣ X n = x n ) . 这个等式要求对所有正概率的历史都成立。把当前状态告诉我们以后,额外再告诉过去,下一步的条件分布没有改变;它没有宣称未来和过去无条件独立。概率为零的历史不能直接代入概率之比,在一般状态空间中应改用几乎处处成立的条件分布表述。
还要留意时刻 n n n :马尔可夫性允许今天和明天采用不同的转移规则。若从 x x x 到 y y y 的一步条件概率另外还不依赖 n n n ,才称为时间齐次。后面的天气模型会同时作这两项假设。
“马尔可夫”不是“每个时刻都独立”。例如随机游走的相邻状态通常明显相关,但给定当前位置后,下一步不需要知道更早的路径。独立性比马尔可夫性强得多;把两者混为一谈,会错误地删掉条件概率中的当前状态。
过滤:在时刻 n 能知道什么 为了把“过去”写成一个对象,定义自然过滤
F n = σ ( X 0 , X 1 , … , X n ) . \mathcal F_n=\sigma(X_0,X_1,\ldots,X_n). F n = σ ( X 0 , X 1 , … , X n ) . 它表示只观察到 0 0 0 到 n n n 时刻的全部信息。随着时间增加,信息不会减少:
F 0 ⊆ F 1 ⊆ F 2 ⊆ ⋯ . \mathcal F_0\subseteq\mathcal F_1\subseteq\mathcal F_2\subseteq\cdots. F 0 ⊆ F 1 ⊆ F 2 ⊆ ⋯ . 若一个量在时刻 n n n 可以由这段历史确定,就说它对 F n \mathcal F_n F n 可测。直观地说,不能用“明天才知道的硬币结果”来决定今天的下注规则。
以两次独立抛公平硬币为例,结果记作 H H H 或 T T T ,样本空间为 { H H , H T , T H , T T } \{HH,HT,TH,TT\} { H H , H T , T H , T T } 。抛之前,四种结果还无法区分;第一次见到 H H H ,能确定结果属于 { H H , H T } \{HH,HT\} { H H , H T } ,却不能判断第二次是否为 H H H ;第二次也看到以后,才能区分四个单独的结果。信息增加时,可区分的组变细,相应的事件集合反而增多。自然过滤记录的是整段已见历史,通常不同于只保留当前状态的 σ ( X n ) \sigma(X_n) σ ( X n ) 。
若未来的实值量 Y Y Y 满足 E ∣ Y ∣ < ∞ \mathbb E|Y|<\infty E ∣ Y ∣ < ∞ ,E [ Y ∣ F n ] \mathbb E[Y\mid\mathcal F_n] E [ Y ∣ F n ] 表示已知历史后的条件均值。在有限模型里,做法就是把与眼前历史相容的结果收在一起,用条件概率加权求平均。例如看到第一次为 H H H 后,第二次为 H H H 的指标变量仍以各 1 / 2 1/2 1/2 的概率取 0 和 1,条件均值是 1 / 2 1/2 1/2 ;两次都看到以后,这个指标本身已知,条件均值就是已见到的 0 或 1。
马尔可夫性也可以通过这些条件均值表达。对每个有界可测函数 g : S → R g:S\to\mathbb R g : S → R ,有
E [ g ( X n + 1 ) ∣ F n ] = E [ g ( X n + 1 ) ∣ X n ] 几乎处处 . \mathbb E[g(X_{n+1})\mid\mathcal F_n]
=\mathbb E[g(X_{n+1})\mid X_n]
\quad\text{几乎处处}. E [ g ( X n + 1 ) ∣ F n ] = E [ g ( X n + 1 ) ∣ X n ] 几乎处处 . 取 g ( x ) = 1 { x ∈ A } g(x)=\mathbf 1_{\{x\in A\}} g ( x ) = 1 { x ∈ A } ,条件均值就变成下一步落入 A A A 的条件概率。对有限状态,这个等式也能直接验证:把每个下一步状态 y y y 的 g ( y ) g(y) g ( y ) 乘上条件概率,再求和;马尔可夫性让和式中的概率只通过 X n X_n X n 依赖历史。若用不受限的 g g g ,还需检查 E ∣ g ( X n + 1 ) ∣ < ∞ \mathbb E|g(X_{n+1})|<\infty E ∣ g ( X n + 1 ) ∣ < ∞ ,不能对任意函数不加条件地取期望。
一个完整的小模型:带记忆的天气记录 设 X n ∈ { S , R } X_n\in\{S,R\} X n ∈ { S , R } 表示第 n n n 天的天气,S S S 为晴,R R R 为雨。初始日明确记作第 0 天 ,P ( X 0 = S ) = 0.6 \mathbb P(X_0=S)=0.6 P ( X 0 = S ) = 0.6 。假设天气满足时间齐次的马尔可夫模型:今天晴时,明天晴的概率是 0.8 0.8 0.8 ;今天雨时,明天晴的概率是 0.4 0.4 0.4 。另外两个去向由概率和为 1 得到,分别是晴后雨 0.2 0.2 0.2 、雨后雨 0.6 0.6 0.6 。
要算“第 1 天雨且第 2 天晴”,得先知道第 1 天的分布。第 1 天的雨可能来自初始的晴,也可能来自初始的雨。这两个事件互斥,合起来覆盖全部初始状态,所以
P ( X 1 = R ) = 0.6 × 0.2 + 0.4 × 0.6 = 0.36 , P ( X 1 = S ) = 0.6 × 0.8 + 0.4 × 0.4 = 0.64. \begin{aligned}
\mathbb P(X_1=R)&=0.6\times0.2+0.4\times0.6=0.36,\\
\mathbb P(X_1=S)&=0.6\times0.8+0.4\times0.4=0.64.
\end{aligned} P ( X 1 = R ) P ( X 1 = S ) = 0.6 × 0.2 + 0.4 × 0.6 = 0.36 , = 0.6 × 0.8 + 0.4 × 0.4 = 0.64. 两数相加为 1,第一步分布没有遗漏去向。现在才使用相邻两天的条件概率:
P ( X 1 = R , X 2 = S ) = P ( X 1 = R ) P ( X 2 = S ∣ X 1 = R ) = 0.36 × 0.4 = 0.144. \begin{aligned}
\mathbb P(X_1=R,X_2=S)
&=\mathbb P(X_1=R)\mathbb P(X_2=S\mid X_1=R)\\
&=0.36\times0.4=0.144.
\end{aligned} P ( X 1 = R , X 2 = S ) = P ( X 1 = R ) P ( X 2 = S ∣ X 1 = R ) = 0.36 × 0.4 = 0.144. 它小于 0.36 0.36 0.36 ,因为在第 1 天下雨之外又加上了一个要求。若有人得到 0.4 × 0.4 = 0.16 0.4\times0.4=0.16 0.4 × 0.4 = 0.16 ,就把初始第 0 天的雨概率,误当成了第 1 天的雨概率。
“第 2 天晴”允许第 1 天是晴或雨,需要把两个互斥的联合事件相加:
P ( X 2 = S ) = P ( X 1 = S , X 2 = S ) + P ( X 1 = R , X 2 = S ) = 0.64 × 0.8 + 0.36 × 0.4 = 0.512 + 0.144 = 0.656. \begin{aligned}
\mathbb P(X_2=S)
&=\mathbb P(X_1=S,X_2=S)+\mathbb P(X_1=R,X_2=S)\\
&=0.64\times0.8+0.36\times0.4\\
&=0.512+0.144=0.656.
\end{aligned} P ( X 2 = S ) = P ( X 1 = S , X 2 = S ) + P ( X 1 = R , X 2 = S ) = 0.64 × 0.8 + 0.36 × 0.4 = 0.512 + 0.144 = 0.656. 单条完整路径又是另一回事。例如初始就雨、随后仍雨、再转晴这条 R → R → S R\to R\to S R → R → S 路径,概率为 0.4 × 0.6 × 0.4 = 0.096 0.4\times0.6\times0.4=0.096 0.4 × 0.6 × 0.4 = 0.096 。它只是上面 0.144 0.144 0.144 的一部分,另一部分是 S → R → S S\to R\to S S → R → S 的 0.048 0.048 0.048 。沿路径相乘,合并互斥路径时相加,是下一章矩阵递推的出发点。
把一般参数记为 q = P ( X 0 = S ) q=\mathbb P(X_0=S) q = P ( X 0 = S ) 、a = P ( S ∣ S ) a=\mathbb P(S\mid S) a = P ( S ∣ S ) 、b = P ( S ∣ R ) b=\mathbb P(S\mid R) b = P ( S ∣ R ) ,那么
q 1 = q a + ( 1 − q ) b , q 2 = q 1 a + ( 1 − q 1 ) b . q_1=qa+(1-q)b,\qquad q_2=q_1a+(1-q_1)b. q 1 = q a + ( 1 − q ) b , q 2 = q 1 a + ( 1 − q 1 ) b . 下方实验同时显示完整路径与合并后的边缘概率。保留 q = 0.6 , b = 0.4 q=0.6,b=0.4 q = 0.6 , b = 0.4 ,只提高 a a a ,观察 q 2 q_2 q 2 和事件 { X 1 = R , X 2 = S } \{X_1=R,X_2=S\} { X 1 = R , X 2 = S } 是否朝同一方向改变。不要急着用“晴更容易持续”代替计算:后一事件必须先经过雨,第 1 天雨的概率会随 a a a 减少,因此其概率 b ( 1 − q 1 ) b(1-q_1) b ( 1 − q 1 ) 反而下降。
恢复默认值,选择 R → R → S R\to R\to S R → R → S ,应读到 0.096 0.096 0.096 。改为筛选所有“第 2 天晴”的路径,看加总如何得到 0.656 0.656 0.656 ;切换到“第 1 天雨且第 2 天晴”,剩下的两条路径则加总为 0.144 0.144 0.144 。有限次模拟的频率可能偏离这些数,精确概率来自模型的加法与乘法规则。
期望、协方差与时间结构 以下只讨论实值过程,并假设每个时刻都有 E [ X t 2 ] < ∞ \mathbb E[X_t^2]<\infty E [ X t 2 ] < ∞ 。有限二阶矩保证均值与协方差有定义。均值函数和协方差函数分别记录单时刻水平与跨时刻联动:
m ( t ) = E [ X t ] , C ( s , t ) = Cov ( X s , X t ) . m(t)=\mathbb E[X_t],\qquad
C(s,t)=\operatorname{Cov}(X_s,X_t). m ( t ) = E [ X t ] , C ( s , t ) = Cov ( X s , X t ) . 对实值过程,C ( s , t ) = E [ ( X s − m ( s ) ) ( X t − m ( t ) ) ] C(s,t)=\mathbb E[(X_s-m(s))(X_t-m(t))] C ( s , t ) = E [( X s − m ( s )) ( X t − m ( t ))] 。协方差为正,表示一个时刻偏高时另一个时刻倾向偏高;为负则倾向相反。协方差为零只表示线性关系消失,一般不等于独立。
若均值不随时间改变,并且协方差只依赖滞后 h h h ,即
m ( t ) = μ , C ( s , t ) = γ ( t − s ) , m(t)=\mu,\qquad C(s,t)=\gamma(t-s), m ( t ) = μ , C ( s , t ) = γ ( t − s ) , 连同有限二阶矩,这些条件定义了弱平稳过程。对离散时间,常写成 γ ( h ) = Cov ( X n , X n + h ) \gamma(h)=\operatorname{Cov}(X_n,X_{n+h}) γ ( h ) = Cov ( X n , X n + h ) 。等式只在涉及的时刻都属于索引集时要求成立;在 N 0 \mathbb N_0 N 0 上使用负滞后时也要留意这一点。特别地,令 s = t s=t s = t 可知方差 C ( t , t ) = γ ( 0 ) C(t,t)=\gamma(0) C ( t , t ) = γ ( 0 ) 必须恒定。
这让“第 3 天到第 4 天”和“第 103 天到第 104 天”在均值、协方差意义下可比较,但不能由此推出所有联合分布在平移后相同。后一个要求叫严格平稳,比只检查二阶统计量涉及的信息多;严格平稳若没有有限二阶矩,也不能直接称为弱平稳。
随机游走展示路径与统计量的区别 令 ξ 1 , ξ 2 , … \xi_1,\xi_2,\ldots ξ 1 , ξ 2 , … 独立,且
P ( ξ k = 1 ) = p , P ( ξ k = − 1 ) = 1 − p , \mathbb P(\xi_k=1)=p,\qquad \mathbb P(\xi_k=-1)=1-p, P ( ξ k = 1 ) = p , P ( ξ k = − 1 ) = 1 − p , 定义
X 0 = 0 , X n = ∑ k = 1 n ξ k . X_0=0,\qquad X_n=\sum_{k=1}^n\xi_k. X 0 = 0 , X n = k = 1 ∑ n ξ k . 一条路径可能是 0 , 1 , 2 , 1 , 0 , 1 , … 0,1,2,1,0,1,\ldots 0 , 1 , 2 , 1 , 0 , 1 , … ,另一条可能是 0 , − 1 , − 2 , − 1 , 0 , − 1 , … 0,-1,-2,-1,0,-1,\ldots 0 , − 1 , − 2 , − 1 , 0 , − 1 , … 。它们都是同一个模型的可能结果。期望和方差可以从一步增量算起:E [ ξ k ] = 2 p − 1 \mathbb E[\xi_k]=2p-1 E [ ξ k ] = 2 p − 1 ,又因 ξ k 2 = 1 \xi_k^2=1 ξ k 2 = 1 ,有 Var ( ξ k ) = 1 − ( 2 p − 1 ) 2 = 4 p ( 1 − p ) \operatorname{Var}(\xi_k)=1-(2p-1)^2=4p(1-p) Var ( ξ k ) = 1 − ( 2 p − 1 ) 2 = 4 p ( 1 − p ) 。期望对有限和具有线性;不同增量独立,交叉协方差为零,所以和的方差等于各项方差之和。这给出
E [ X n ] = n ( 2 p − 1 ) , Var ( X n ) = 4 n p ( 1 − p ) , \mathbb E[X_n]=n(2p-1),\qquad \operatorname{Var}(X_n)=4np(1-p), E [ X n ] = n ( 2 p − 1 ) , Var ( X n ) = 4 n p ( 1 − p ) , 这些量描述许多路径合在一起的统计规律。第 n n n 步的位置只能取 − n , − n + 2 , … , n -n,-n+2,\ldots,n − n , − n + 2 , … , n ,不仅必须是整数,还要与 n n n 同奇偶。公平游走的均值始终是 0,但第 1 步不可能停在 0,说明均值曲线也未必是一条允许的路径。
相隔两时刻的协方差也能用同一个分解得到。若 m ≤ n m\le n m ≤ n ,把 X n X_n X n 写成 X m + ( ξ m + 1 + ⋯ + ξ n ) X_m+(\xi_{m+1}+\cdots+\xi_n) X m + ( ξ m + 1 + ⋯ + ξ n ) 。括号里的未来增量与 X m X_m X m 独立,故
Cov ( X m , X n ) = Var ( X m ) = 4 m p ( 1 − p ) = 4 p ( 1 − p ) min ( m , n ) . \begin{aligned}
\operatorname{Cov}(X_m,X_n)
&=\operatorname{Var}(X_m)\\
&=4mp(1-p)=4p(1-p)\min(m,n).
\end{aligned} Cov ( X m , X n ) = Var ( X m ) = 4 m p ( 1 − p ) = 4 p ( 1 − p ) min ( m , n ) . 当 0 < p < 1 0<p<1 0 < p < 1 时,方差随 n n n 增长,因此这个从 0 出发的随机游走不是弱平稳过程。取 p = 1 / 2 p=1/2 p = 1/2 也无济于事:均值恒为 0 只满足了一部分条件。反过来,增量序列本身的均值恒定,协方差在滞后 0 时为 4 p ( 1 − p ) 4p(1-p) 4 p ( 1 − p ) 、非零滞后时为 0,倒是弱平稳的。状态过程与增量过程要分开检查。
从增量表示可以看出,X n + 1 = X n + ξ n + 1 X_{n+1}=X_n+\xi_{n+1} X n + 1 = X n + ξ n + 1 。给定当前 X n X_n X n ,下一步只需知道新的增量;更早的增量已经被当前总和压缩进当前位置。这是马尔可夫建模的典型动机:寻找一个足够描述当前的状态,而不是把全部历史原样带入。
状态里漏掉了什么 面对一个新的随机变化问题,可以把下面几件事写出来:
观察单位是什么,是每次交易、每个小时,还是事件发生的连续时刻?这决定索引集。
预测对象是什么,是一个有限状态标签、计数,还是实数测量?这决定状态空间。
一条路径怎样产生?要说明初始状态和状态之间的随机规则,而不是只列出几个可能序列。
题目需要边缘分布、联合分布、条件概率,还是期望与协方差?不同问题调用的对象不同。
当前状态是否保留了预测未来所需的信息?若没有,必须扩充状态,例如把“当前库存”和“尚未到货的订单”一起作为状态。
一个好状态的标准不是“看起来简单”,而是“给定它以后,未来问题所需的信息已经足够”。状态过少会让所谓转移概率依赖更长历史;状态过多则增加计算负担。后面学习马尔可夫链,本质上就是在一个合适状态空间上系统利用这个判断。
来看一个与前面两状态天气模型不同的假设系统。今天晴,明天下雨的概率是 0.2 0.2 0.2 ;今天是连续下雨的第一天,明天继续下雨的概率是 0.3 0.3 0.3 ;若已经连雨至少两天,明天继续下雨的概率是 0.8 0.8 0.8 。这些是模型设定,用来检验状态选择,不是现实天气的经验定律。
取 X 0 = S X_0=S X 0 = S ,比较到第 2 天的两段正概率历史 S , S , R S,S,R S , S , R 与 S , R , R S,R,R S , R , R 。它们今天都为雨,前者却是首个雨天,后者已有两天雨,于是
P ( X 3 = R ∣ X 0 = S , X 1 = S , X 2 = R ) = 0.3 , P ( X 3 = R ∣ X 0 = S , X 1 = R , X 2 = R ) = 0.8. \begin{aligned}
\mathbb P(X_3=R\mid X_0=S,X_1=S,X_2=R)&=0.3,\\
\mathbb P(X_3=R\mid X_0=S,X_1=R,X_2=R)&=0.8.
\end{aligned} P ( X 3 = R ∣ X 0 = S , X 1 = S , X 2 = R ) P ( X 3 = R ∣ X 0 = S , X 1 = R , X 2 = R ) = 0.3 , = 0.8. 若只保留 X 2 = R X_2=R X 2 = R ,两段历史就混在一起。任何一个单独的“雨后雨概率”都不可能同时等于 0.3 0.3 0.3 和 0.8 0.8 0.8 ,因此这个二状态记录不满足马尔可夫性。
不必把整段历史全带上。将状态改为 Z n ∈ { S , R 1 , R 2 + } Z_n\in\{S,R_1,R_{2+}\} Z n ∈ { S , R 1 , R 2 + } ,分别表示晴、首个雨天、连雨至少两天,下一步规则就确定了:从 S S S 以 0.2 0.2 0.2 到 R 1 R_1 R 1 ,否则留在 S S S ;从 R 1 R_1 R 1 以 0.3 0.3 0.3 到 R 2 + R_{2+} R 2 + ,否则到 S S S ;从 R 2 + R_{2+} R 2 + 以 0.8 0.8 0.8 留在 R 2 + R_{2+} R 2 + ,否则到 S S S 。按设定,更长的连雨天数不会再改变概率,所以不必无限细分状态。
在实验里选这两段历史,比较下一天下雨的概率条。把“首日续雨”和“连日续雨”都设成 0.5 0.5 0.5 ,再观察扩充状态是否还给预测带来差别。在这个特定模型中,两类雨状态的下一步粗分类概率相同,晴雨标签已足够。恢复 0.3 0.3 0.3 与 0.8 0.8 0.8 后,调节两类雨天在混合记录中的比例:粗略的雨后雨概率随比例改变,却没有改变任何一类历史自己的转移规则。这说明在条件不足时,一个汇总数字会掩盖什么。
继续计算之前 随机过程把“随机”与“随时间变化”放在同一个对象里。固定时间看分布,固定结果看路径;多个时刻一起看联合分布;用过滤表示到某时刻为止可用的信息;用条件概率检验当前状态对未来是否足够。离散时间链的矩阵、首达事件和吸收时间,都只是沿着这条主线继续问得更具体。
自测与练习 1 固定一个样本结果 ω 后,t ↦ X_t(ω) 表示什么?
A. 一条样本路径 B. 一个边缘分布 C. 一个条件概率 D. 一个转移矩阵
巩固:识别对象与概率层次
某仓库每天记录库存量 I n I_n I n ,其中 I n ∈ { 0 , 1 , … , 20 } I_n\in\{0,1,\ldots,20\} I n ∈ { 0 , 1 , … , 20 } 。请指出索引集、状态空间、I 5 = 0 I_5=0 I 5 = 0 所描述的事件,并说明固定样本结果后得到的对象是什么。
查看解答 索引集是离散时间集合 { 0 , 1 , 2 , … } \{0,1,2,\ldots\} { 0 , 1 , 2 , … } ,状态空间是有限集合 { 0 , 1 , … , 20 } \{0,1,\ldots,20\} { 0 , 1 , … , 20 } 。I 5 = 0 I_5=0 I 5 = 0 是“第 5 个记录时刻库存为 0”的事件。固定一个样本结果 ω \omega ω 后,n ↦ I n ( ω ) n\mapsto I_n(\omega) n ↦ I n ( ω ) 是一条库存样本路径,而不是一个新的随机变量。
已知 P ( X 0 = A ) = 0.7 \mathbb P(X_0=A)=0.7 P ( X 0 = A ) = 0.7 ,P ( X 1 = B ∣ X 0 = A ) = 0.2 \mathbb P(X_1=B\mid X_0=A)=0.2 P ( X 1 = B ∣ X 0 = A ) = 0.2 ,P ( X 1 = B ∣ X 0 = C ) = 0.6 \mathbb P(X_1=B\mid X_0=C)=0.6 P ( X 1 = B ∣ X 0 = C ) = 0.6 ,且 P ( X 0 = C ) = 0.3 \mathbb P(X_0=C)=0.3 P ( X 0 = C ) = 0.3 。计算 P ( X 1 = B ) \mathbb P(X_1=B) P ( X 1 = B ) ,并解释为什么不能直接使用 0.2。
查看解答 第 1 时刻到达 B B B 有两条按初始状态区分的路径,因此用全概率公式:P ( X 1 = B ) = 0.7 × 0.2 + 0.3 × 0.6 = 0.14 + 0.18 = 0.32 \mathbb P(X_1=B)=0.7\times0.2+0.3\times0.6=0.14+0.18=0.32 P ( X 1 = B ) = 0.7 × 0.2 + 0.3 × 0.6 = 0.14 + 0.18 = 0.32 。0.2 只是“初始为 A 时到 B”的条件概率,题目没有给定 X 0 = A X_0=A X 0 = A ,所以不能把它当作无条件概率。
变式:检查状态是否充分
某服务器仅在空闲时接收任务:每个空闲时刻,以 1 / 2 1/2 1/2 的概率在下一时刻开始一个新任务,否则继续空闲,各次机会独立。任务服务时间独立地以各 1 / 2 1/2 1/2 的概率取 1 步或 2 步;开始服务时记已服务 0 步,服务完成后先回到空闲,不立即替换任务。若只记录“忙/闲”,为什么一般不满足马尔可夫性?给出一种足够的扩充状态。
查看解答 若当前都记为“忙”,刚开始服务时,下一步完成的概率为 1 / 2 1/2 1/2 ;已经服务 1 步仍忙时,已知服务时长必为 2,下一步完成的概率为 1。这两种可由历史区分的情形被压在同一状态内。因此只看“忙/闲”时,下一步规则仍依赖更早历史。可以把状态扩充为“闲、忙且已服务 0 步、忙且已服务 1 步”;若服务时间还有更多可能值,就记录足以判断剩余服务分布的信息。
设 X 0 X_0 X 0 以相等概率取 0 或 1,且 X 1 = X 0 X_1=X_0 X 1 = X 0 。另一个过程 Y 0 Y_0 Y 0 同样以相等概率取 0 或 1,且 Y 1 = 1 − Y 0 Y_1=1-Y_0 Y 1 = 1 − Y 0 。比较 X 1 , Y 1 X_1,Y_1 X 1 , Y 1 的边缘分布与 P ( X 1 = X 0 ) , P ( Y 1 = Y 0 ) \mathbb P(X_1=X_0),\mathbb P(Y_1=Y_0) P ( X 1 = X 0 ) , P ( Y 1 = Y 0 ) 。这个例子说明了什么?
查看解答 两者的第 1 时刻边缘分布都满足取 0、1 各为 1 / 2 1/2 1/2 ,因为对 Y 1 Y_1 Y 1 来说翻转并不改变均匀分布。可是 P ( X 1 = X 0 ) = 1 \mathbb P(X_1=X_0)=1 P ( X 1 = X 0 ) = 1 ,而 P ( Y 1 = Y 0 ) = 0 \mathbb P(Y_1=Y_0)=0 P ( Y 1 = Y 0 ) = 0 。所以边缘分布相同并不能确定时间之间的联合结构,更不能替代对依赖关系的建模。
迁移:把文字问题翻译成过程
一条生产线每小时可能处于“正常”“降速”“停机”三种状态。维修员只在停机后工作,且下一小时状态的概率据称只由当前状态决定。请写出过程的索引集与状态空间,给出一个可检验的马尔可夫性陈述,并指出至少一个需要实际检查的数据问题。
查看解答 可以令 X n X_n X n 表示第 n n n 个小时的状态,索引集为 { 0 , 1 , 2 , … } \{0,1,2,\ldots\} { 0 , 1 , 2 , … } ,状态空间为 S = { 正常 , 降速 , 停机 } S=\{\text{正常},\text{降速},\text{停机}\} S = { 正常 , 降速 , 停机 } 。对每个正概率历史 x 0 , … , x n x_0,\ldots,x_n x 0 , … , x n ,应检查是否有 P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) \mathbb P(X_{n+1}=y\mid X_0=x_0,\ldots,X_n=x_n) P ( X n + 1 = y ∣ X 0 = x 0 , … , X n = x n ) 与历史只通过 x n x_n x n 发生关系。数据上至少要检查:记录时间是否等长、状态定义是否一致、维修动作是否被遗漏,以及不同历史在同一当前状态下的下一小时频率是否明显不同。若维修员是否在场也影响未来,就应把“维修员状态”纳入状态。
令 X n X_n X n 为公平随机游走的位置,X 0 = 0 X_0=0 X 0 = 0 ,每步以相等概率向左或向右。有人说“期望位置为 0,所以粒子一定会在原点附近”。请计算 E [ X 4 ] \mathbb E[X_4] E [ X 4 ] 和 Var ( X 4 ) \operatorname{Var}(X_4) Var ( X 4 ) ,再解释这句话的问题。
查看解答 这里 p = 1 / 2 p=1/2 p = 1/2 ,所以 E [ X 4 ] = 4 ( 2 p − 1 ) = 0 \mathbb E[X_4]=4(2p-1)=0 E [ X 4 ] = 4 ( 2 p − 1 ) = 0 ,Var ( X 4 ) = 4 × 4 × ( 1 / 2 ) ( 1 / 2 ) = 4 \operatorname{Var}(X_4)=4\times4\times(1/2)(1/2)=4 Var ( X 4 ) = 4 × 4 × ( 1/2 ) ( 1/2 ) = 4 。期望为 0 只说明许多路径的平均位置在原点,不表示每条路径都靠近原点;第 4 步的位置可能是 − 4 , − 2 , 0 , 2 , 4 -4,-2,0,2,4 − 4 , − 2 , 0 , 2 , 4 ,波动的标准差为 2。要判断“附近”的概率,还需要完整分布或至少方差等信息,不能只看均值。
延伸一步:用信息和协方差作判断
独立抛两次公平硬币,F 1 \mathcal F_1 F 1 表示只看过第一次的全部信息。令 A = 1 { 第一次为 H } A=\mathbf1_{\{\text{第一次为 }H\}} A = 1 { 第一次为 H } ,B = 1 { 两次相同 } B=\mathbf1_{\{\text{两次相同}\}} B = 1 { 两次相同 } 。哪个量在 F 1 \mathcal F_1 F 1 下可测?求 E [ B ∣ F 1 ] \mathbb E[B\mid\mathcal F_1] E [ B ∣ F 1 ] ,并用样本空间分组解释。
查看解答 A A A 可测:它在 { H H , H T } \{HH,HT\} { H H , H T } 上恒为 1,在 { T H , T T } \{TH,TT\} { T H , T T } 上恒为 0。B B B 在同一组内仍会变化,例如 H H HH H H 上为 1、H T HT H T 上为 0,所以 B B B 不可测。无论第一次为 H H H 还是 T T T ,两次相同都只占相容结果的一半,故 E [ B ∣ F 1 ] = 1 / 2 \mathbb E[B\mid\mathcal F_1]=1/2 E [ B ∣ F 1 ] = 1/2 。这个条件均值在每个可辨认组内恒定,可以在时刻 1 确定;未来的实际 B B B 值还不能确定。
设 Z 0 , Z 1 , … Z_0,Z_1,\ldots Z 0 , Z 1 , … 独立同分布,均值为 0、方差为 1,令 U n = Z n + Z n + 1 U_n=Z_n+Z_{n+1} U n = Z n + Z n + 1 。求 U n U_n U n 的均值,以及滞后为 0、1 和至少 2 时的协方差,判断它是否弱平稳。为何相邻的 U n U_n U n 不能据此说成独立?
查看解答 由线性性,E [ U n ] = 0 \mathbb E[U_n]=0 E [ U n ] = 0 ;独立性使不同 Z Z Z 的协方差为 0,故 Var ( U n ) = 2 \operatorname{Var}(U_n)=2 Var ( U n ) = 2 。相邻两项 U n = Z n + Z n + 1 U_n=Z_n+Z_{n+1} U n = Z n + Z n + 1 、U n + 1 = Z n + 1 + Z n + 2 U_{n+1}=Z_{n+1}+Z_{n+2} U n + 1 = Z n + 1 + Z n + 2 共享一个 Z n + 1 Z_{n+1} Z n + 1 ,展开协方差后只留下 Var ( Z n + 1 ) = 1 \operatorname{Var}(Z_{n+1})=1 Var ( Z n + 1 ) = 1 。相隔至少 2 时没有共享项,协方差为 0。因此 γ ( 0 ) = 2 \gamma(0)=2 γ ( 0 ) = 2 、γ ( 1 ) = γ ( − 1 ) = 1 \gamma(1)=\gamma(-1)=1 γ ( 1 ) = γ ( − 1 ) = 1 ,其余滞后为 0;有限二阶矩、均值恒定和只依赖滞后三项都满足,所以弱平稳。相邻项协方差非零,在二阶矩有限的这里已经足以排除独立;平稳从来没有要求各时刻独立。