中值定理、导数的全局约束与 Taylor 估计
上一章把导数解释成一点附近的最佳线性近似:当 h 很小时,f(a+h)−f(a) 大约是 f′(a)h。这给了我们“瞬时变化率”,却留下一个很实际的问题:已知从 a 走到 b 的总变化,能不能确定中间某一刻真的承担了这份平均变化?
先拿位移作比喻。两小时一共走了 12 千米,平均速度是每小时 6 千米。直觉会说“总有一刻速度正好是 6”,但直觉本身不够用:速度会不会跳变?行程有没有突然断开?实分析要把这些疑问写成条件,再从条件中推出结论。本章的主角正是这条桥梁:端点的平均变化率,必由某个内点的瞬时变化率实现。
以下定理反复出现同一组假设:函数在闭区间 [a,b] 上连续,并在开区间 (a,b) 内可导,其中 a<b。闭区间上的连续性负责让最大值、最小值真正取到;开区间内的可导性负责把内部极值变成导数为零。两件事缺一件,结论都可能失效。
从局部极值出发
Fermat 定理先划清边界
设 c 是定义域内部的一点。若存在 r>0,使得对所有足够靠近 c 的定义域内点 x 都有
f(x)≤f(c),
就说 f 在 c 处有局部最大值;把不等号反向得到局部最小值。注意“局部”只比较一小段邻域,和整个定义域上的最大、最小不是同一件事。
Fermat 定理说:若 c 是局部极大点或局部极小点,且 f 在 c 处可导,那么
f′(c)=0.
这里有三个不能吞掉的词:局部极值点、定义域内部、可导。它并没有说“导数为零就一定有极值”,也没有说所有极值点都可导。
我们证明局部最大值的情形。对充分靠近 c 的 x>c,有 f(x)−f(c)≤0,分母为正,于是
x−cf(x)−f(c)≤0.
让 x→c+,右导数不大于零。对 x<c,同一个分子仍不大于零,但分母为负,故
x−cf(x)−f(c)≥0.
让 x→c−,左导数不小于零。可导意味着左右导数相等;一个数既不大于零又不小于零,只能是零。局部最小值时不等号全部反过来,推理完全相同。
这条必要条件很有用,也很容易被用过头。f(x)=x3 在 0 处有 f′(0)=0,但函数穿过 时仍在上升, 不是极值点。反过来, 在 处有局部最小值,左右导数却分别为 与 ,所以没有导数。端点也不能套用: 在 的最小值出现在 ,但 并不是可供双侧比较的内部点。
找极值时,f′(c)=0 只是在可导内点上给出的候选条件。还必须检查不可导的内点和区间端点;更关键的是,候选点还需要用符号变化、函数比较或后面的高阶导数判定来确认。
Rolle 定理让水平切线无处可躲
现在设 f 在 [a,b] 上连续、在 (a,b) 内可导,并且端点等高:
f(a)=f(b).
那么存在某个 c∈(a,b),使得
f′(c)=0.
这就是 Rolle 定理。它说的不是曲线“看上去应该拐一下”,而是:只要这条曲线完整地连着两个等高端点,并且内部处处有切线,就必有一条内部切线水平。
证明把上一章学过的极值定理和 Fermat 定理接起来。连续函数在闭区间 [a,b] 上能取到最大值和最小值。若两个值相同,函数在整个区间恒为常数,任取内点都满足导数为零。若二者不同,端点又取同一个值,那么最大值或最小值中至少有一个不可能只落在端点,必在某个内点 c 取到。Fermat 定理立刻给出 f′(c)=0。
三个假设都有工作要做。下面的例子不是为了记反例,而是为了看清证明在哪一步会停住。
平均变化率为什么会落在中间
减去割线,问题就变成 Rolle 形态
对 a<b,端点之间的平均变化率是
b−af(b)−f(a).
它是连接 (a,f(a)) 和 (b,f(b)) 的割线斜率。我们真正要证明的是,某条内部切线会与这条割线平行。
Lagrange 中值定理:若 f 在 [a,b] 上连续、在 (a,b) 内可导,则存在 c∈(a,b),使得
f′(c)=b−af(b)−f(a).
证明的想法很值得保留。令 L(x) 是经过两个端点的直线:
L(x)=f(a)+b−af(b)−f(a)
不要直接盯着 f,而是观察曲线到割线的竖直差:
g(x)=f(x)−L(x).
因为割线经过两个端点,g(a)=g(b)=0。g 继承了连续性和可导性,故 Rolle 定理给出某个 c∈(a,b) 满足 。再把导数展开:
0=g′(c)=f′(c)−
这正是所求结论。所谓“中值定理的技巧”,核心并不是猜中值点,而是把一般的端点高度差减掉,使两端变成同高。
例题:中值点未必显眼,但可以验算
在区间 [0,2] 上考虑
f(x)=x3−3x+1.
函数是多项式,因此满足中值定理的两项正则性条件。端点增量为
f(2)−f(0)=3−1=2,
所以平均变化率是 2/(2−0)=1。另一方面,
f′(x)=3x2−3.
令 f′(c)=1,得到
3c2−3=1,
c=32
或 c=−2/3。只有 2/3,因此它是本区间内的中值点。代回导数确有
f′(32
与端点平均变化率一致。定理只保证至少一个中值点;方程若有多个解,要再用区间筛掉不合格的根。
导数界会变成函数值的界
对同一区间中的任意 x<y,中值定理给出某个 ξ∈(x,y),使
f(y)−f(x)=f′(ξ)(y−x).
因此,如果对区间内每个点都有
m≤f′(t)≤M,
那么
m(y−x)≤f(y)−f(x)≤M(y−x).
特别地,若 ∣f′(t)∣≤M,便有
∣f(y)−f(x)∣≤M∣y−x∣.
这叫作 Lipschitz 型估计。中值点 ξ 往往找不到,也完全不必找;只要它被困在已知导数界的区间内,整个函数差就被控制住了。
例如,对任意实数 s,t,有
∣sins−sint∣≤∣s−t∣.
当 s=t 时,对 sinx 在两个数之间的闭区间应用中值定理,得到 sins−sint=cosξ(。再用 取绝对值即可; 时两边同为零。这个不等式把“正弦的导数不超过 1”翻译成“任何两处的函数值不会相差得比横坐标更快”。
两个函数怎样共用一个中值点
Lagrange 中值定理把一个函数的总增量和导数联系起来。若同时有两个函数,能够比较的往往不是各自的平均变化率,而是两者增量的比例。
Cauchy 中值定理:若 f,g 在 [a,b] 上连续、在 (a,b) 内可导,则存在 c∈(a,b),使得
(g(b)−g(a))f′(c)=(f(b)
这个交叉相乘的版本永远有意义。只有在额外知道
g(b)=g(a)且g′(c)=0
时,才可以除过去,写成
g′(c)f′(c)
分式看起来更熟悉,却比交叉相乘多了两项非零要求;不能把它们默认省略。
证明仍是“造出端点相等的函数”。记
Δf=f(b)−f(a),Δg=g(b)−g(a),
并构造
H(x)=Δg[f(x)−f(a)]−Δf[g(x)−g
直接代入可见 H(a)=H(b)=0。Rolle 定理给出 H′(c)=0,而
H′(c)=Δgf′(c)−Δfg
恰好就是结论。
例题:比例不是分别取两个中值点
令 f(x)=ex,g(x)=e2x,区间取 。端点增量为
f(ln2)−f(0)=1,
g(ln2)−g(0)=3.
Cauchy 中值定理保证某个 c∈(0,ln2) 满足
3ec=2e2c.
由于 ec>0,可以除以 ec,从而
ec=23,
c=ln23.
确实有 0<ln(3/2)<ln2。这里的关键是两个函数使用同一个 c;分别对 f、g 使用普通中值定理,只会各得到一个可能不同的点,无法推出上面的比例关系。
用一个内点约束整段函数
导数的符号决定单调方向
设 I 是一个区间,f 在 I 上可导。对任意 x<y 且 x,y∈I,整个 仍在 中,故可以使用中值定理。于是存在 ,使
f(y)−f(x)=f′(c)(y−x).
因为 y−x>0,导数的符号会直接传给函数差:
最后一行也可单独读作一个常用结论:如果 f′=0 在一个区间上处处成立,那么任意两点 x<y 满足 f(y)−f(x)=,所以函数在整个区间只有一个值。由此还能得到:若 在区间 上处处成立,则 在 上是常值函数。
方向不能倒过来。严格递增的 x3 在 0 处仍有导数 0,所以“严格递增 ⇒f′>0 处处成立”是错的。另一个容易漏掉的量词是“整个区间”:在 上定义 ()和 (),则 在其定义域每一点都成立,函数却不是常值,因为定义域分成了两段。中值定理要求能把任意两点之间的整段放进定义域,区间这个条件正是在保证这件事。
导数可以不连续,却不能跳过中间值
连续函数有介值性质:函数从一个值走到另一个值时,不会跳过中间高度。导数未必连续,但仍有一个令人意外的限制。
设 f 在开区间 I 上可导,取 u<v 且 u,v∈I。若实数 λ 严格介于 与 之间,那么存在 ,使得
f′(c)=λ.
这就是导数的 Darboux 性质。为证明它,不妨设
f′(u)<λ<f′(v),
并令
q(x)=f(x)−λx.
于是 q′(u)<0、q′(v)>0。q 在 上连续,因而有最小值。 表明从 向右走一小步,函数值会低于 ; 表明从 向左走一小步,函数值也会低于 。最小值不可能在任一端点,只能在内部某点 取得。Fermat 定理给出 ,于是 。若端点导数大小相反,交换两端的角色即可。
“有介值性质”不等于“连续”。考虑
f(x)={x2sin(1/x),0,
在 0 处,差商为 xsin(1/x),极限是 0,所以 f′(0)=0。在 时,
f′(x)=2xsin(1/x)−cos(1/x).
取 xn=1/(2πn) 与 yn=1/((2n,它们都趋于 ,但 、。因此 在 处不连续。尽管如此,它仍不能像阶跃函数那样从负值直接跳到正值而漏掉 ;Darboux 性质在这里仍然成立。
Taylor 多项式把局部信息逐层叠起来
上一章的一阶线性化是
f(x)=f(a)+f′(a)(x−a)+o(∣x
如果在 a 处还知道二阶、三阶直到 n 阶导数,就希望用一个多项式把这些局部变化都记下来。令 f(0)=f。满足
Pn(k)(a)=f(k)(a),k
的多项式只能是
Pn(x)=k=0∑n
它叫作 f 在 a 点的 n 阶 Taylor 多项式。系数不是约定出来的:若写成 Pn(x)=∑,对它求 阶导数再令 ,只有第 项留下,得到 ,所以 。
为把条件说清楚,若 f 在包含 a 的某个开区间上有 n 阶连续导数,那么 Taylor 多项式有高阶局部精度:
f(x)−Pn(x)=o(∣x−a∣n)
这句话只谈 x 靠近 a 时的相对误差;它没有给某个固定 x 的具体误差,也没有说把所有 Taylor 多项式无限相加必定恢复原函数。固定点的误差需要下一节的余项,关于无限级数的问题则要等到函数项级数部分再处理。
高阶导数如何判别局部极值
Taylor 展开还解释了常见的“高阶导数判别”。设 f 在 a 的某个邻域内有 n 阶连续导数,并且 n 是最小的正整数,满足
f(1)(a)=f(2)(a)=
那么在 a 附近,主导项是
f(x)−f(a)≈n!f(n)(a)
由余项的严格版本可得以下结论:n 为奇数时,(x−a)n 在两侧异号,a 不是局部极值点;n 为偶数时,f 给出局部最小值, 给出局部最大值。二阶导数判别只是 的特例。
这也是充分判定,不是万能机器。若所有阶导数在 a 都为零,规则没有结论。例如
ϕ(x)={e−1/x2,
在 0 处有局部最小值,且每一阶导数都等于 0。对 x=0 反复求导会得到“1/x 的多项式乘 e”的形式;指数衰减快过任何幂,因此这些表达式在 时都趋于零,可归纳得到 。所有有限阶 Taylor 多项式都是零,却不能据此说 在 附近恒为零。
余项给近似一张可核对的收据
现在取包含 a 与 x 的开区间 I,设 f(n+1) 在 I 上存在,且 。Taylor 定理给出某个介于 与 之间的 ,使
f(x)=Pn(x)+(n+1)!
最后一项记为 Rn(x),叫作 Lagrange 型余项:
Rn(x)=(n+1)!f
ξ 通常无法预先写出,但它的位置很明确:就在 a 和 x 之间。这已经足够做估计。若在线段两端之间有
∣f(n+1)(t)∣≤B,
则
∣Rn(x)∣≤(n+1)!B∣x−
这才是“近似得不错”的可检查版本。没有导数界时,图像看起来贴近、前几位小数碰巧相同,都不能替代误差证明。
证明为什么仍然是 Rolle 定理
为看清余项来自哪里,先假设 a<x;x<a 时在反向区间上做同样的论证。定义
A=(x−a)n+1(n+1)![f(x
再构造
H(t)=f(t)−Pn(t)−
按 A 的定义,H(a)=H(x)=0。同时,Pn 与 f 在 处的前 阶导数相同,所以
H′(a)=H′′(a)=⋯=H
先对 H 在 [a,x] 上使用 Rolle 定理,得到 H′ 的一个内部零点;而 H′(a),于是可继续对 使用 Rolle 定理。这样重复 次,得到某个 ,满足
H(n+1)(ξ)=0.
由于 Pn 的 n+1 阶导数为零,(t−a)n+ 的 阶导数为 ,故
0=f(n+1)(ξ)−A.
把 A=f(n+1)(ξ) 代回其定义,就得到余项公式。Taylor 定理看似比中值定理复杂,骨架却没有变:构造一个在端点相等的辅助函数,再反复把“整体的零”压到内部导数上。
例题:三次近似究竟误差多大
用
P3(x)=1+x+2x2
近似 ex,并限制 ∣x∣≤1/4。因为 ex 的每一阶导数仍是 e,Taylor 余项给出
ex−P3(x)=24e
其中 ξ 位于 0 与 x 之间。由 ∣x∣≤1/4 可知 ξ≤1/4,所以
∣ex−P3(x)∣≤24
使用 e1/4<1.285,得到
∣ex−P3(x)∣<2.1×10−4.
这里提高阶数确实压低了 ∣x∣n+1,但这不是无条件的承诺。区间变大时,幂次会放大;如果高阶导数的上界本身很大,也会抵消阶乘带来的好处。选近似阶数时,要同时检查距离 ∣x−a∣ 和下一阶导数的界。
从变化率走向累积量
本章把上一章的一点导数扩展成了整段结论:Fermat 定理把内部极值压到导数为零;Rolle 定理把等高端点压到一条水平切线;中值定理进一步让端点平均变化率在中间实现。于是导数的符号能判断单调性,导数的大小能控制函数差,导数即使不连续也不能跳过中间值。Taylor 定理则把这种“中间点存在”的机制变成具体的近似误差。
接下来要把视角从变化率转向累积量。积分同样会从一个直觉开始:把许多小区间上的局部贡献加起来。但这一次,不能只依赖某些取样点看起来接近;我们要用分割、上和与下和给“总量”一个能经受证明的定义。
自检练习
- 令 p(x)=x3−4x。在 [−2,2] 上使用 Rolle 定理,找出所有由定理保证的中值点。
先核对端点:
p(−2)=0=p(2).p 是多项式,故在闭区间连续、在内部可导,可以用 Rolle 定理。求导得
p′(x)
- 只用中值定理证明:对每个实数 x,都有 ex≥1+x,且等号只在 x=0 成立。
当 x>0 时,对 et 在 [0,x] 上使用中值定理,存在 ξ∈(0,x),使
- 对 f(x)=x2、g(x)=x3 在区间 [1, 上使用 Cauchy 中值定理,求一个中值点,并核对比例式。
端点增量为
f(3)−f(1)=8,g(3)−g(1)=26.又有 、。Cauchy 等式给出
- 设 f 在开区间 (−2,2) 上可导,并且 f′(−1/2)<−2、。证明存在两个内点,一个处导数为 ,另一个处导数为 。
0 与 1 都严格介于 f′(−1/2) 和 f′(1/2) 之间。对 应用导数的 Darboux 性质,得到某个
- 用三阶 Taylor 多项式在 0 附近近似 cosx。证明当 ∣x∣≤0.3 时,近似 1−x2/2 的误差不超过 。
在 0 处,cosx 的前四个导数值依次为
1, 0, −1, 0.所以三阶 Taylor 多项式虽然写到三次项,实际为
P
- 判断 r(x)=x4−2x6 在 0 处是否有局部极值,并分别用高阶导数判别和直接估计核对。
函数的前三阶导数在 0 都为零,而
r(4)(0)=24>0.第一个非零导数是偶数阶且为正,高阶导数判别说明 0 是局部最小点。
直接核对也很清楚: