墨与留白——一位测绘师的顿悟
寓言
崇山峻岭之间,有一位老测绘师,带着唯一的徒弟云游四方。
师傅有一只旧皮箱,里面整整齐齐码着墨锭、狼毫笔与泛黄的宣纸。他的规矩是:每到一地,只取恰好够用的一张纸——不多,不少。云游三十年,他的箱子从不见空,也从不见满。
徒弟跟在身后,心中暗忖:师傅是如何知道该带多少纸的?
某日,师徒二人来到一片荒漠。沙丘连绵,一望无际。师傅从箱中取出纸,裁下一条窄窄的纸带,卷好入箱。徒弟瞪大了眼睛:"师傅!这地方这么大,怎么就带这么点?"
师傅笑了笑:"你且看。"
第二日,他们进入了一片河网交错的三角洲。水道如蛛网,汊港似迷宫,连向导都迷失了方向。师傅在箱中翻找良久,最后取出一刀厚厚的纸,足足有平日十倍。徒弟更困惑了:"师傅,这地方再大,也比昨日的沙漠小得多啊!"
师傅头也不抬:"你且看。"
此后数月,徒弟留心观察,发现了师傅用纸的规律:
- 沙漠广阔却单调——沙丘连绵,形态相似,一张窄纸条便够了
- 河网弹丸之地却变化无穷——每条岔路、每处回流都不同,需要厚厚一叠
- 雪原苍茫而均匀——只需薄薄一张
- 古城街巷曲折、废墟残垣——纸用得极多
徒弟苦思不得其解。一夜露宿山巅,他望着满天繁星,忽然悟道:
"师傅,我懂了!"
"哦?"
"您用的纸量,不取决于地方有多大,而取决于那个地方的花样多不多!"
师傅停下脚步。
"花样多、不确定、猜不到——这就是'乱'。越乱的地方,越难用简单的语言描述,就需要越多的纸来记录。反过来说,如果一个地方板上钉钉、毫无意外,那一张纸都嫌多。"
师傅转过身,第一次露出赞许的神色:"那你说,该怎么量化这个'乱'呢?"
徒弟望着星空,沉吟片刻:
"若一种情况出现的概率是 p,它带来的'意外'大约正比于 log(1/p)……把所有可能情况的意外加权求和,便是那一地需要的纸量。不确定性的总量。"
师傅缓缓点头,从怀中取出一本泛黄的手抄本,封面上写着两个字——
《信息熵》。
"这本书,我本打算等你再走三十年路再给你。"
概念解释
信息熵(Information Entropy) 是香农(Claude Shannon)在 1948 年提出的概念,用于量化一个概率分布中不确定性的总量。
信息熵的本质是:描述一个随机变量平均需要多少信息量。
- 熵越高 → 随机变量的不确定性越大 → 越难预测
- 熵越低 → 随机变量越确定 → 越容易被压缩/描述
寓言 ↔ 概念对照表
| 寓言元素 | 对应概念 |
|---|---|
| 测绘师记录一地用纸量 | 用信息量描述随机变量 |
| 地形花样多、变化大 | 高概率分布 → 高熵 |
| 地形单调、一望无际 | 低概率分布 → 低熵 |
| 纸量 = 花样"意外"的加权求和 | $H(X) = -\sum_x p(x) \log p(x)$ |
| 概率 p 的意外 = log(1/p) | 信息量 $I(x) = -\log p(x)$ |
核心公式
信息量(Self-Information):单个事件携带的信息,与它发生的概率负相关。
$$I(x) = -\log_2 p(x)$$
信息熵(Information Entropy):随机变量 $X$ 的平均信息量。
$$H(X) = -\sum_{x \in \mathcal{X}} p(x) \log_2 p(x) = \mathbb{E}_{x \sim p}[-\log_2 p(x)]$$
熵的链式法则:联合熵与条件熵的关系。
$$H(X, Y) = H(X) + H(Y|X) = H(Y) + H(X|Y)$$
互信息(Mutual Information):两个变量共享的信息量。
$$I(X; Y) = H(X) - H(X|Y) = H(Y) - H(Y|X)$$
关键要点
- 熵的单位 是 bit(以 2 为底的对数),表示描述随机变量平均所需的最少二进制位数
- 最大熵原则:在没有额外信息时,应选择熵最大的分布——即让所有可能事件概率均等
- 熵与压缩:熵是数据压缩的理论下限,无法压缩到低于熵的平均码长
- 条件熵减少信息:知道一个变量的信息后,条件熵 $H(Y|X) \leq H(Y)$,即不确定性只会减少
- 机器学习中的应用:决策树的分裂准则(ID3、C4.5)、特征选择、朴素贝叶斯分类器、变分推断中的 ELBO 等都依赖熵的概念
参考文献
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal, 27(3), 379–423.
- Cover, T. M., & Thomas, J. A. (2006). Elements of Information Theory (2nd ed.). Wiley-Interscience.
- MacKay, D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press.