画影地图的匠人

寓言

在遥远的云岭国,有一位技艺精湛的画师,名叫林渡。他以绘制地形图闻名遐迩,但从不绘制那些人们已知的地方——他专画不可抵达之境

所谓不可抵达之境,是云岭国北境的一片迷雾山谷。传说那里有一座隐世之城,但从未有人真正踏入。旅人只能远远望见些许轮廓,带回些零碎的口信:有人说城中有高塔,有人说城门前有河流,有人说夜里有灯火。

这些口信杂乱、矛盾、不完整。林渡要做的事,就是根据这些碎片,还原那座城的真实模样。


林渡坐在工作室里,面前摆满了旅人的记录。他叹了口气:"这些人看到的,不过是透过迷雾的影子。每个人站在不同位置,看到的都不一样。有人把塔楼当成了灯塔,有人把河流当成了城墙......"

他翻开第一份记录,是老猎户写的:"雾气很浓,我看到三个尖顶。"

第二份是行商写的:"城门朝南,门前有护城河,水声很大。"

第三份是牧童写的:"晚上有光,一闪一闪的,像是星星落在了城里。"

林渡将这些碎片并排放好,陷入沉思。

"如果让我来画,"他自言自语,"我不会去猜那座城真正是什么样子——我先画一幅我自己觉得最可能的图。然后我把这幅图'讲给'旅人们听,看他们的口信和我画的是否吻合。如果不吻合,我就修改我的图,直到旅人们说'对,这就是我们看到的'。"

他找来一张空白羊皮纸,开始落笔。

"首先,那座城应该有一个主体结构......城中有塔楼,城门朝南......"他画了一个粗略的轮廓,然后停下来,审视自己的作品。

"这只是我的猜测。我需要知道它和'真相'差多少。"

林渡用了一种巧妙的方法:他假设旅人们说的每一句话都包含一些"线索",而他自己画的图也应该能"产生"类似的线索。如果他的图能产生的线索,和旅人们实际带回来的线索越接近,就说明他的图越接近真实。

他在羊皮纸的角落写下一些符号,用来衡量这种"接近程度"。


日子一天天过去。林渡不断修改他的地图。有时候他增加一座塔楼,有时候他改变城门的朝向,有时候他调整河流的宽度。每一次修改后,他都会重新计算他的图与旅人口信之间的"接近程度"。

有一天,一位年轻的学徒问他:"老师,你怎么知道什么时候该停下?"

林渡捋了捋胡须:"当我再也找不到办法让'接近程度'变得更大的时候。当我的图所能'产生'的线索,和旅人们实际带回来的线索,几乎完全一致的时候——那就是我能画出的最接近真相的地图了。"

学徒若有所思:"所以,您其实不是在'猜测'真相,而是在'逼近'真相?"

林渡笑了:"可以这么说。我承认我永远看不到那座城,但我可以用我自己的方式,一步步接近它。"

他放下画笔,看着那幅已经修改了无数次的地图。那座城的轮廓,已经和最初的设计截然不同——更复杂,更矛盾,却也更真实。

"这,就是我理解的画影地图之道,"林渡轻声说道,"不是去追寻绝对的真相,而是用最好的近似,一步步走向它。"


窗外,云岭国的晨雾渐渐散去。林渡将地图小心卷好,准备送去王宫。在羊皮纸的封口处,他郑重写下四个字:

变分推断


概念解释

变分推断(Variational Inference,VI) 是贝叶斯推断中的一种近似方法。当我们希望根据观测数据推断隐变量或参数的后验分布 $p(z \mid x)$ 时,这个后验分布往往无法直接计算(分母上的边缘似然 $p(x) = \int p(z,x)dz$ 可能涉及难以求解的积分)。

变分推断的核心思想是:将推断问题转化为优化问题。我们选择一个容易处理的参数化分布 $q(z;\nu)$(称为变分分布),通过优化变分参数 $\nu$ 来使 $q(z;\nu)$ 尽可能接近真实后验 $p(z \mid x)$。


寓言 ↔ 概念对照表

寓言元素对应的变分推断概念
不可抵达之境的隐世之城真实的后验分布 $p(z \mid x)$ —— 无法直接观测
旅人的口信(碎片化、矛盾的观察)观测数据 $x$ 或似然信息
林渡自己画的地图变分分布 $q(z;\nu)$ —— 参数化的近似
不断修改地图使其"产生"的线索与旅人口信吻合优化过程:最大化 ELBO / 最小化 KL 散度
停止修改的时机:接近程度无法再提升优化收敛
"用最好的近似一步步走向真相"变分推断的核心哲学

核心公式

变分推断的优化目标是最小化变分分布 $q(z;\nu)$ 与真实后验 $p(z \mid x)$ 之间的 KL 散度:

$$ KL(q(z;\nu) \| p(z \mid x)) = \int_z q(z;\nu) \log \frac{q(z;\nu)}{p(z \mid x)} dz $$

但由于分母 $p(x)$ 难以计算,我们转为最大化证据下界(ELBO)

$$ \text{ELBO}(\nu) = \mathbb{E}_q[\log p(z, x)] - \mathbb{E}_q[\log q(z;\nu)] $$

两者之间的关系为:

$$ \log p(x) = \text{ELBO}(\nu) + KL(q(z;\nu) \| p(z \mid x)) $$

由于 $\log p(x)$ 是常数(与 $\nu$ 无关),最大化 ELBO 等价于最小化 KL 散度。


关键要点

  1. 核心思想:将难以计算的贝叶斯后验推断问题转化为优化问题
  2. 变分分布:从一个参数化的简单分布族(如高斯分布)中选取,通过优化参数来拟合真实后验
  3. ELBO:可操作的优化目标,避免了难以计算的边缘似然项
  4. 收敛判断:当 ELBO 无法再提升(或 KL 散度无法再下降)时停止
  5. 与 MCMC 的区别:变分推断是近似方法,速度快但可能有偏差;MCMC 是渐进精确方法,速度慢但理论上可以无限接近真实分布
  6. 应用场景:主题模型(LDA)、变分自编码器(VAE)、贝叶斯神经网络等大规模概率模型

参考文献

  1. Blei, D. M., Kucukelbir, A., & McAuliffe, J. D. (2017). Variational Inference: A Review for Statisticians. Journal of the American Statistical Association, 112(518), 859-877.
  2. Kingma, D. P., & Welling, M. (2014). Auto-Encoding Variational Bayes. Proceedings of the 2nd International Conference on Learning Representations (ICLR).
  3. Mandt, S., McInerney, J., Abrol, F., Tahmasbi, R., Mathard, E., & Blei, D. M. (2017). Advances in Variational Inference. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(8), 2001-2016.
  4. 西山晴雪,《变分推断方法综述》,https://xishansnow.github.io/posts/46ae35f1
最后修改:2026 年 07 月 30 日
如果觉得我的文章对你有用,请随意赞赏