智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 在本节课中,我们将要学习概率图形模型(PGM)的基本概念、课程安排以及学习这门高级课程的意义。我们将从为什么需要图形模型开始,探讨如何将领域知识融入数学模型,并初步了解衡量变量间关系的不同方法。
我很高兴看到这么多同学。这门课是机器学习领域最先进的技术课程之一。最初是为少数学生设计的,今年是课程开设的第15周年。第一年只有大约10名学生,而今年注册人数达到了160人,另有50人在等待名单上。
这门课技术内容具有挑战性,每年都会收到关于课程难度的反馈。我无意降低难度,但希望你们都能从中学到很多,并取得好成绩。
课程没有期中或期末考试。评分主要由几次作业(占50%)和一个主要的课程项目(占40%)构成。课程项目鼓励组成3-4人的团队,许多往届学生在此发表了他们的第一篇论文。
课程会被录制,并会定期发布额外的阅读材料。每节课的内容都足够深入,可以作为一学期课程的指南。
以下是课程相关的后勤信息:
课程要求包括完成作业、参与课堂笔记记录以及完成团队项目。我们鼓励尽早组队。课程中还设有加分机制和中期反馈调查。
如今,机器学习领域非常活跃,每年有数百种算法变体发表,很难全面掌握。本课程的目标之一,就是尝试用一个统一的框架来组织这些纷繁复杂的算法和模型实例。
我们希望用一棵或几棵“树”来统一当前乃至未来几年出现的大多数算法实例,让你能更好地定位自己的研究,设计出更具通用性和影响力的算法。
为了实现这个目标,我们需要从基础开始。大多数机器学习算法的核心动机源于对数据的统计建模。让我们看看如何使用概率模型来建模数据。
假设我们有一个具有8个二元特征的数据实例。如何为其写出概率分布?最直接的方法是枚举所有可能的特征组合并给出每个组合的概率,即创建一个巨大的概率表。
然而,这种方法存在明显缺陷:表格的行数随特征数量呈指数级增长,会迅速耗尽计算资源。此外,在学习和推断(例如计算某些事件的概率)时,也会面临巨大的复杂性挑战。
在现实中,数据实例通常对应着真实世界的现象。例如,考虑一个描述细胞信号通路的生物学问题,其中有8个分子随机变量(开或关)。生物学家会提供额外的知识:哪些分子在细胞表面,哪些在内部,以及它们之间的触发关系图。她还会指出某些分子(如受体A和基因H)在生命周期中从未相遇,因此不可能直接相互作用。
作为数学家或计算机科学家,这些领域知识是否有用?答案是肯定的。这正是本课程的核心问题:如何将各种形式的领域知识整合到数学框架中,使模型表达式更具信息性、更简单、更可解释、更可操作。
一言以蔽之,这引出了我们对图形模型的介绍。模型与表示它的图相结合,就成了图形模型。我们最关心的是图形模型内在的严谨含义。
“关系”这个词很容易产生歧义。例如,一张基于《圣经》人物共现频率绘制的网络图,其边的定义(如“在同一页中出现”)就是主观的。不同的人使用相同的材料但采用不同的共现范围定义,可能会画出不同的图。
因此,我们需要更严谨地定义随机变量之间的关系。关系可以有很多种解释:相关、独立、依赖、条件独立/依赖,甚至因果。我们需要定量地确定这些关系的存在与否。
一种方法是探索使用单一数值摘要作为关系强度的度量。以下是一些常见的度量指标:
在多元高斯分布的假设下,偏相关可以通过精度矩阵(协方差矩阵的逆)方便地计算。此时,偏相关与条件独立性等价。
即使我们有了衡量成对关系(边际的或条件的)的方法,直接为包含多个变量的大领域构建图形模型仍然面临操作上的困难。例如,对于三个变量:孩子的身高(X)、词汇量(Y)和年龄(Z)。如果仅进行成对独立性检验,可能会发现每对变量都相关,从而得到一个全连接的图。
然而,根据我们的先验知识,更合理的模型可能是年龄(Z)同时影响身高(X)和词汇量(Y)。这说明,我们需要超越局部的成对检验,从全局条件独立性的角度来定义和构建图形模型。这正是我们将在第二讲中深入研究的条件独立图(也称为马尔可夫网络或无向图模型)。
这类模型用途广泛,例如著名的伊辛模型,最初用于模拟原子自旋状态,后来被应用于图像建模。
本节课我们一起探讨了图形模型的动机、基本思想以及定义变量间关系的挑战。以下是后续课程的简要路线图:
最后需要明确:图形模型是一个领域或一种思维方式的名称,而不是一个特定模型的名称。它提供了一种语言,用于:
其优势包括:
希望在本学期结束时,你们不仅能带走许多公式,更能掌握几个核心的“主方程”,并能根据具体问题插入不同的构建模块,从而高效地启动甚至完成你们的研究工作。
我们周三见! 👋
在本节课中,我们将要学习概率图形模型中的一个重要类别——无向图模型。我们将探讨其基本定义、如何从图中读取独立性、以及一些经典的实际应用模型。
上一讲我们讨论了如何通过条件独立性测试(如偏相关、互信息)来判断两个随机变量之间的依赖关系。然而,当变量数量庞大时,这种“自底向上”地测试所有变量对及其条件集的方法在计算上是不可行的。
本节中,我们将采用“自顶向下”的视角:首先定义一个图结构,然后探讨如何从该图中系统地“读出”它所蕴含的所有条件独立性关系。如果图与概率分布之间能建立良好的对应关系,那么通过图来构建模型将变得简单高效。
在深入之前,我们先统一一些基本符号,这在统计学和机器学习领域尤为重要:
一个无向图模型由一个无向图 G 定义。图中的节点代表随机变量,边代表变量之间的对称关联关系(非因果性)。该模型定义了这些随机变量联合概率分布的一种特定参数化形式。
那么,图中的边具体意味着什么?它们对节点的联合配置有何影响?这就是本节课的核心。
让我们通过一个实际问题来感受无向图模型的价值:图像语义分割。任务是将图像中的每个像素或图像块分类(例如,分为“天空”或“水”)。
仅看一个孤立的图像块很难判断。但如果我们知道它在图像中的位置(例如,在顶部或邻*陆地),判断就会容易得多。这种“邻*区域标签倾向于一致”的常识,正是无向图模型可以自然表达的。
具体做法是:将图像网格化,每个格点定义一个随机变量表示其标签。在相邻的格点(变量)之间连接一条边,并为这条边上的联合配置(如“同为天空”、“同为水”、“一水一天空”)分配一个数值。这个数值表达了我们对这种配置的“偏好”或“兼容性”,例如,赋予“标签相同”的配置更高的分数。
这种思想广泛应用于多个领域:
一个无向图模型(也称为马尔可夫随机场或吉布斯分布)的联合概率分布定义如下:
给定一个无向图 G,我们首先找出其所有团。一个团是图中所有节点都相互连接的一个子集。极大团是指不能再添加任何其他节点而仍保持为团的团。
对于每个团 c,我们定义一个势函数 φ_c。势函数是一个正的实值函数,其输入是该团中所有随机变量的某种联合配置 x_c。它衡量了该配置的“可能性”或“能量”,但本身不是概率。
整个模型的联合分布由所有团上的势函数乘积归一化后得到:
P(X) = (1/Z) * ∏_{c ∈ C} φ_c (x_c)
其中,归一化常数 Z 称为配分函数:
Z = ∑_{x} ∏_{c ∈ C} φ_c (x_c)
对于连续变量,求和应替换为积分。
为什么使用势函数而非概率?
势函数提供了更大的灵活性。它可以是任何正数,便于注入人类知识(如“相邻像素标签相同的兼容性得分为10”)。直接将其定义为条件概率或边缘概率反而困难且不必要,因为势函数在因子分解中并不对应唯一的概率解释。
无向图模型的核心价值在于,其图结构直接编码了随机变量间的条件独立性假设。以下是三种等价的马尔可夫性质定义:
这些性质为我们提供了一套从图结构直接推断独立性关系的规则。
为了建立图模型与概率分布之间的严格联系,我们引入 I-map 的概念。
如果 I(G) ⊆ I(P),即图 G 中蕴含的所有独立性在分布 P 中都成立,则称图 G 是分布 P 的一个 I-map。
重要性:如果一个分布 P 可以表示为基于图 G 的吉布斯分布,那么 G 一定是 P 的一个 I-map。这意味着,通过吉布斯分布的形式定义模型,我们能自动保证图结构所编码的独立性在分布中成立。这比直接通过数字定义分布并验证独立性要方便得多。
哈默斯利-克利福德定理 进一步强化了这种对应关系:如果一个严格正的分布 P 满足图 G 是其 I-map,那么 P 一定可以表示为基于 G 的吉布斯分布形式。这为无向图模型的合理性提供了理论基础。
在实际应用中,直接指定正的势函数有时不直观。更常用的形式是将其写为指数族形式,即对数线性模型:
P(X) = (1/Z) * exp( -∑_{c ∈ C} E_c(x_c) )
其中 E_c(x_c) 称为能量函数,可正可负。-E 可视为“得分”,得分越高(能量越低),该配置概率越大。这种形式与统计物理中的玻尔兹曼分布一致。
以下是两个经典的无向图模型:
受限玻尔兹曼机 是一个两层结构的无向图模型,包含一层可见单元 v(对应观测数据,如图像像素)和一层隐藏单元 h(对应潜在特征或表示)。它是一个二分图,可见层和隐藏层内部无连接,只有层间有连接。
其联合分布定义为:
P(v, h) ∝ exp( -E(v, h) )
E(v, h) = - (b^T v + c^T h + v^T W h)
其中 W 是层间连接的权重矩阵,b 和 c 是偏置项。
RBM 的关键性质:
这一性质使得吉布斯采样等推断和学习算法变得非常高效,是后续深度信念网络等模型的基础。
条件随机场 是一种在给定观测序列 X 条件下,对标签序列 Y 进行建模的无向图模型(通常是链式结构)。与之前模型不同,CRF 是条件模型,直接对 P(Y|X) 建模。
其形式为:
P(Y|X) = (1/Z(X)) * exp( ∑_{i} λ_i f_i(Y, X) )
其中 f_i(Y, X) 是特征函数,可以依赖于整个观测序列 X 和标签序列的局部(如相邻标签对 (Y_i, Y_{i-1}) 或单个标签 Y_i)。λ_i 是特征权重。
优势:通过特征函数 f_i,CRF 能够灵活地融入长距离的、依赖于整个观测序列 X 的上下文信息,这在自然语言处理等任务中非常强大。
本节课我们一起学习了概率图形模型的核心组成部分之一——无向图模型。以下是需要掌握的关键点:
理解如何从图中读取独立性以及如何通过势函数构建模型,是掌握更复杂的概率推断和学习算法的基础。在接下来的课程中,我们将探讨如何在这些模型中进行参数学习和概率推断。
