首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

CMU-概率图模型笔记-全- - 绝不原创的飞龙 - 博客园

发布日期:2026-03-26 来源:博客园作者:博客园

CMU 概率图模型笔记(全)

001:导论 🎯

  在本节课中,我们将要学习概率图形模型(PGM)的基本概念、课程安排以及学习这门高级课程的意义。我们将从为什么需要图形模型开始,探讨如何将领域知识融入数学模型,并初步了解衡量变量间关系的不同方法。

课程概述与安排 📅

  我很高兴看到这么多同学。这门课是机器学习领域最先进的技术课程之一。最初是为少数学生设计的,今年是课程开设的第15周年。第一年只有大约10名学生,而今年注册人数达到了160人,另有50人在等待名单上。

  这门课技术内容具有挑战性,每年都会收到关于课程难度的反馈。我无意降低难度,但希望你们都能从中学到很多,并取得好成绩。

  课程没有期中或期末考试。评分主要由几次作业(占50%)和一个主要的课程项目(占40%)构成。课程项目鼓励组成3-4人的团队,许多往届学生在此发表了他们的第一篇论文。

  课程会被录制,并会定期发布额外的阅读材料。每节课的内容都足够深入,可以作为一学期课程的指南。

课程资源与要求 📚

  以下是课程相关的后勤信息:

  • 课程主页:请定期访问以获取材料、更新和信息。
  • 教材:推荐两本教材作为理论基础和经典用例参考,但请注意它们不包含最新的解决方案。
  • 讨论区:使用Piazza论坛进行提问和课堂互动。
  • 作业提交:通过Gradescope提交。
  • 教学团队:我们有多位优秀的助教和课程助理Amy负责后勤问题。
  • 旁听:允许旁听,但需要填写表格。

  课程要求包括完成作业、参与课堂笔记记录以及完成团队项目。我们鼓励尽早组队。课程中还设有加分机制和中期反馈调查。

为什么需要图形模型?🤔

  如今,机器学习领域非常活跃,每年有数百种算法变体发表,很难全面掌握。本课程的目标之一,就是尝试用一个统一的框架来组织这些纷繁复杂的算法和模型实例。

  我们希望用一棵或几棵“树”来统一当前乃至未来几年出现的大多数算法实例,让你能更好地定位自己的研究,设计出更具通用性和影响力的算法。

  为了实现这个目标,我们需要从基础开始。大多数机器学习算法的核心动机源于对数据的统计建模。让我们看看如何使用概率模型来建模数据。

从基础概率模型到图形模型 📊

  假设我们有一个具有8个二元特征的数据实例。如何为其写出概率分布?最直接的方法是枚举所有可能的特征组合并给出每个组合的概率,即创建一个巨大的概率表。

  然而,这种方法存在明显缺陷:表格的行数随特征数量呈指数级增长,会迅速耗尽计算资源。此外,在学习和推断(例如计算某些事件的概率)时,也会面临巨大的复杂性挑战。

融入领域知识 🧬

  在现实中,数据实例通常对应着真实世界的现象。例如,考虑一个描述细胞信号通路的生物学问题,其中有8个分子随机变量(开或关)。生物学家会提供额外的知识:哪些分子在细胞表面,哪些在内部,以及它们之间的触发关系图。她还会指出某些分子(如受体A和基因H)在生命周期中从未相遇,因此不可能直接相互作用。

  作为数学家或计算机科学家,这些领域知识是否有用?答案是肯定的。这正是本课程的核心问题:如何将各种形式的领域知识整合到数学框架中,使模型表达式更具信息性、更简单、更可解释、更可操作。

  一言以蔽之,这引出了我们对图形模型的介绍。模型与表示它的图相结合,就成了图形模型。我们最关心的是图形模型内在的严谨含义。

定义“关系”:从模糊到严谨 🔍

  “关系”这个词很容易产生歧义。例如,一张基于《圣经》人物共现频率绘制的网络图,其边的定义(如“在同一页中出现”)就是主观的。不同的人使用相同的材料但采用不同的共现范围定义,可能会画出不同的图。

  因此,我们需要更严谨地定义随机变量之间的关系。关系可以有很多种解释:相关、独立、依赖、条件独立/依赖,甚至因果。我们需要定量地确定这些关系的存在与否。

  一种方法是探索使用单一数值摘要作为关系强度的度量。以下是一些常见的度量指标:

  • 皮尔逊相关系数:衡量线性依赖关系。公式为 corr(X, Y) = E[(X-μ_X)(Y-μ_Y)] / (σ_X σ_Y)。注意:若X与Y独立,则相关系数为0;但相关系数为0不能推出X与Y独立(例如,Y = X²)。
  • 互信息:基于Kullback-Leibler散度,衡量两个分布之间的差异,能捕捉非线性依赖。公式为 I(X; Y) = KL( P(X,Y) || P(X)P(Y) )。计算可能具有挑战性。
  • 希尔伯特-施密特独立性准则:使用核方法将分布嵌入到希尔伯特空间,然后计算距离,适用于更复杂的分布形式。
  • 偏相关:在给定其他变量(如Z)的条件下,衡量两个变量(X与Y)之间的线性关系。公式涉及计算残差之间的相关性。

  在多元高斯分布的假设下,偏相关可以通过精度矩阵(协方差矩阵的逆)方便地计算。此时,偏相关与条件独立性等价。

超越成对检验:全局视角 🌐

  即使我们有了衡量成对关系(边际的或条件的)的方法,直接为包含多个变量的大领域构建图形模型仍然面临操作上的困难。例如,对于三个变量:孩子的身高(X)、词汇量(Y)和年龄(Z)。如果仅进行成对独立性检验,可能会发现每对变量都相关,从而得到一个全连接的图。

  然而,根据我们的先验知识,更合理的模型可能是年龄(Z)同时影响身高(X)和词汇量(Y)。这说明,我们需要超越局部的成对检验,从全局条件独立性的角度来定义和构建图形模型。这正是我们将在第二讲中深入研究的条件独立图(也称为马尔可夫网络或无向图模型)。

  这类模型用途广泛,例如著名的伊辛模型,最初用于模拟原子自旋状态,后来被应用于图像建模。

课程路线图与总结 🗺️

  本节课我们一起探讨了图形模型的动机、基本思想以及定义变量间关系的挑战。以下是后续课程的简要路线图:

  • Lecture 2: 条件独立图:深入研究马尔可夫网络等无向图模型及其统计含义。
  • Lecture 3: 有向图模型:研究贝叶斯网络,探讨其因子化特性、可解释性(如因果)和计算优势。
  • Inference & Learning:用多讲篇幅深入探讨图形模型上的推断(如计算条件概率、最可能配置、采样)和学习(从数据中学习参数和结构,融入规则、奖励等丰富知识)。
  • Modern PGM:研究现代图形模型,展示其如何成为强化学习、深度学习、迁移学习等技术的统一框架。
  • Student-Selected Topics:本学期将实验保留部分课时,由同学们投票选择感兴趣的主题进行深入探讨。

图形模型的核心价值 💎

  最后需要明确:图形模型是一个领域或一种思维方式的名称,而不是一个特定模型的名称。它提供了一种语言,用于:

  • 交流领域知识和设计模型。
  • 组织和规划计算。
  • 进一步开发模型。

  其优势包括:

  • 表示优势:通过局部结构(超越成对)全局地构建模型,节省参数。
  • 模块化与可组合性:易于组合不同模块或研究成果。
  • 统一框架:贝叶斯推断等都可以视为在图形模型框架下引入额外节点和边。

  希望在本学期结束时,你们不仅能带走许多公式,更能掌握几个核心的“主方程”,并能根据具体问题插入不同的构建模块,从而高效地启动甚至完成你们的研究工作。

  我们周三见! 👋

002:无向图模型 📊

  在本节课中,我们将要学习概率图形模型中的一个重要类别——无向图模型。我们将探讨其基本定义、如何从图中读取独立性、以及一些经典的实际应用模型。

课程概述与回顾

  上一讲我们讨论了如何通过条件独立性测试(如偏相关、互信息)来判断两个随机变量之间的依赖关系。然而,当变量数量庞大时,这种“自底向上”地测试所有变量对及其条件集的方法在计算上是不可行的。

  本节中,我们将采用“自顶向下”的视角:首先定义一个图结构,然后探讨如何从该图中系统地“读出”它所蕴含的所有条件独立性关系。如果图与概率分布之间能建立良好的对应关系,那么通过图来构建模型将变得简单高效。

基本符号约定 📝

  在深入之前,我们先统一一些基本符号,这在统计学和机器学习领域尤为重要:

  • 随机变量:通常用大写字母(如 X)表示,其具体取值用小写字母(如 x)表示。
  • 随机向量:可表示为粗体大写字母 X 或带箭头的 \vec{X}。
  • 参数:通常用希腊字母表示,如 α, β, θ。

什么是无向图模型?

  一个无向图模型由一个无向图 G 定义。图中的节点代表随机变量,边代表变量之间的对称关联关系(非因果性)。该模型定义了这些随机变量联合概率分布的一种特定参数化形式。

  那么,图中的边具体意味着什么?它们对节点的联合配置有何影响?这就是本节课的核心。

动机与应用实例 🌅

  让我们通过一个实际问题来感受无向图模型的价值:图像语义分割。任务是将图像中的每个像素或图像块分类(例如,分为“天空”或“水”)。

  仅看一个孤立的图像块很难判断。但如果我们知道它在图像中的位置(例如,在顶部或邻*陆地),判断就会容易得多。这种“邻*区域标签倾向于一致”的常识,正是无向图模型可以自然表达的。

  具体做法是:将图像网格化,每个格点定义一个随机变量表示其标签。在相邻的格点(变量)之间连接一条边,并为这条边上的联合配置(如“同为天空”、“同为水”、“一水一天空”)分配一个数值。这个数值表达了我们对这种配置的“偏好”或“兼容性”,例如,赋予“标签相同”的配置更高的分数。

  这种思想广泛应用于多个领域:

  • 计算机视觉:图像去噪、分割。
  • 统计物理:伊辛模型描述原子自旋相互作用。
  • 计算生物学:蛋白质相互作用网络。
  • 自然语言处理:词性标注、主题模型。

形式化定义:吉布斯分布 ⚙️

  一个无向图模型(也称为马尔可夫随机场或吉布斯分布)的联合概率分布定义如下:

  给定一个无向图 G,我们首先找出其所有团。一个团是图中所有节点都相互连接的一个子集。极大团是指不能再添加任何其他节点而仍保持为团的团。

  对于每个团 c,我们定义一个势函数 φ_c。势函数是一个正的实值函数,其输入是该团中所有随机变量的某种联合配置 x_c。它衡量了该配置的“可能性”或“能量”,但本身不是概率。

  整个模型的联合分布由所有团上的势函数乘积归一化后得到:

  P(X) = (1/Z) * ∏_{c ∈ C} φ_c (x_c)

  其中,归一化常数 Z 称为配分函数:

  Z = ∑_{x} ∏_{c ∈ C} φ_c (x_c)

  对于连续变量,求和应替换为积分。

  为什么使用势函数而非概率?

  势函数提供了更大的灵活性。它可以是任何正数,便于注入人类知识(如“相邻像素标签相同的兼容性得分为10”)。直接将其定义为条件概率或边缘概率反而困难且不必要,因为势函数在因子分解中并不对应唯一的概率解释。

从图中读取独立性:马尔可夫性质 🔍

  无向图模型的核心价值在于,其图结构直接编码了随机变量间的条件独立性假设。以下是三种等价的马尔可夫性质定义:

  • 全局马尔可夫性:对于图中不相交的节点子集 A, B, C,如果 C 在图分离了 A 和 B(即所有连接 A 和 B 的路径都必须经过 C),则在概率分布中满足 A ⊥ B | C。
  • 局部马尔可夫性:一个节点 X_i,在给定其所有邻居节点(即马尔可夫毯)的条件下,独立于图中所有其他非邻居节点。
  • 成对马尔可夫性:对于两个没有边直接相连的节点 X_i 和 X_j,在给定所有其他节点的条件下,它们相互独立。

  这些性质为我们提供了一套从图结构直接推断独立性关系的规则。

图与分布的对应关系:I-map 🗺️

  为了建立图模型与概率分布之间的严格联系,我们引入 I-map 的概念。

  • 令 I(P) 为分布 P 中所有成立的条件独立性语句的集合。
  • 令 I(G) 为根据图的全局马尔可夫性质所能读出的所有条件独立性语句的集合。

  如果 I(G) ⊆ I(P),即图 G 中蕴含的所有独立性在分布 P 中都成立,则称图 G 是分布 P 的一个 I-map。

  重要性:如果一个分布 P 可以表示为基于图 G 的吉布斯分布,那么 G 一定是 P 的一个 I-map。这意味着,通过吉布斯分布的形式定义模型,我们能自动保证图结构所编码的独立性在分布中成立。这比直接通过数字定义分布并验证独立性要方便得多。

  哈默斯利-克利福德定理 进一步强化了这种对应关系:如果一个严格正的分布 P 满足图 G 是其 I-map,那么 P 一定可以表示为基于 G 的吉布斯分布形式。这为无向图模型的合理性提供了理论基础。

指数族形式与经典模型 🌡️

  在实际应用中,直接指定正的势函数有时不直观。更常用的形式是将其写为指数族形式,即对数线性模型:

  P(X) = (1/Z) * exp( -∑_{c ∈ C} E_c(x_c) )

  其中 E_c(x_c) 称为能量函数,可正可负。-E 可视为“得分”,得分越高(能量越低),该配置概率越大。这种形式与统计物理中的玻尔兹曼分布一致。

  以下是两个经典的无向图模型:

  • 伊辛模型:变量取值为 {+1, -1}。通常只定义单点势和相邻节点间的成对势。常用于建模二值图像或铁磁体自旋。
  • 波茨模型:伊辛模型的推广,变量可取 K (K>2) 个离散状态。常用于彩色图像分割或多类标签问题。

受限玻尔兹曼机:深度学习的先驱 🧠

  受限玻尔兹曼机 是一个两层结构的无向图模型,包含一层可见单元 v(对应观测数据,如图像像素)和一层隐藏单元 h(对应潜在特征或表示)。它是一个二分图,可见层和隐藏层内部无连接,只有层间有连接。

  其联合分布定义为:

  P(v, h) ∝ exp( -E(v, h) )

  E(v, h) = - (b^T v + c^T h + v^T W h)

  其中 W 是层间连接的权重矩阵,b 和 c 是偏置项。

  RBM 的关键性质

  • 条件独立性:给定可见层,所有隐藏单元条件独立;给定隐藏层,所有可见单元条件独立。即:
    P(h|v) = ∏_i P(h_i|v) 和 P(v|h) = ∏_j P(v_j|h)

  这一性质使得吉布斯采样等推断和学习算法变得非常高效,是后续深度信念网络等模型的基础。

条件随机场:考虑全局上下文的序列模型 📄

  条件随机场 是一种在给定观测序列 X 条件下,对标签序列 Y 进行建模的无向图模型(通常是链式结构)。与之前模型不同,CRF 是条件模型,直接对 P(Y|X) 建模。

  其形式为:

  P(Y|X) = (1/Z(X)) * exp( ∑_{i} λ_i f_i(Y, X) )

  其中 f_i(Y, X) 是特征函数,可以依赖于整个观测序列 X 和标签序列的局部(如相邻标签对 (Y_i, Y_{i-1}) 或单个标签 Y_i)。λ_i 是特征权重。

  优势:通过特征函数 f_i,CRF 能够灵活地融入长距离的、依赖于整个观测序列 X 的上下文信息,这在自然语言处理等任务中非常强大。

总结与要点 ✅

  本节课我们一起学习了概率图形模型的核心组成部分之一——无向图模型。以下是需要掌握的关键点:

  • 无向图模型(马尔可夫随机场)通过无向图定义变量间的对称关联,并用吉布斯分布表示联合概率。
  • 势函数定义在团的配置上,是模型表达先验知识或数据偏好的载体。
  • 图结构编码了条件独立性,主要通过全局、局部和成对马尔可夫性质来体现。
  • I-map 概念严格定义了图与概率分布之间的对应关系。哈默斯利-克利福德定理确立了这种表示的完备性。
  • 马尔可夫毯的概念在推断中极其有用,它允许我们将一个变量对其余所有变量的条件分布,简化为对其马尔可夫毯的条件分布。
  • 我们介绍了几个经典模型:伊辛模型、波茨模型、作为深度学习基石的受限玻尔兹曼机,以及广泛应用于序列标注的条件随机场。

  理解如何从图中读取独立性以及如何通过势函数构建模型,是掌握更复杂的概率推断和学习算法的基础。在接下来的课程中,我们将探讨如何在这些模型中进行参数学习和概率推断。

本文转载自博客园, 作者:博客园, 原文标题:《 CMU-概率图模型笔记-全- - 绝不原创的飞龙 - 博客园 》, 原文链接: https://www.cnblogs.com/apachecn/p/19773025。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅