拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从联合分布到条件分布:Gaussian-Process-Regression-Tutorial三步推导高斯过程回归预测方程

从联合分布到条件分布Gaussian-Process-Regression-Tutorial三步推导高斯过程回归预测方程【免费下载链接】Gaussian-Process-Regression-TutorialAn Intuitive Tutorial to Gaussian Processes Regression项目地址: https://gitcode.com/gh_mirrors/ga/Gaussian-Process-Regression-TutorialGaussian-Process-Regression-Tutorial 是 Jie Wang 编写的高斯过程回归入门教程配套一份可交互运行的 Jupyter 笔记本 gpr_tutorial.ipynb 和一篇正式论文的 LaTeX 源码位于 latex/arXiv/ 目录。许多新手在接触高斯过程回归时最困惑的往往不是高斯过程是什么而是那张神秘的预测方程究竟从哪来。本文将沿教程的核心脉络把推导拆成清晰的三步先建立联合分布再套用 MVN 条件分布定理最后代入核矩阵得到高斯过程回归预测方程。全程不烧脑用直觉 少量公式带你走完这条路。为什么高斯过程回归的预测方程值得认真推导回归任务的本质是根据观测点找出一条函数并对新输入做出预测。普通回归方法只给一个答案而高斯过程回归的独特优势是它给出一整个分布——预测均值告诉你答案在哪预测方差告诉你答案有多可信。这份不确定性正是贝叶斯优化、主动学习等进阶应用的基石。教程 README.md 中反复强调一个核心观点高斯过程是所有可能函数上的概率分布。一旦你手里有这个分布取均值就是预测函数取方差就是置信区间。而从分布到预测本质上就是从联合分布走向条件分布的过程。推导前的三块基础砖在动笔之前先确认三块拼图缺一不可基础一多元高斯分布MVN由均值向量和协方差矩阵完全刻画一个多元高斯分布完全由均值向量 $\mu$ 和协方差矩阵 $\Sigma$ 决定。协方差矩阵的对角线是每个变量自己的方差非对角线则描述变量两两之间的相关程度。下图展示了二维高斯的联合分布与两个边际分布的关系基础二核函数定义点与点之间的相似度高斯过程回归常用平方指数核RBF / 高斯核$k(x_i, x_j) \sigma^2 \exp\left(-\frac{1}{2l^2}|x_i - x_j|^2\right)$。两点越近协方差越大越远协方差趋近于 0。它保证了输入相近的点函数值也相近——这正是平滑函数的来源。基础三联合分布切一刀就是条件分布而且条件分布仍是高斯这是整个推导的钥匙。对二维高斯曲面沿某个变量方向切一刀得到的截面曲线依然是高斯分布左边是三维视角下固定 $x_1$ 后的切片右边是该切片在二维平面上对应的一维高斯条件分布。固定已知变量、推断未知变量正是回归想做的事。第一步把观测点和预测点放进同一个联合分布假设我们已有观测输入 $\mathbf{X}$ 与观测输出 $\mathbf{y}$想预测新位置 $\mathbf{X}*$ 上的函数值 $\mathbf{f}*$。在高斯过程回归中我们假设观测值与预测值共同服从一个多元高斯分布$$\begin{pmatrix}\mathbf{y} \ \mathbf{f}*\end{pmatrix} \sim \mathcal{N}\left(\mathbf{0},; \begin{pmatrix}\mathbf{K} \sigma_n^2\mathbf{I} \mathbf{K}* \ \mathbf{K}*^T \mathbf{K}{**}\end{pmatrix}\right)$$其中 $\mathbf{K}\kappa(\mathbf{X},\mathbf{X})$、$\mathbf{K}*\kappa(\mathbf{X},\mathbf{X})$、$\mathbf{K}{**}\kappa(\mathbf{X},\mathbf{X}_*)$ 都是由核函数算出的协方差矩阵$\sigma_n^2$ 是观测噪声方差。下图直观地展示了已知红色观测 → 推断蓝色新点的联合建模思路这一步的要点是不要把观测和预测分开看而是把它们当成同一个高维高斯随机向量的不同分量。第二步套用 MVN 条件分布定理现在问题变得很纯粹我们已知这个联合分布且已经观测到了 $\mathbf{y}$想知道 $\mathbf{f}*$ 的条件分布 $p(\mathbf{f}* \mid \mathbf{y}, \mathbf{X}, \mathbf{X}_*)$。教程在这里直接调用了概率论中著名的MVN 边缘分布与条件分布定理把联合分布的分块形式代入定理立刻得到 eqn. 2.19见 gpr_tutorial.ipynb 的 Math 章节$$\mathbf{f}* \mid \mathbf{y}, \mathbf{X}, \mathbf{X}* \sim \mathcal{N}\left(\mathbf{K}*^T\mathbf{K}^{-1}\mathbf{y},; \mathbf{K}{**} - \mathbf{K}*^T\mathbf{K}^{-1}\mathbf{K}*\right)$$注意观察条件均值的形态$\mathbf{K}_*^T$ 衡量新点与观测点的相似度再乘以 $\mathbf{K}^{-1}\mathbf{y}$——相似度越高观测对预测的影响越大。直觉上完全合理。第三步代入核矩阵得到高斯过程回归预测方程现实中我们只能观测到带噪声的 $y f(x) \epsilon$所以把上一步中的 $\mathbf{K}$ 换成含噪声的 $\mathbf{K} \sigma_n^2\mathbf{I}$就得到了教科书 GPML 中的预测方程eqn. 2.22–2.24$$\bar{\mathbf{f}}* \mathbf{K}*^T\left[\mathbf{K} \sigma_n^2\mathbf{I}\right]^{-1}\mathbf{y}$$$$cov(\mathbf{f}*) \mathbf{K}{**} - \mathbf{K}*^T\left[\mathbf{K} \sigma_n^2\mathbf{I}\right]^{-1}\mathbf{K}*$$均值是所有可能函数在 $\mathbf{X}_*$ 处取值的加权平均就是预测曲线方差刻画每个预测点的不确定性离观测点越远、方差越大。教程还给出了基于 Cholesky 分解的高效实现流程避免直接求逆用 notebook 亲手验证预测方程纸上得来终觉浅。教程的 gpr_tutorial.ipynb 用不到 30 行代码实现了上述全部流程采样 20 个观测点、计算核矩阵、Cholesky 分解求 $\alpha$、再算出测试点的均值与方差。运行后你会看到预测均值曲线平滑地穿过观测点灰色区域±2 倍标准差在数据稀疏处明显变宽——不确定性量化一目了然。从后验中抽取 40 条函数曲线它们全部钉在观测点上总结三个值得带走的直觉高斯过程回归预测方程 联合分布 条件分布定理。三步推导中没有引入任何新魔法只是把熟悉的概率论定理用在了核矩阵上。均值看趋势方差看信心。预测方程同时给出答案与不确定度这正是高斯过程回归区别于普通回归的核心价值。公式可以忘结构要记住相似度核矩阵、加权求逆、更新条件分布——抓住这条主线即使公式细节淡忘你也能向别人讲清楚高斯过程回归预测方程从何而来。想深入了解每一步的数学细节与可视化代码直接打开仓库中的 gpr_tutorial.ipynb 逐节运行论文级的正式推导与排版则见 latex/arXiv/elsarticle-template-num.tex。从联合分布到条件分布三步之后高斯过程回归对你将不再神秘。【免费下载链接】Gaussian-Process-Regression-TutorialAn Intuitive Tutorial to Gaussian Processes Regression项目地址: https://gitcode.com/gh_mirrors/ga/Gaussian-Process-Regression-Tutorial创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门