)
目录什么是集成学习1.学习器相关的基本定义2 .集成学习的方法3 .并行计算 4 .串行计算 boosting实例给定如下表所示训练数据。假设个体学习器由x输入和y输出产生其阈值v判定正反例的分界线使该分类器在训练数据集上分类误差率最低。y1为正例y-1为反例reference:什么是集成学习集成学习ensemble learning通过构建并结合多个学习器来完成学习任务是一大类模型融合策略和方法的统称。1.学习器相关的基本定义弱学习器对于二分类而言弱分类器的准确率可能比较低例如60%65%等等但它们的最低要求是一定要大于50%即随机预测的准确率。强学习器…识别准确率很高并能在多项式时间内完成的学习算法同质集成 集成中包含同一类型的学习器基学习器对应的算法基学习算法异质集成继承中包含不同的类型的学习器组件学习器2 .集成学习的方法串行集成方法这种方法串行地生成基础模型如AdaBoost。串行集成的基本动机是利用基础模型之间的依赖。通过给错分样本一个较大的权重来提升性能。并行集成方法这种方法并行地生成基础模型如Random Forestbagging。并行集成的基本动机是利用基础模型的独立性因为通过平均能够较大地降低误差。3 .并行计算 1. 实例 bagging的基本过程A从原始样本集中抽取训练集。每轮从原始样本集中使用Bootstraping的方法抽取n个训练样本在训练集中有些样本可能被多次抽取到而有些样本可能一次都没有被抽中。共进行k轮抽取得到k个训练集。k个训练集之间是相互独立的B每次使用一个训练集得到一个模型k个训练集共得到k个模型。注这里并没有具体的分类算法或回归方法我们可以根据具体问题采用不同的分类或回归方法如决策树、感知器等C对分类问题将上步得到的k个模型采用投票的方式得到分类结果对回归问题计算上述模型的均值作为最后的结果。所有模型的重要性相同为了让更好地理解bagging方法这里提供一个例子X表示一维属性Y表示类标号1或-1测试条件当xk时y当xk时yk为最佳分裂点下表为属性x对应的唯一正确的y类别现在进行5轮随机抽样结果如下每一轮随机抽样后都生成一个分类器然后再将五轮分类融合:对比符号和实际类我们可以发现在该例子中Bagging使得准确率可达90%.2.随机森林随机森林:bagging 决策树(基学习器)随机森林随机主要体现在两个方面一个是样本抽取随机另一个是每棵树的M个特征的随机选取。森林多个决策树进程学习形成森林每棵树的按照如下规则生成1如果训练集大小为N总样本为MNM)对于每棵树而言随机且有放回地从训练集中的抽取N个训练样本这种采样方式称为bootstrap sample方法作为该树的训练集2如果每个样本的特征维度为M指定一个常数mM随机地从M个特征中选取m个特征子集每次树进行分裂时从这m个特征中选择最优的3每棵树都尽最大程度的生长并且没有剪枝过程。思考题为什么要随机抽样训练集如果不进行随机抽样每棵树的训练集都一样那么最终训练出的树分类结果也是完全一样的这样的话完全没有bagging的必要为什么要有放回地抽样有放回地抽样才能保证每次抽取时可能的概率时一样的即为了达到独立同分布可保证每一颗决策树都是相互独立的而随机森林最后分类取决于多棵树弱分类器的投票表决这种表决应该是求同因此使用完全不同的训练集来训练每棵树这样对最终分类结果是没有帮助的这样无异于是盲人摸象。随机的好处随机森林中的“随机”就是指的上述的两个随机性即二重随机性。两个随机性的引入对随机森林的分类性能至关重要。由于它们的引入使得随机森林不容易陷入过拟合并且具有很好得抗噪能力比如对缺省值不敏感。填空题Bagging属于______集成的基本动机是利用基础模型的(__独立性___)A串行B并行4 .串行计算 1.Boostingboosting是一族可将弱学习器提升为强学习器的算法这族算法的工作机制类似1先从初始训练集训练出一个基学习器2再根据基学习器的表现对训练样本分布进行调整使得先前基学习器做错的训练样本在后续受到更多关注3基于调整后的样本分布来训练下一个基学习器4重复进行上述步骤直至基学习器数目达到事先指定的值T最终将这T个基学习器进行加权结合。boosting实例给定如下表所示训练数据。假设个体学习器由x输入和y输出产生其阈值v判定正反例的分界线使该分类器在训练数据集上分类误差率最低。y1为正例y-1为反例具体过程可以看太长了懒~~~https://www.zhihu.com/collection/213299143思考题试述随即森林为什么比决策树Bagging集成的训练速度快首先理解决策树Bagging与随机森林的区别随机森林不仅会随机样本还会在所有样本属性中随机几种出来计算。这样每次生成分类器时都是对部分属性计算最优速度会比Bagging计算全属性要快。BaggingBoosting二者之间的区别1样本选择上Bagging训练集是在原始集中有放回选取的从原始集中选出的各轮训练集之间是独立的。Boosting每一轮的训练集不变只是训练集中每个样例在分类器中的权重发生变化。而权值是根 据上一轮的分类结果进行调整。2样例权重Bagging使用均匀取样每个样例的权重相等Boosting根据错误率不断调整样例的权值错误率越大则权重越大。3预测函数Bagging所有预测函数的权重相等。Boosting每个弱分类器都有相应的权重对于分类误差小的分类器会有更大的权重。4并行计算Bagging各个预测函数可以并行生成Boosting各个预测函数只能顺序生成因为后一个模型参数需要前一轮模型的结果Reference:https://www.cnblogs.com/zongfa/p/9304353.htmlhttps://www.zhihu.com/collection/213299143