根据个体学习器的生成方法分成2类
个体学习器间存在强依赖关系,必须串行生成序列化方法
Boosting
个体学习器间不存在强依赖关系,可同时生成并行化方法
Bagging
Random Forest
Bagging
自助采样法
给定包含m个样本的数据集,先随机取出一个放入采样集,再放回初始数据集,经过m次随机采样操作,得到含m个样本的采样集
自助采样T个含m个训练样本的采样集,然后基于每个采样集训练出一个基学习器,再将这些基学习器进行结合
降低方差
在决策树,神经网络等易受样本扰动的学习器上效用更明显
多分类,回归
Random Forest
随机森林
Bagging的一个扩展变体
在决策树为基学习器构建Bagging集成的基础上,进一步在决策树的训练过程中引入随机属性选择
传统决策树在选择划分属性时是在当前节点的属性集合中选择一个最优属性
RF,基决策树每个节点,先从该节点属性集合中随机选一个包含k个属性的子集,然后从子集选择最优属性用于划分
Bagging多样性只来自样本扰动,RF来自样本和自属性扰动
RF基学习器少,性能低,随着基学习器数目增加,收敛到更低泛化误差