拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【Python机器学习】零基础掌握小样本分类中 LDA 与 QDA 的选型思路

样本很少时,分类边界越灵活越好吗?假如每类只有几十条训练记录,QDA 允许两类拥有不同的协方差结构,但估计的参数也更多。仅凭训练集上的一条漂亮曲线,不能判断它是否比 LDA 更适合未来数据。本文用两组二维模拟数据演示选型:一组让两类共享协方差,另一组故意让协方差不同。先在训练集做相同划分的重复交叉验证,再依据事先声明的简化规则选模型,最后只看一次留出测试集。模拟结果用于说明判断过程,不是 LDA 或 QDA 的通用排名。文章目录小样本分类首先要检查哪些条件LDA 与 QDA 的关键假设有什么不同何时选择线性边界或二次边界用两种协方差情形进行对照实验结果不稳定时如何排查与调整总结小样本分类首先要检查哪些条件在考虑算法名称前,先问每一类究竟有多少训练样本、特征维数是多少、不同类的形状是否明显不同。本文每种情形总共只使用 120 条训练记录,二分类各 60 条,另有 780 条独立测试记录。二维设置是为了看清边界,并不代表真实问题只有两个特征。检查项为什么重要可能采取的动作每类样本数QDA 需要分别估计每类协方差;样本过少时估计容易波动。分层划分,报告每类数量;必要时简化边界或考虑正则化。特征维数与相关性维数接近类内样本数,协方差可能接近奇异。先排查冗余特征;不要只凭训练准确率选择 QDA。类别分布形态LDA 和 QDA 都建立在类条件分布及协方差假设之上。用分布图和验证分数检查近似是否可用,而不是机械套用正态假设。数据划分方式同一主体的重复记录若跨训练和验证,分数可能虚高。真实项目按主体或时间重新设计验证,不照搬本例随机划分。本例以平衡准确率作为指标,避免只看总体命中率。两类数量相同并不意味着这个指标只能用于本例;
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门