拓冰建站拓冰建站
首页 / 资讯中心 / 正文

潜在类别分析(LCA)核心原理与实操指南

1. 先弄明白这件事你手里有一堆分类变量想找的是“人”的类别还是“变量”的维度手里有一批分类数据比如问卷里的“是/否”“没有/偶尔/经常”你想把人分成几类——这大概是潜在类别分析LCA, latent class analysis最常被想起的使用场景。干这行时间长了你会发现很多研究者其实在还没分清“分类”和“维度”之前就已经开始跑模型了结果往往是把因子分析当成聚类用或者把聚类结果硬说成潜在类别。所以这篇文章第一件事就是先把LCA真正想解决的问题说清楚。LCA这个东西统计软件里跑起来很快但它背后藏着一套和传统聚类完全不同的逻辑。传统聚类比如K-means是从“距离”出发点跟点近的就归到一起LCA则是从“概率模型”出发假设你看到的那些指标背后其实隐藏着一个你观测不到的类别变量这个变量把人群切成了若干个互斥的子群体。注意这个表述“隐藏”“观测不到”“互斥”这是理解LCA的三把钥匙。隐藏潜在类别是不能被直接测量的只能通过多个观测指标去推断观测不到它不像“性别”“年级”那样能直接问出来必须用统计模型去估计互斥每个人只能属于其中一个类别不是“有点属于A又有点像B”的模糊状态——虽然归属过程带概率但最终潜变量本身是类别型。我见过太多人把LCA和“分层聚类”“谱聚类”混在一起谈其实两者差别非常大。聚类算法是数据探索工具它不做统计推断也不输出“这个类别是否显著优于另一个类别”的证据LCA则是确认性更强的模型方法它能告诉你某个K类模型的拟合好不好、各类别占比多少、每个指标在不同类别上的响应概率是多少这些信息可以直接写进论文的方法部分和结果部分。这些年我在帮同事和学生看稿子时发现一个高频误区明明指标是连续变量比如量表总分、反应时却硬套LCA。LCA的标准场景是分类指标连续指标应该走潜在剖面分析LPAlatent profile analysis或者更广义的因子混合模型。虽然很多软件里两者语法几乎一样但概念上必须分清不然后面解释模型时很容易卡壳。这篇文章的读者我默认是三类人一是刚接触LCA的硕博研究生论文需要做“类型分析”二是用问卷或行为数据做用户分群的市场/产品研究人员三是想把手头分类变量做成“亚型”“分型”的临床或社科研究者。无论哪类人核心诉求都一样把LCA跑明白、跑稳并且知道每一步为什么这样做。2. LCA的数学内核潜在类别概率与条件概率以及那个常被忽略的局部独立性2.1 一个模型两个概率LCA本质上是一个概率混合模型。先看一个最常见的公式形式P(Y_i y) Σ_{k1}^{K} π_k × Π_{j1}^{J} P(y_ij | C_i k)这个式子如果你之前没接触过会觉得全是字母但其实拆开就两样东西π_k潜在类别概率。意思是“你随便从人群里拉一个人他属于第k类的概率有多大”。比如三分类模型里可能是0.55、0.30、0.15加起来等于1。它直接告诉你每个类别的规模占比。P(y_ij | C_i k)条件概率也叫响应概率。意思是“如果一个人属于第k类他在第j个指标上选某一个选项的概率”。比如某一类人在“是否吸烟”上回答“是”的概率是0.85另一类人只有0.05这个差异就成了给类别起名字的依据。我经常用一个生活类比来解释这两个概率。假设一个学校有两类学生一类经常去图书馆一类经常去操场。类别概率就是“两类学生各占多少比例”条件概率就是“某一类学生里有多少人会在周六早上选择去图书馆”。你手里只有每个学生“周六早上去了图书馆还是操场”的记录看不见他到底是哪类人但通过大量记录可以反推这个学校大概率存在两类人并且能估算出每类人的比例和偏好。这就是LCA干的事用可观测的指标分布反推不可观测的潜在类别归属。2.2 局部独立性假设为什么它是理解LCA的关键LCA有一个核心假设叫局部独立性local independence在同一潜在类别内部各个观测指标之间彼此独立。这个假设为什么重要因为LCA的逻辑是“类别可以解释全部关联”。也就是说不同指标之所以会相关是因为它们背后共享同一个潜在类别变量一旦把这个类别变量固定住指标之间就不应该再有残余关联了。举个例子如果吸烟和饮酒两个指标显著相关LCA的解释是“有那么一群人既吸烟又饮酒的概率本来就高另一群人本来就低”。当你把人群按潜类别分开后在每个类别内部吸烟和饮酒变成了独立事件——一个吸烟的人不比一个不吸烟的人更容易饮酒。这个假设不是形式主义。如果违背了局部独立性后果很直接模型会倾向于提取更多类别用“多分类”来硬吃那些指标间的残余相关。我在实际数据里很多次看到某个模型原本3类解释得很好但只因为在指标中塞进了两个高度相似的题目比如“最近两周是否失眠”和“最近两周是否入睡困难”局部独立被严重违背BIC一路指向5类6类分类结果却完全没法解释。如果你怀疑指标间存在局部依赖有几个处理思路第一检查是否有两个指标在语义上高度重叠考虑合并或删掉一个第二在Mplus等支持残差相关的框架中给特定指标之间加上局部依赖参数第三如果局部依赖集中在某两个指标采用“分包”parceling策略先把高度相关的指标合成一个指标再进模型。不过我个人经验是能在指标选择阶段就避免就不要在建模阶段硬处理设计阶段想清楚永远比事后修补省力。3. 为什么说LCA比K-means聚类和因子分析更能“讲清楚”一类人3.1 LCA与K-means的核心差异直接看一个对比表你就能明白两者在思维层面就有根本不同对比维度K-meansLCA分组依据距离欧氏距离等概率分布混合模型类别归属硬分类每个点只能归一类软分类每个个案给出属于各类的概率指标类型通常是连续变量分类变量标准LCA至少类别数确定肘部图、轮廓系数主观性强BIC、aBIC、LMR-LRT、BLRT等统计检验是否做推断否纯描述是有参数估计和假设检验对异常值的敏感度比较敏感相对稳健基于模型分布输出结果聚类标签、质心坐标潜在类别概率、条件概率、后验概率K-means并不是错而是“不可检验”。你很难回答“为什么是三类而不是四类”这个问题只能拿肘部图去“说服”自己和别人。LCA的BIC、BLRT这些指标至少给了你一个相对客观的决策依据。另外K-means对名义变量非常不友好你就算把“从不/偶尔/经常”编码成0/1/2K-means也会把这个编码当成等距数值处理0和1的距离被算成和1和2一样这个假设往往是站不住的。而LCA直接把每个指标的类别水平拿来做概率估计不存在这种“顺序距离”的伪假设。3.2 LCA与因子分析类型还是维度因子分析和LCA的差别也经常被混淆。一句话总结因子分析找的是“维度”LCA找的是“类型”。维度是连续的每个人在某个维度上都有高低之分类型是离散的每个人只能归属到某个类别里。打个比方人格的“内外倾”是一个维度你可以在1到7分之间有一个值但“这人是社交型还是独处型”就是一个类型判断。维度适合回答“多与少”的问题类型适合回答“是哪一种”的问题。如果你的理论假设是“存在几种截然不同的行为模式”那LCA的思路是天然匹配的如果你觉得“所有人都在同一批连续特质上程度不同”因子分析才是对的选择。3.3 什么时候必须用LCA综合来看下面几种情况请优先考虑LCA指标都是分类变量且你不想强行把它们当连续变量理论上你认为存在几个异质性的子群体而不是一条连续轴上程度不同你希望类别归属本身能作为后续分析的自变量或分组变量你需要用统计证据BIC、LRT等来支撑“分成几类最合适”这个决定。我自己的经验是LCA最出效果的时候是那些“指标多、分类水平简单、理论上有明显分型”的数据。比如健康风险行为的组合、消费习惯的组合、学习策略的组合。它天然适合做“人群画像”类的研究这也是它在市场细分和用户分群领域用得越来越多的原因。4. 跑模型之前的准备样本量、指标选择和数据格式决定后面少踩一半坑4.1 样本量到底要多大LCA的样本量要求没有绝对标准因为它取决于指标数量、分类水平数和潜在类别的可分性。可分性好各类别条件概率差异很大时300人也能跑得很稳可分性差1000人也未必理想。但有几个经验法则可以参考总样本量建议不低于300这是多数模拟研究给出的底线最小潜在类别的比例不要低于5%也就是最小类至少有大约几十人否则估计不稳定指标越多需要的样本量越大。5个指标和20个指标对样本量的需求完全不是一个量级。我建议在正式分析前用模拟数据做一遍“诊断”按你预期的类别数和条件概率生成一批数据用同样的模型拟合看看能否稳定恢复出真实类别。这一步虽然看起来多花时间但能提前暴露“指标太少导致类别不可识别”或“类别占比太小导致收敛失败”这类问题。4.2 指标选择不是越多越好而是每个都要有信息量指标选择的黄金法则是每个指标都要在理论上能区分不同类别。如果一个指标在所有类别上的条件概率几乎一样它对分类就没有贡献还会稀释其他指标的区分力。经验上标准LCA的指标数量3到8个比较合适。太少比如2个会导致模型识别不足或类别数严重低估太多比如20个以上会导致局部独立性问题高发、收敛缓慢、参数非常多。如果你手里确实有20个题目建议先做因子分析或根据理论做维度合并把每个维度的总分或典型题目作为LCA指标而不是把20个原始题直接塞进模型。还要注意指标的测量水平。LCA标准版本处理的是二分类、名义分类和有序分类指标。如果你有一个指标是有序分类的比如“从不、偶尔、经常、总是”在Mplus里用CATEGORICAL声明即可模型会当作有序分类处理poLCA这类R包则统一按名义分类处理有序信息会被忽略。选工具之前先看清这点不然白白损失顺序信息。4.3 数据格式和缺失值处理数据格式这件事看着细碎但直接影响你能不能跑出结果。R的poLCA包要求所有指标都是因子类型factor数值型0/1编码不行必须转换成因子Mplus要求指标用CATEGORICAL声明缺失值通常用-999表示缺失值处理方面如果缺失比例低比如低于5%Full Information Maximum Likelihood就能处理如果某个指标缺失比例很高建议先考虑它是不是该被剔除。还有一个经常被忽略的细节指标分类水平的一致性。同一个指标在不同个案上一定要有相同的类别水平集。比如“年级”变量有的人编码是1/2/3有的人编码混入了一个4如果不统一模型在估计条件概率时会出现奇怪的0或1极端值而且很难被察觉。5. 核心步骤类别数从1试到5看什么指标、怎么权衡才能确定“恰好的K”5.1 一组必须一起看的指标确定潜在类别个数是LCA分析的灵魂步骤。任何单一指标都不足以做决定必须组合起来看。下表是我每次分析都要整理的一张汇总表指标含义判断方向Log-likelihood (LL)模型拟合的对数似然值越大越好但复杂模型天然更大不能单独比较AIC信息准则越小越好倾向选取更复杂模型常高估类别数BIC信息准则越小越好相对保守中文论文中最常报告aBIC样本量调整BIC折中方案模拟研究中表现较好LMR-LRTLo-Mendell-Rubin调整似然比检验比较K类和K-1类p0.05说明K类显著优于K-1类BLRTBootstrap似然比检验p0.05说明K类显著优于K-1类更稳健Entropy分类质量范围0到1越接近1越好通常要求≥0.8最小类别占比最小的潜在类别占总样本比例经验上最好不低于5%这里必须强调BIC是最先看的但不是唯一能拍板的。BIC在样本量很大时会倾向于选择较多的类别aBIC有时又过于宽松。LMR和BLRT提供了“增加一个类别是否真的更好”的统计检验。实际操作中我看到很多正确的模型选择是BIC/aBIC在某一个K值处趋于平缓BLRT在K类时还显著、到K1类时不显著加上Entropy可以接受就选K。5.2 我的综合决策流程这些年我做LCA确定类别数基本沿着下面这个流程走你也可以把它当成一个可复用的清单从1类开始逐次增加到5类或6类记录每类的LL、AIC、BIC、aBIC、Entropy、各类别占比以及LMR和BLRT的p值先看BIC和aBIC找出它们下降趋势开始放缓的区间再看LMR/BLRT找到最后一个显著的K。比如3类显著、4类不显著那3类是候选检查Entropy是否≥0.8低于这个值要谨慎说明分类混淆度偏高检查每个类别的最小占比出现2%左右的小类别方案基本可以直接放弃最关键的一步把候选模型的每个类别在指标上的条件概率可视化用常识和理论去审视——类别是否有意义是否能命名是否存在“为了分类而分类”的碎类别第6步是最不该跳过的。我见过一个数据强行分成5类统计指标都还行但其中一个类别只占3%而且在这个类别里所有指标的概率都介于两类之间说白了就是“骑墙的人”被单独切了出来。这种类别在论文里根本没法解释审稿人一眼就能看出来是过度提取。5.3 三个类别方案的决策示例举一个真实分析中的决策片段。某研究用5个二分类风险行为指标做人分型1到4类的拟合指标如下类别数LLAICBICaBICEntropyLMR pBLRT p最小类别占比1类-1586.203182.403207.103188.601.00——100%2类-1455.802937.602987.202948.000.820.0010.00131.2%3类-1401.502835.002909.702849.800.890.0120.00114.8%4类-1380.002800.002899.702819.100.930.2140.0584.2%从BIC看4类略优于3类2899.7 vs 2909.7但差距不大从LMR和BLRT来看4类的检验都不显著说明4类相比3类没有显著改善再看最小类别占比4类的最小类别只有4.2%明显偏小。综合分析3类方案是稳健选择。这就是“统计指标互相核验”的典型过程。6. 类别解释与命名从条件概率矩阵到给人起一个有说服力的名字6.1 条件概率矩阵怎么读确定类别数之后模型会输出一个条件概率矩阵。每一行是一个潜在类别每一列是一个指标选项。例如5个二分类指标的三类别模型条件概率矩阵可能长这样类别吸烟是饮酒是网络成瘾是逃课是睡眠不足是类别占比类别10.050.150.100.050.3055.2%类别20.200.750.650.250.7030.0%类别30.850.950.800.700.9014.8%读这个表的技巧是横向对比看每个类别内部的概率轮廓。类别1几乎在所有风险行为上都低可以叫“低风险型”类别2在饮酒、网络成瘾、睡眠不足上明显高吸烟和逃课中等可以叫“中高社交外露型”类别3在所有指标上都处于高位是“高风险复合型”。命名需要结合你的研究领域和指标含义来做数学只负责告诉你“这几类人在指标上就是不一样”具体差异是什么得靠人眼和领域知识去解读。6.2 命名的几个原则给潜在类别命名看似简单实则很考察分析者的功力。我的三条经验名字要能概括该类别最突出的指标特征最好用一个“标签化”的词让人一听就有画面命名要尽量与已有文献或理论呼应如果文献里已有类似概念比如“外化问题型”“内化问题型”优先沿用方便学术对话避免用过于空泛的词比如“类型A”“组1”这类名字没有任何信息量。有时条件概率差异不大命名就会很尴尬。这时候要回头检查指标选择——如果每个指标都拉不开差距说明这个类别的差异化信息不足模型可能不应该选这个类别数或者该指标本身就不是好的分型指标。6.3 后验概率与个案归属模型除了给出类别层面的结果还会为每个个案计算后验概率——这个人属于类别1、类别2、类别3的概率分别是多少。三者加起来等于1。实际操作中我们一般取后验概率最大的那个类别作为该个案的最可能类别这个过程叫“modal assignment”相当于把软分类变成硬标签。但这个转换是有信息损失的如果某个个案在类别1上概率只有0.45在类别2上是0.40你把它硬归到类别1误差风险就比较大。因此一定要检查分类质量指标。除了整体Entropy更细一点的做法是看每个类别内部的平均后验概率。具体来说把所有最终被归为类别1的人挑出来算他们后验概率的平均值这个平均后验概率最好不低于0.70如果低于0.60说明这个类别的成员归属非常模糊分类结果不可靠。6.4 论文中该怎么报告LCA结果按我审稿的经验一篇合格的LCA结果汇报至少要包含这些内容模型比较表格列出不同类别数至少K-1、K、K1这几个的LL、AIC、BIC、aBIC、Entropy、LMR和BLRT的p值最终模型的类别占比条件概率矩阵或者用图展示各类别的条件概率轮廓每个类别的平均后验概率或整体Entropy各类别命名的理由以及简要的理论解读。表格是最常用的呈现方式但条件概率轮廓图折线图横轴是指标纵轴是概率每条线是一个类别在可视化上有不可替代的优势审稿人和读者一眼就能看清类别之间的差异。Mplus的PLOT指令和R的ggplot都能做这个图。7. 一个完整的实操案例用R和Mplus各跑一遍三类别LCA7.1 案例背景假设你调查了500名大学生收集了5个行为指标是否吸烟、是否频繁饮酒、是否网络成瘾倾向、是否有逃课行为、是否睡眠不足。5个指标均为二分类0否1是。理论上认为大学生可以被分成几种不同的行为模式类型用LCA来验证。7.2 R语言poLCA包实操R里最常用的LCA工具是poLCA包它对指标类型的支持是分类变量二分类、多分类都可以。跑一遍核心流程library(poLCA) # 模拟一份数据作为演示实际分析直接读入你的数据即可 set.seed(1234) n - 500 # 真实潜类别标签只是模拟参考分析时不需要 true_class - sample(1:3, n, replace TRUE, prob c(0.55, 0.30, 0.15)) # 根据条件概率生成5个指标 smoke - rbinom(n, 1, ifelse(true_class 1, 0.05, ifelse(true_class 2, 0.20, 0.85))) drink - rbinom(n, 1, ifelse(true_class 1, 0.15, ifelse(true_class 2, 0.75, 0.95))) internet - rbinom(n, 1, ifelse(true_class 1, 0.10, ifelse(true_class 2, 0.65, 0.80))) absent - rbinom(n, 1, ifelse(true_class 1, 0.05, ifelse(true_class 2, 0.25, 0.70))) sleep - rbinom(n, 1, ifelse(true_class 1, 0.30, ifelse(true_class 2, 0.70, 0.90))) demo - data.frame(smoke, drink, internet, absent, sleep) # poLCA要求所有指标都是因子 demo - as.data.frame(lapply(demo, as.factor)) # 定义模型公式cbind()列出全部指标~1表示暂不考虑协变量 f - cbind(smoke, drink, internet, absent, sleep) ~ 1 # 拟合1到4类模型每个类别数做20次随机起始值 models - lapply(1:4, function(k) { poLCA(f, data demo, nclass k, nrep 20, maxiter 5000) }) # 对比AIC和BIC选出最佳类别数 sapply(models, function(m) m$aic) sapply(models, function(m) m$bic) # 以3类模型为例查看核心结果 best - models[[3]] best$P # 类别概率三个类别的占比 best$probs # 条件概率每个指标在三个类别上的响应概率 best$predclass # 每个个案的最可能类别标签 best$posterior # 每个个案的后验概率矩阵代码里几个容易踩的细节说一下nrep 20表示做20次随机起始值搜索。poLCA对起始值敏感跑一次太容易掉进局部最优解20次起步我习惯设到50maxiter 5000是为了确保迭代足够充分默认值在复杂模型下可能不够如果数据里指标是数值型0/1编码必须转factor否则结果完全不对。读结果时best$P是类别占比best$probs返回每个指标在每个类别下每个水平的条件概率。比如best$probs$smoke就是一个3行2列的矩阵每一行对应一个类别两列分别是“否”和“是”的概率。需要说明的是poLCA不自带BLRTLMR检验也需要自己写bootstrap循环或换用Mplus。日常快速探索用R正式论文需要报告LMR/BLRT时我一般会转到Mplus跑一遍正式结果。7.3 Mplus实操Mplus是LCA分析用得最广泛的商业软件之一语法简洁输出规范。三类别LCA的核心语法如下TITLE: LCA demo DATA: FILE IS lca_data.dat; VARIABLE: NAMES ARE smoke drink internet absent sleep; CATEGORICAL ARE smoke drink internet absent sleep; USEVARIABLES ARE smoke drink internet absent sleep; CLASSES c(3); ANALYSIS: TYPE MIXTURE; ESTIMATOR MLR; STARTS 100 20; LRTSTARTS 100 20 100 20; OUTPUT: TECH1 TECH8; PLOT: TYPE PLOT3; SERIES smoke drink internet absent sleep; SAVEDATA: FILE IS class3.txt; SAVE CPROBABILITIES;逐个参数说CLASSES c(3)是核心指定潜在类别为3类。要比较不同类别数时只需要改这里分别跑一遍TYPE MIXTURE告诉Mplus这是一个混合模型LCA属于其中一种ESTIMATOR MLR是稳健极大似然估计指标是分类变量时稳健标准误很有用STARTS 100 20表示100组随机起始值最终保留20组做优化。模拟研究和实际分析中这个数值太小容易错过全局最优解LRTSTARTS 100 20 100 20是为BLRT设置起始值搜索参数TECH8输出优化历史如果发现loglikelihood没有稳定重复出现几次说明可能没收敛到全局最优。Mplus结果中需要重点看几个地方FINAL CLASS COUNTS AND PROPORTIONS看各类占比RESULTS IN PROBABILITY SCALE看条件概率MODEL FIT INFORMATION看AIC/BIC/EntropyVUONG-LO-MENDELL-RUBIN和BOOTSTRAP LIKELIHOOD RATIO TEST看LMR和BLRT的p值。7.4 结果汇报示例假设3类模型最终被确定为最佳方案汇报表格可以这样组织类别占比吸烟是饮酒是网络成瘾是逃课是睡眠不足是类别155.2%0.050.150.100.050.30类别230.0%0.200.750.650.250.70类别314.8%0.850.950.800.700.90然后按前文说的命名原则给出类别名称和解释。这就是一次完整LCA分析从数据到结论的交付物。8. 我在实际数据分析中踩过的坑以及对应的排查思路8.1 坑一指标之间局部依赖类别数越跑越多有一年我处理一份包含20多个题目的问卷数据把20个题全部塞进LCA后模型的BIC一路指向7类、8类但每个新增类别都没有实质意义。反复检查后发现问题出在两个几乎重复的题目上它们之间相关性极高导致局部独立性被严重违背。从那以后我的习惯是建模前先做两件事一是检查指标间两两相关相关性超过0.7的指标要重点审视看是否语义重复二是如果指标来自同一个量表的不同维度先按理论结构做维度合并不要一股脑全塞进去。LCA的指标贵精不贵多。8.2 坑二局部最优解不同起始值结果差很多LCA的似然函数不是凸函数可能存在多个局部最大值。如果你只跑一次起始值很可能停在某个局部最优解上参数估计和类别划分都不稳定。判断是否落入局部最优的一个实用办法看loglikelihood是否在多次随机起始值下重复出现同一个值。如果5次起始值给出5个不同的loglikelihood说明没有一次稳定收敛最优解还没找到。Mplus的STARTS和R里poLCA的nrep都是为了解决这个问题。我给学生的建议是正式分析至少用100组起始值如果你发现结果和20组时不一样就以更多起始值的结果为准。8.3 坑三Entropy很大但类别毫无意义Entropy高表示分类很“干净”但“干净”不等于“有意义”。我见过一些模型Entropy高达0.95但因为某个类别在所有指标上都处于中间水平完全说不清它是什么人。排查思路是把条件概率矩阵画出来看轮廓。如果某一类的条件概率几乎是所有其他类别的“平均水平”那它大概率是被人为切出来的中间类别不是真正的类型。这时候回到模型比较看看少一个类别的解是否更容易解释哪怕BIC稍差一点也值得换。8.4 坑四把分类标签当“真实标签”忽略分类误差这是LCA后续分析中最常见的问题。很多人先跑LCA得到每个个案的类别然后直接把类别标签当成观测变量去做卡方检验、回归分析或方差分析。问题是这个标签本身带误差——后验概率是0.55的人被硬塞进某类误差就存在。正确的做法是使用三步法第一步跑LCA确定潜在类别结构第二步在类别结构固定的前提下单独估计类别归属与协变量的关系第三步用BCH校正或其他稳健方法进行后续比较。Mplus中可以用AUXILIARY或R3STEP实现。这一步在你只是做描述性分类时可以省但只要进入假设检验环节就必须认真对待。8.5 坑五样本量不足还硬上模型不收敛LCA的参数估计依赖最大似然样本量不足时经常出现警告标准误无法计算、某些参数靠近0或1的边界或者模型在类别数较多时根本跑不动。处理方式不是硬调参数增加迭代次数而是回到设计层面——增加样本量或减少类别数。有一个判断模型“有没有吃饱”的简单方式看条件概率估计是否出现极端值。如果某个条件概率的估计是0.00或1.00而理论上不应该是这个值很可能是数据太稀疏。当然样本量较小时可以用更保守的BIC或者考虑贝叶斯估计方法作为补充。最后分享一个我个人的工作习惯跑LCA不要只盯模型输出一定要把类别轮廓图画出来贴在电脑前看上几分钟。图和数字给人的感觉完全不同一个类别能不能解释、命名是否自然很多时候一眼看图就有答案。这个习惯帮我挡住了不少“统计上完美、实际上荒谬”的错误方案。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门