空间转录组实战:CosMx解析SCLC肿瘤微环境与数据分析全流程
1. 从一篇文献说起CosMx如何把SCLC的肿瘤微环境“看”清楚前阵子课题组的组会文献分享轮到我正好手上在跑空间转录组的数据就选了一篇用小细胞肺癌SCLC原发灶和淋巴结转移灶做对比的研究。当时选这篇一是因为SCLC的治疗进展一直比较慢免疫治疗虽然上了线但响应率远不如非小细胞肺癌大家都很想知道肿瘤微环境里到底发生了什么二是因为这篇用的是NanoString的CosMx平台属于目前空间转录组里少数能做到“单细胞分辨率多靶标”的技术路线在亚结构和细胞邻域分析上有不少值得抠的细节。先说结论这篇文献的核心工作是用CosMx对SCLC原发灶和配对淋巴结转移灶做了高plex的空间转录组检测系统比较了两者在细胞组成、空间组织模式以及细胞通讯网络上的差异。它回答了一个很实际的问题——为什么SCLC的淋巴结转移灶在临床上往往表现出更强的侵袭性以及这种侵袭性背后肿瘤细胞和周围基质、免疫细胞之间的空间关系到底发生了什么变化。如果你也是做肿瘤微环境、空间组学或者SCLC相关研究的这篇推文的拆解应该能帮你在两个层面上少走弯路一是理解CosMx这类技术的适用边界和数据分析时真正需要花力气的地方二是看完能直接借鉴它的分析思路用在你们自己的多灶性、多点对照研究设计里。在动手拆文献之前还是先把CosMx到底是台什么“显微镜”说清楚不然后面讲细胞邻域、配受体分析的时候容易飘。2. 单细胞空间转录组学技术选型为什么偏偏是CosMx空间转录组这几年很火但火的代价是平台多得让人眼花缭乱。从早期基于条形码阵列的Visium到后来各种基于显微切割或原位杂交的新方案大家都在同一个目标上较劲在保留组织原位信息的同时尽可能提高分辨率、增加检测通量、扩大检测范围。而CosMx在SCLC这种实体瘤研究里被选中有几个硬件和化学原理上的必然理由。2.1 CosMx的技术定位与分辨率边界CosMx属于原位杂交类空间转录组方案核心是把编码了基因信息的探针直接送进组织切片里的单个细胞结合光学成像读出信号。和Visium这类基于空间条形码阵列的方案相比CosMx的最大优势是把分辨率真正压到了单细胞甚至亚细胞水平在FFPE组织切片上也能实现这就比很多对组织质量要求苛刻的方案友好得多。我自己的使用体感是CosMx在形态学保留上做得相当好。HE或者荧光染色的形态信息可以和高plex的转录组信号严格对齐在判断肿瘤边界、看微转移灶、识别导管结构这类需要形态学支撑的问题上这种优势是转录组数据本身替代不了的。SCLC这种细胞密度极高、间质成分少的肿瘤恰恰需要这种分辨率来把肿瘤细胞和浸润的免疫细胞区分开。2.2 高plex检测通量从“几十个基因”到“几千个基因”早期原位空间转录组方案的痛点之一是通量太低一次只能看几个到几十个基因做出来的结果更像是有空间信息的免疫荧光离“转录组”差得远。CosMx的迭代解决了这个问题现在的检测通量已经到几千重能从全转录组范围做筛选再结合定制panel对关键通路和细胞类型标志物做精确定量。在SCLC这篇文献里高plex的意义特别明显。SCLC本身在病理上分型就复杂不同亚型之间的转录特征差异很大加上肿瘤微环境里的巨噬细胞、T细胞、成纤维细胞亚群高度异质。你需要先做一个广谱的“摸底”才知道该把注意力放在哪些细胞类型和哪些通路上如果一开始就只能看几十个基因很容易漏掉关键的信息。2.3 多组学共检测蛋白和RNA一张切片上同时看空间转录组现在还有一个趋势就是RNA和蛋白的共检测。CosMx可以在同一张切片上同时检测RNA和几十种蛋白标志物这在肿瘤微环境研究里的价值非常大。RNA层面的信息能告诉你细胞“可能正在做什么”而蛋白层面的信息能告诉你“已经做了的”功能状态两者结合推断细胞状态和细胞通讯的时候置信度要高很多。SCLC文献里也做了类似的设计——用蛋白标志物确定关键的细胞谱系和功能状态用RNA panel去补充通路层面的信息再回到空间位置上去解释这些信号的位置和邻域关系。这种“先定位、再定性、后通讯”的思路确实比单组学的空间数据经得起推敲。2.4 平台对比为什么不用Visium或单细胞测序很多人会问既然有单细胞测序scRNA-seq分辨率也是单细胞级别也有空间信息虽然是推断的为什么还要做CosMx这种成本更高的实验我的看法是scRNA-seq的空间信息是“算出来的”是通过参考图谱去推断细胞可能的位置而CosMx的空间信息是“看出来的”是真实组织切片上每个细胞在原始位置上的转录组。对SCLC这种异质性很强、基质成分少的肿瘤来说“原位验证”几乎是刚需。Visium虽然有空间信息但分辨率是几十微米级别的捕获点一个点里常常混着好几个细胞做肿瘤边界和细胞邻域分析可以说是力不从心。三者之间不是替代关系而是互补关系scRNA-seq适合做“全面发现”Visium适合做“区域比较”CosMx/Xenium这类原位单细胞空间方案适合做“精确定位和验证”。关键的逻辑是先通过非空间单细胞测序拿到高分辨率的细胞亚型图谱再通过空间原位平台把细胞类型和功能状态映射回组织原位并从中发掘空间尺度的调控关系。3. 文献核心拆解SCLC原发灶与转移灶的微环境差异说回文献本身。这篇研究的实验设计非常清晰核心是比较配对的原发灶和淋巴结转移灶用CosMx同时拿到两边的单细胞空间转录组数据然后做细胞分型、空间邻域分析、细胞通讯推断最后锁定转移灶特有的微环境特征。3.1 实验设计与样本信息样本来源是SCLC患者的原发灶和配对的淋巴结转移灶。配对设计是整个研究里最关键的一步——它排除了个体间差异对比较结果的干扰让所有后续分析都能直接归因于“原发”和“转移”这个变量的差异。如果只是拿不同病人的原发灶和转移灶混在一起比个体间的遗传背景、治疗史、分期差异都会成为巨大的混杂因素结论很难站得住脚。组织处理上文献里用的是FFPE切片。这一点值得单独拎出来说因为空间转录组早期对新鲜冰冻组织的要求比较苛刻很多临床样本库里的存档组织都是FFPE的做不了新鲜组织的检测。CosMx在FFPE上的表现比较成熟这也是它能在临床样本研究中普及开来的一个现实原因。3.2 细胞分型结果转移灶里的“细胞类型重排”CosMx数据经过质控、聚类、注释之后研究者识别出了肿瘤细胞和多种微环境细胞类型包括T细胞、B细胞、巨噬细胞、中性粒细胞、成纤维细胞、内皮细胞等。在SCLC原发灶和转移灶之间最直观的差异是细胞成分的比例发生了变化。原发灶里肿瘤细胞比例高、间质成分相对少这和SCLC本身的病理特征是吻合的而转移灶里免疫细胞尤其是髓系细胞的比例明显上调。用生活化的类比来说原发灶更像是一个“肿瘤细胞占绝对主导的集中营”而转移灶则是一个“重新洗牌了的战场”——肿瘤细胞必须适应新的环境周围的免疫和基质成分也发生了剧烈的变化。这种细胞成分上的差异是后续所有空间分析的基础。3.3 空间组织模式细胞邻域分析揭示的关键差异光有细胞比例还不够空间转录组学真正值钱的地方在于可以看到这些细胞在组织里是怎么排列的、谁挨着谁、谁远离谁。文献里做了细胞邻域分析cell neighborhood analysis——简单说就是把每个细胞周围一定半径内的邻居细胞类型统计出来找出在空间上频繁共现的细胞组合。在原发灶中肿瘤细胞和巨噬细胞的空间共定位关系呈特定的分布模式而在转移灶中这个模式发生了明显的重塑。更关键的是转移灶里出现了原发灶中几乎看不到的特定细胞互作结构——比如某些免疫抑制性巨噬细胞亚群与耗竭T细胞在空间上的紧密邻近。这种“空间共定位”的意义在于如果两个细胞类型在组织中频繁相互靠近它们在功能上很可能是相互作用的。T细胞旁边紧挨着M2型巨噬细胞就提示局部微环境存在免疫抑制肿瘤细胞旁边围着成纤维细胞就可能存在基质介导的药物屏障。这些空间层面的共定位证据比单独看比例或单独看转录特征更有说服力。3.4 细胞通讯分析转移灶里的“信息高速公路”CosMx的数据不仅可以看细胞类型和空间组织还可以通过配体-受体分析来推断细胞间的通讯网络。文献里利用空间共定位信息结合已知的配体-受体互作数据库推断了原发灶和转移灶中差异明显的信号通路。结果发现转移灶中肿瘤细胞与巨噬细胞之间、以及T细胞与肿瘤细胞之间的配体-受体对呈现出了显著的富集。尤其值得关注的是与免疫抑制和T细胞耗竭相关的一些信号通路在转移灶中明显激活——这和我们之前在单细胞数据里看到的现象是一致的。在空间转录组数据里做配受体分析有一个典型的坑是单纯依赖表达量可能会产生大量假阳性。因为你不知道A细胞表达的配体蛋白是否真的接触到了B细胞表达的受体蛋白。但如果细胞类型在空间上紧邻再加上已知的分子互作关系推论的可靠性就高得多。这也是CosMx这类能保留空间位置信息的方案在通讯分析上比普通单细胞测序更有优势的原因。4. 从文献到实操CosMx数据分析全流程要点文献拆解完了接下来聊聊如果自己上手跑CosMx数据哪些环节是决定成败的。4.1 上游数据处理从原始图像到表达矩阵拿到CosMx原始数据之后第一步是生成细胞级别的表达矩阵。这个过程包括图像配准、细胞分割、信号提取和质控每一个子环节都会直接影响后续分析结果的质量。细胞分割是这里面最容易被低估的环节。CosMx虽然能提供形态学信息帮助识别细胞边界但在细胞密度极高的SCLC组织里细胞边界往往是模糊的分割不准会导致“一个细胞读出两份转录组”或者“两个细胞被合并成一个”。我自己跑下来的经验是一定要结合核染色和膜染色的信息分别做核分割和全细胞分割并且建议在正式分析之前先抽几张代表性视野做人工检查确认分割质量。质控方面需要关注的指标包括每个细胞的基因检出数、总UMI数、线粒体基因比例等和单细胞测序的质控逻辑类似。但在空间数据里还有一个特殊指标值得留意每个细胞与其邻居在转录谱上的相似性。如果某个细胞和它周围几十个细胞的转录谱几乎完全一致往往是分割错误的产物同一个细胞被切成了几块需要过滤掉。4.2 下游核心分析聚类注释、邻域分析和通讯推断过滤完低质量细胞后正经的分析流程大体分几步第一步是聚类和细胞类型注释。标准做法是先做降维和聚类再用已知的标志基因列表去注释每一类细胞。对SCLC来说关键的标志基因包括NEUROD1、ASCL1神经内分泌亚型以及SYP、CHGA这类通用神经内分泌标志免疫细胞标志就更常规了CD3D、CD8A、CD68、CD163这些。第二步是空间可视化。把聚类结果映射回组织坐标这一步能直接暴露出许多问题某个细胞类型是否富集在特定区域肿瘤边界处的细胞组成是否和肿瘤中心完全不同这些信息在2D散点图上可以很直观地看到。第三步是邻域分析。最常用的方案是把每个细胞周围一定半径内的邻居细胞类型分布统计出来然后用非负矩阵分解或者社群检测算法识别出反复出现的“生态型”ecotype或者“微环境模块”。这篇SCLC文献里识别的免疫抑制生态型就是这么做的。第四步是配受体和通讯分析。这里需要特别注意选择配受体数据库的版本和物种匹配关系以及设定合理的表达阈值。我的习惯是同时要求配体和受体在相应细胞类型中的表达比例达到一定阈值比如至少10%的细胞表达再结合空间共定位做筛选。4.3 分析工具选型生态型分析、社区发现与大规模并行CosMx的数据量比单细胞测序还大因为除了基因表达矩阵之外还有空间坐标、邻域矩阵、分割掩膜等多层数据。分析工具选得好不好直接决定你有没有耐心把整个流程跑完。生态型ecotype和社区发现是空间组学里识别微环境模块的常用手段。两者思路略有不同生态型分析侧重识别“反复出现的细胞组合”常用方法包括分层聚类、非负矩阵分解和主题模型更关注组合的生物学稳定性社区发现则是基于细胞之间的空间邻近关系用图算法去切分组织中的功能区域类似于在社交网络里找紧密联系的小圈子。在这方面Squidpy是我个人非常推荐的工具。它把邻域分析、共现分析、生态型识别这些常用方法整合在一起用Python就能跑通从数据导入到可视化的大部分流程。CellChat和CellPhoneDB则分别是配受体分析和通讯推断的常用选择。前者擅长跨条件比较通讯模式后者胜在程序简单、文档清晰、变量解释容易适合新手过渡。如果团队里R和Python环境都很熟练也可以考虑Giotto它在空间模式识别上做得比较细致。本质上工具选型的关键在于先明确你要回答的问题再决定用哪个工具不要被工具本身牵着手走。4.4 临床信息与空间数据的整合分析空间转录组数据还有一个很高价值但经常被浪费的信息形态学和空间位置背后的临床关联。在SCLC这篇文献里作者把空间数据与患者的临床病理特征整合发现转移灶里特定的免疫抑制微环境生态型与更差的患者预后存在相关性。自己分析的时候可以在组织坐标上手动圈出感兴趣的区域比如肿瘤中心、肿瘤边界、间质区、三级淋巴结构计算每个区域内的细胞组成和生态型分布然后把这些量化特征与患者的生存数据、治疗反应数据做相关性分析。这个思路并不复杂但得到的结论往往比全组织平均值的分析更有临床转化价值。5. 实操心得与避坑指南5.1 实验设计阶段的三个关键决策第一样本配对设计。能做配对就一定要配对。原发灶和转移灶取自同一个患者才能排除个体差异的影响如果不配对后续所有差异都可能被遗传背景或治疗历史混淆。这一点文献做得很标准。第二panel选择。CosMx既有人类全转录组panel也有定制化的靶向panel。对于一个探索性研究建议优先考虑全转录组或者尽可能大通量的panel因为SCLC微环境里可能有未知的细胞亚群或新的标志物预先限定基因清单容易遗漏关键信息。如果是验证性的或者大规模临床队列研究再考虑定制panel以控制成本。第三切片质量。虽然CosMx支持FFPE但切片的保存时间和质量直接影响RNA检出。我个人建议在正式实验前先做一张预实验切片看一下RNA检出数和组织形态的匹配情况不要直接上来跑全部样本发现了问题再返工成本就很高了。5.2 数据分析阶段最容易踩的四个坑第一个坑是细胞分割不当。前面提过一定查分割结果尤其在密集区域。可以用细胞密度热图来定位异常区域再做局部调整。第二个坑是注释时把不同功能状态的同一细胞类型分开当作不同类型。比如巨噬细胞M1和M2严格来说应该算同一种细胞的不同功能状态如果直接分成两个细胞类型后面的比例分析和通讯分析就会产生误导。建议先按谱系做粗注释再做功能状态细分两者分开看。第三个坑是伪复制问题。空间转录组数据里同一个组织切片内的两个区域并不是完全独立的样本——它们在空间上有关联在技术上高度相似。如果直接拿每个视野或每个区域作为独立样本做差异分析容易把技术噪声当成生物学差异。正确的做法是把“患者”作为生物学重复单位用混合效应模型或者配对检验处理。第四个坑是空间分辨率的过度解读。CosMx的分辨率在单细胞水平但RNA检出效率和单细胞测序相比还是有差距某些低表达基因可能漏检。所以做差异表达或者通路富集时建议对低频基因保持怀疑优先关注在相当比例的细胞中都有表达变化的基因。5.3 如何把文献的分析思路复用在自己的数据上跑完文献梳理后我觉得最有迁移价值的分析思路有三条。第一条是多灶性配对比较的设计强调使用严格的配对照实验思路来精简后续差异分析的解释维度第二条是细胞邻域生态型的识别方法即使数据来源不同、肿瘤类型不同只要空间数据支持从共定位到共现、从共现到社群结构的分析这套“由微观互作到宏观生态型”的思路就依然适用第三条是把空间共定位信息和配受体分析结果交叉验证这种思路在验证传统的肿瘤免疫信号通路时非常“省力”。6. 从单点看全局空间组学在肿瘤研究里的下一步最后聊一点自己对技术走向的观察。CosMx这类原位单细胞空间转录组方案正在把组织病理学和转录组学真正意义上融合到一个维度里。对SCLC这种高度异质、快速进展的肿瘤来说空间层面的微环境解析会为免疫治疗响应预测和联合用药策略提供更扎实的生物学基础。我个人在实际操作中的体会是空间转录组数据最大的价值不在“能测多少基因”而在于“能把这些基因的表达放回它的真实位置上去理解”。没有空间信息的时候我们看得见细胞类型却看不见谁在肿瘤边缘打头阵、谁被排斥在免疫热点之外、谁的信号在决定边界的进退。有了空间这一维才真正把这些细胞的故事讲完整了。如果手头已有SCLC或者类似实体瘤的空间数据不妨试着按本文的顺序跑一遍先做严格的质控和分割检查再做细胞分型和空间可视化接着做邻域和生态型分析最后用配受体和临床数据收尾。这整套流程走完你会对自己的数据有一个很不一样的理解。