用于评估银行部门NIDS数据集对MITRE ATTCK技术覆盖的多LLM共识框架
大家读完觉得有帮助记得关注和点赞摘要 全球银行网络的系统性关键性使其成为高级持续性威胁的高优先级目标这就需要网络入侵检测系统NIDS的运营有效性必须超越统计准确性。然而在实验性NIDS性能与实际有效性之间仍然存在显著的验证差距在标准基准上达到高准确率的NIDS模型往往在运营银行环境中失效因为通用数据集缺乏真实金融威胁所特有的行业特定模式如SWIFT和ATM相关入侵。为解决此问题本文研究了一种行业感知评估方法该方法系统性地评估现有NIDS基准数据集在多大程度上覆盖了与银行基础设施最相关的攻击行为。该方法将MITRE ATTCK知识库中记录的攻击者行为映射到NIDS基准同时强制实施NIST SP 800-94定义的真实传感器限制。利用一个包含四种最先进模型的多LLM共识引擎我们评估了210种银行特定 adversary 技术得出了一个包含68种网络可观察行为的基线用于系统性的覆盖分析。对五个基准数据集的评估结果表明UNSW-NB15以82.2%的加权覆盖得分获得了最高的效用尽管只有18.4%反映了直接的、技术层面的证据而CIC-DDoS2019则显示出对核心银行行为89.9%的盲区。这些发现为行业感知的NIDS评估建立了可复现的基础并突显了对银行原生数据集的迫切需求。关键词 网络入侵检测系统NIDS· 银行安全 · 网络安全 · MITRE ATTCK · 大型语言模型。1 引言现代银行基础设施构成了全球金融稳定的支柱通过包括SWIFT、实时全额结算RTGS系统和自动柜员机ATM网络在内的互联网络促进高价值交易[4,7]。这种数字化转型在提高运营效率的同时也扩大了复杂对手的攻击面。近期由APT38、Lazarus和Carbanak等组织发起的攻击表明银行网络已不再是机会性目标而是国家支持的和以金融为动机的威胁行为者的战略目标[1,16]。这些对手采用专门设计用于利用金融市场基础设施FMIs固有独特协议和交易流的多阶段入侵使得通用网络安全措施不足以应对[16]。为防御这些关键环境网络入侵检测系统NIDS被广泛部署为被动传感器监控流量中的未授权或异常活动。NIST根据SP 800-94指南将NIDS确定为持续网络监控和策略执行的核心机制[21]。然而这些系统的有效性从根本上受到其训练和评估数据集代表性的限制[19,13]。尽管这一局限性已被充分记录但基于机器学习的NIDS研究仍依赖于少量通用基准而没有批判性地评估它们对特定行业部署的适用性[13,20]。越来越多的证据表明在标准基准上达到高准确率的NIDS模型在部署到运营银行环境时往往表现不佳主要是因为实验数据集缺乏行业特定的攻击模式如交易滥用、凭证滥用和银行间通信操纵而这些正是现实世界金融威胁的特征[15,20]。这种验证差距源于可用基准与运营需求之间的根本不匹配。流行的数据集包括NSL-KDD、UNSW-NB15和CICIDS2017是为通用企业IT环境设计的主要关注拒绝服务、端口扫描和暴力破解等粗粒度攻击[6,17,23]。虽然这些数据集适合基线算法评估但它们对银行特定 adversary 行为尤其是那些针对支付协议或表现出多阶段入侵检测所需时间连续性的行为的覆盖有限[19]。因此从这些基准得出的性能指标可能会对运营韧性产生错误的信心[24]。最近的研究已采用MITRE ATTCK框架作为评估检测覆盖的结构化本体。ATTCK通过有记录的战术和技术对真实世界的 adversary 行为进行建模从而能够系统性地推理哪些攻击行为在网络流量中是可观察的[15,14,12,10]。一些工作已将此扩展到特定领域Bagui等人[3]开发了一个明确映射到ATTCK技术的网络流量数据集而Wu等人[26]则展示了大型语言模型LLM在银行系统内自动化威胁建模中的适用性。然而现有的映射方法存在两个关键缺陷。首先它们通常将所有ATTCK技术视为网络传感器同样可检测而忽略了关于加密和端点可见性的任何标准约束[21,19]。其次手动映射方法无法扩展到高风险银行环境所需的粒度[8]。本文提出了一种行业感知评估方法旨在弥合实验性NIDS验证与运营银行安全要求之间的差距。本工作的主要贡献如下我们引入了一个银行部门评估框架该框架在将MITRE ATTCK技术映射到数据集之前通过NIST SP 800-94被动NIDS可见性限制仅被动感知无端点数据无TLS解密进行过滤防止夸大的“覆盖”声明并定义一个现实的可见性界限。我们构建了一个与银行业务相关的ATTCK技术核心银行、SWIFT/RTGS、ATM环境的可复现基线并整理了在被动约束下网络可观察的子集为行业感知的数据集验证提供了一个标准参考。我们提出了一种共识驱动的技术到数据集映射程序和一个优先级加权覆盖度量该度量通过强调对银行对手最重要的技术来评分数据集的效用将评估从原始计数转向与威胁相关的代表性。2 背景与相关工作2.1 背景银行业的数字化转型需要高度互联的基础设施涉及云服务和全球网络如SWIFT[4,7,16]。为缓解包括勒索软件和横向移动在内的日益增长的威胁[1,16]银行根据美国国家标准与技术研究院NIST标准[21,19]在外部网关和内部网段部署网络入侵检测系统NIDS以监控流量模式和权限滥用。图1说明了在关键银行基础设施中代表性的被动NIDS部署架构该架构围绕NIST SP 800-94传感器放置指南一致的双防火墙DMZ非军事区模型构建[21]。三个被动分路传感器监控关键阻塞点的流量在互联网网关边界、SWIFT银行间连接处以及覆盖数据库集群、支付引擎和ATM控制器之间交易流的内部核心银行网段[21]。标准基准如KDD Cup 99、NSL-KDD[23]、UNSW-NB15和CICIDS2017因其易获取性而被广泛使用但它们主要反映通用企业IT环境和粗粒度的攻击向量如拒绝服务、端口扫描和暴力破解活动[6,17,23,11]。越来越多的证据表明公共NIDS数据集仅覆盖已知攻击行为的一小部分[13]并且缺乏交易特定上下文和金融通信协议的数据集为评估部署在银行基础设施中的NIDS提供的依据有限[19,20,24]。MITRE ATTCK框架为推理这些差距提供了结构化本体通过有记录的战术和技术对真实世界的 adversary 行为进行建模以便系统性地评估哪些攻击行为在网络流量中是可观察的[15,14]。图1描述银行基础设施中的被动NIDS部署架构2.2 相关工作在这些已识别差距的基础上近期研究寻求更结构化的方法来评估检测覆盖。表1总结了关键相关工作及本文解决的差距。如表1所示现有的基于ATTCK的映射方法存在两个关键缺陷。首先它们通常将所有ATTCK技术视为网络传感器同样可检测而忽略了NIST SP 800-94关于加密、端点可见性和被动监控限制的约束[21,19]。其次手动映射方法无法扩展到高风险银行环境所需的粒度[8]。虽然LLM越来越多地用于威胁建模等安全任务但单个模型的输出往往容易受到推理偏差的影响[8,26]。为确保银行环境中的高风险可靠性近期研究提出了基于共识的框架[18,24]。最密切相关的先前工作Tory等人[24]对能源部门的NIDS数据集进行了差距分析使用了双LLM验证方法但未应用NIST SP 800-94被动约束或处理银行特定的威胁行为者。此外现有的共识和验证框架[8,18,24]缺乏银行特定的威胁建模来建立网络可观察技术的可复现基线。本文通过引入一个受NIST约束的可检测性框架来解决这些差距该框架根据被动NIDS可观察性过滤ATTCK技术。由此产生的基线为银行NIDS数据集的行业感知评估提供了一个现实的上限。表1. NIDS数据集和银行业MITRE ATTCK映射相关工作的定性比较相关工作领域MITRE ATTCK映射缺少NIST SP 800-94约束和银行业特定上下文应用严格的NIST SP 800-94被动监控限制无TLS/端点可见性为银行环境定制Hasan Rahman Tory [19]通用基于NIDS的数据集评估是否否Bagui 等人 [3]云IT与ATTCK对齐的网络流量数据集构建是缺乏金融交易上下文如SWIFT, RTGS否否Wu 等人 [26]银行LLM驱动的银行系统自动化威胁建模是因忽略被动NIDS约束而高估覆盖否否我们的工作银行提出共识驱动的技术-数据集映射和优先级加权覆盖否是引入与NIST SP 800-94限制对齐的3级NIDS过滤是将基线扩展至210种银行相关技术涵盖ATM、SWIFT操作3 方法该评估框架通过一个三阶段流程运作(1) 银行部门威胁识别和技术提取(2) 受NIST约束的可检测性分类以及 (3) 针对基准数据集的多LLM共识映射。图2说明了这一工作流程。3.1 范围界定与威胁识别尽管MITRE ATTCK框架将金融实体归类于统一的“金融服务”部门但本研究采用更狭义的定义以隔离专门针对核心银行基础设施的威胁。此处将银行机构定义为运营关键金融市场基础设施FMIs的实体具体指银行间支付系统如SWIFT和RTGS、自动柜员机ATM网络以及促进存款和结算功能的核心银行系统[4]。此定义排除了更广泛的金融实体如保险公司、投资公司和加密货币交易所它们不运营同样具有系统重要性的支付基础设施[7]。图2描述多LLM共识框架流程利用MITRE ATTCK框架v18[15]我们使用类似于[19]的基于关键词的过滤方法来识别潜在的银行部门对手。候选者经过手动验证以确保其目标符合我们的银行定义排除了仅关注外围金融服务的组织。这产生了12个软件家族Dridex、TrickBot、QakBot、Dyre、Carbanak、Carberp、Ursnif、IcedID、Bankshot、Zeus Panda、Wiper和TrickMo和12个威胁组织Indrik Spider、APT38、Lazarus Group、Cobalt Group、Andariel、GCMAN、Malteiro、Silence、TA505、DarkVishnya、RTM和Carbanak。值得注意的是Carbanak既作为恶意软件条目S0030又作为威胁组织G0008出现因为它们在MITRE ATTCK中是不同的实体。技术提取通过Python针对MITRE ATTCK企业版STIX/JSON存储库在2025年11月以编程方式执行使用了版本18.12025年10月28日发布[15]产生了210种独特技术。表2. 根据NIST SP 800-94的被动NIDS传感器约束约束描述参考无TLS解密加密负载HTTPS、SSH、VPN对传感器是不透明的仅元数据如SNI、证书保持可见。[21] 第4.3.3.4节仅被动监控传感器通过SPAN端口或TAP观察流量副本它缺乏内联预防或主动响应能力。[21] 第4.2节无端点可见性内部进程执行、文件系统更改、内存状态和本地认证不在传感器范围内。[21] 第4.5、7.1节3.2 可检测性分类框架为按被动NIDS可检测性对技术进行分类我们开发了一个分类框架将NIST SP 800-94能力操作化[21]。该模型假设通过网络分路器进行被动传感器部署受表2总结的三个明确约束限制。四种LLMClaude Opus 4.5、GPT-5.2、Grok 4.1和Gemini 3 Pro独立评估了210种技术中的每一种。为确保跨模型一致性提示策略应用了表3总结的六种提示工程原则通用完整提示模板见附录A。表3. 为跨模型一致性应用的提示工程技术技术描述理由结构标签XML风格分隔符task、constraints创建明确边界防止模型混淆指令与示例[2]。约束框架固定声明性参数“传感器不能...” vs “通常不会...”消除解释余地减少模糊边缘情况下的差异。显式输出限制推理列指定“最多15个词”量化限制确保统一输出定性指令因模型而异太大。角色分配“网络安全分析师”阶段1“高级CTI分析师”阶段2锚定领域特定词汇和跨模型一致的推理模式。每个LLM分配了表4中定义的三个分类标签之一将NIST SP 800-94检测梯度操作化。表4. NIDS可检测性分类方案标签描述事件类型参考YES核心行为产生可观察的网络工件包括签名、异常或协议违规。[21] 第4.3.3.1节PARTIAL检测取决于加密状态依赖元数据推断或因实现而异。流分析 per [21] 第6.2节NO在本地执行无网络足迹或流量与合法活动无法区分。基于主机的IDPS要求 per [21] 第7.1节共识要求至少四种LLM中的三种达成一致75%。此阈值平衡了包容性和严谨性虽然一致共识100%消除了假阳性但因单模型偏差可能排除有效技术相反简单多数50%允许单个模型错误主导分类。75%的阈值确保了稳健的一致同时适应了关于网络工件可观察性的合理解释差异[18]。在210种技术中有21种10.0%未能达成共识需要手动裁决包括19例2-2分裂和2例三方分歧2-1-1模式。有争议的分类通过结构化专家评审解决。优先考虑保守分类具有模糊网络可观察性的技术被分类为PARTIAL而非YES以避免夸大可检测性估计。此过程识别出68种NIDS可检测技术形成了数据集映射的范围。3.3 数据集映射与效用度量表5. 数据集映射分类标签描述Direct数据集明确包含直接实现该技术核心行为并具有可观察网络工件的攻击流量。Indirect数据集不直接包含该技术的明确实例但包含相关的侦察、利用前活动或反映该技术部分方面的类似攻击模式。None没有数据集标签对应于该技术表明攻击向量不在数据集范围内。为评估覆盖范围我们开发了结构化数据集档案描述每个基准的攻击分类法、网络工件和已知局限性。分析了五个NIDS数据集CICIDS2017[6]、CIC-DDoS2019[22]、UNSW-NB15[17]、UWF-ZeekData22[25]和CTU-13[9]。数据集建档 每个档案记录了(1) 攻击类别及其分布(2) 可观察的网络工件包括端口、协议、标志和负载特征(3) 与检测相关的数据集特定特征以及 (4) 影响技术覆盖的已知局限性如数据格式约束、类别不平衡或时间过时性。表6. 2-2映射分裂的争议解决规则争议模式解决方式理由Direct vs. IndirectIndirect保守方法承认部分覆盖而不夸大行为对齐。Direct vs. NoneIndirect承认潜在覆盖同时考虑显著的分类不确定性。Indirect vs. None排除共识不足以保证覆盖移除以防止推测性对齐。语义映射过程 相同的四种LLM独立地根据数据集档案评估每种技术。每个模型收到68种技术的主列表、结构化数据集档案和演示映射逻辑的推理指令。每个映射被分配了表5中定义的三个分类标签之一。映射共识要求75%的一致与阶段1一致。一致4/4和共识3/4分类被直接接受。有争议的案例2-2分裂通过表6总结的预定义保守规则解决确保了可复现性并消除了主观偏差。在所有数据集中有12种技术占68种技术基线的17.6%因Indirect-None争议被排除确保报告的覆盖指标仅代表高置信度映射。优先级评分 每种技术都收到一个综合优先级得分0-100。为对每种技术的关键性进行排名按如下计算综合优先级得分PS其中Ue ∈ [0, 40] 代表实体使用在银行部门攻击中的使用频率。It ∈ [0, 40] 代表战术重要性相关MITRE战术的关键性。Dg ∈ [0, 20] 代表组织多样性使用该技术的不同威胁行为者数量。实体使用反映了威胁行为者和恶意软件采用广度。战术重要性来源于银行威胁语料库的经验战术分布。组织多样性奖励被多个不同威胁组织使用的技术。40/40/20的权重优先考虑直接威胁采用和运营影响。技术被分类为高优先级≥6个实体、常见4-5个、中等2-3个或稀有1个。覆盖度量 数据集效用通过加权覆盖量化覆盖加权其中 wᵢ 是技术的优先级得分cᵢ 是二元的如果为Direct/Indirect则为1如果为None则为0确保高优先级技术对评估成比例贡献。3.4 可复现性与工件可用性所有主要工件都公开存档于 GitHub - adritatori/BankSectorNIDSdatasetCoverage · GitHub按三个方法阶段组织成三个目录。共识引擎包括GPT-5.2OpenAI、Claude Opus 4.5Anthropic、Gemini 3 ProGoogle和Grok 4.1xAI通过标准消费者聊天界面在2025年11月至2026年1月期间访问。由于推理参数如温度和top_p通过消费者界面不可用户配置输出在结构上是可复现的但可能因非确定性采样而表现出微小变化[18,24]。整个过程中使用的ATTCK框架版本为v18于2025年11月通过 MITRE ATTCK® 访问。提示模板和少样本校准示例见附录A。4 结果评估侧重于针对核心银行基础设施的对手相关的NIDS可检测MITRE ATTCK技术的表示。4.1 银行部门技术的NIDS可检测性分类从最初的210种银行部门技术中有68种32.4%在严格的被动NIDS约束下被分类为NIDS可检测YES或PARTIAL。其余142种67.6%被分类为NO主要由于主机驻留执行或与合法活动无法区分的加密流量。图3说明了所有210种技术的三向分类分布其中21种10.0%获得YES47种22.4%获得PARTIAL标签。合并的68种YES和PARTIAL技术32.4%构成了NIDS可检测基线为银行威胁模型内被动NIDS评估建立了现实的上限。图3显示NIDS可检测性分类的饼图4.2 数据集映射的模型间一致将68种可检测技术映射到基准数据集的共识结果总结在表7中。CIC-DDoS2019表现出最强的一致92.6%为一致或共识分类这归因于其狭窄、定义明确的攻击范围。相反CTU-13表现出最高的模糊性有50.0%的技术导致争议2-2分类且无弱一致实例。这反映了CTU-13粗粒度、以活动为导向的标签结构与具有明确攻击标签的数据集相比使得细粒度技术归属复杂化。CIC-DDoS2019主要关注DDoS攻击这些攻击产生清晰且重复的流量模式。这使得检测更容易并导致技术间更高的一致[22]。相比之下多攻击数据集包含多样且复杂的攻击行为导致一致性较低。因此CIC-DDoS2019的高性能反映了DDoS特定的检测能力而非通用入侵检测性能。此局限性已被承认以确保公平比较和正确解释结果。表7. 模型间一致摘要数据集总技术数一致 (4/4)共识 (3/4)弱 (2/4)争议 (2-2)CICIDS20176816 (23.5%)32 (47.1%)8 (11.8%)12 (17.6%)CIC-DDoS20196844 (64.7%)19 (27.9%)3 (4.4%)2 (2.9%)UNSW-NB156825 (36.8%)23 (33.8%)9 (13.2%)11 (16.2%)UWF-ZeekData226824 (35.3%)18 (26.5%)17 (25.0%)9 (13.2%)CTU-136818 (26.4%)16 (23.5%)0 (0.0%)34 (50.0%)4.3 数据集覆盖分析将68种NIDS可检测技术映射到五个基准数据集以评估银行部门威胁的表示。图4总结了所评估数据集的加权覆盖得分。UNSW-NB15提供了最全面的银行业务相关行为表示尽管直接对齐有限18.4%但总覆盖率达到82.2%。相反CTU-13表现出明显的不平衡间接表示比例很大40.4%但直接覆盖极少9.0%。最后CIC-DDoS2019的89.9%覆盖缺口反映了其对体积性拒绝服务攻击的专业化关注使其不适合全面的银行部门安全评估。关键技术在所评估的所有数据集中覆盖不均。虽然渗出方法T1041, T1048出现在多个基准中但凭证访问T1078和持久性机制T1053仍然显著代表性不足。值得注意的是没有数据集提供对T1071应用层协议的直接覆盖尽管它对于命令与控制C2检测至关重要。图5说明了这些战术级别的覆盖模式。直接覆盖在所有数据集中仍低于18.9%表明明确的银行特定攻击实现很少见。发现和渗出是覆盖最好的战术而初始访问和影响在当前NIDS基准中系统性代表性不足。图4数据集覆盖分析的柱状图图5跨基准数据集的战术级ATTCK覆盖的热图4.4 映射争议分析有争议的数据集映射揭示了ATTCK技术边界的系统模糊性。对CTU-13中34个有争议2-2分裂案例的分析显示分歧主要源于粗粒度的、活动级别的标签。对于CICIDS2017中的12个争议案例和UNSW-NB15中的11个案例分歧通常涉及具有重叠网络指标的技术例如当两者都利用HTTP时区分T1071和T1041。在这些情况下保守地默认使用Indirect分类防止了虚假的精确度同时承认了潜在的覆盖。由于不可调和的Indirect与None争议而排除12种技术占基线的17.6%主要影响了攻击多样性有限的数据集如CIC-DDoS2019和UWF-ZeekData22。这些排除确保报告的覆盖指标代表高置信度映射而非推测性对齐。5 讨论研究结果表明实验性网络入侵检测系统NIDS与运营银行需求之间存在实质性的验证差距。尽管UNSW-NB15数据集覆盖了82.2%的银行业相关技术但其严重依赖间接工件63.8%表明它更适合异常检测而非精确技术分类。在这些数据集上训练的系统可能识别可疑活动而无法识别特定的 adversary 战术如ATM劫持或SWIFT操纵。CIC-DDoS2019的差劲表现仅提供10.1%的覆盖突显了依赖单一向量数据集的风险。依赖此类基准的金融机构仍对已建立技术基线的89.9%保持脆弱在NIDS采购中造成“错误信心”。对初始访问和影响战术的有限可见性证实NIDS必须与基于主机的检测和TLS检查集成以确保全面安全。多LLM共识方法减轻了单个模型的偏差。选择75%的共识阈值是为了平衡精确度和召回率较低的50%阈值将以分类置信度为代价将检测到的技术扩展12%而一致要求将排除35%的基线。时间有效性是另一个问题因为像CICIDS2017和UNSW-NB15这样的数据集早于现代云原生银行和TLS 1.3加密。排除12种技术17.6%可能低估实际覆盖因为争议技术通常涉及使用有效凭证这些凭证在没有主机级遥测的情况下与良性流量无法区分。虽然本研究侧重于银行业但结果可能无法完全推广到加密货币或保险行业这些行业面临不同的威胁格局。应优先考虑开发银行特定的基准包括具有明确ATTCK标签的SWIFT消息流和ATM协议使监督学习模型能够识别特定的 adversary 行为而不仅仅是检测异常。当前的68种技术基线需要持续更新以与不断演变的MITRE ATTCK版本和新兴的金融威胁情报保持一致。未来的研究还应探索加密流量分析以在不需完整TLS解密的情况下重新获得对防御规避战术的可见性。将此方法扩展到基于主机的系统将有助于对其他关键部门如医疗保健和能源的多层安全架构进行更全面的评估。6 结论现代银行网络需要反映运营现实 adversary 行为而非通用基准性能的NIDS评估。本文通过引入一个行业感知框架来弥合威胁情报与现实传感器能力之间的差距解决了银行部门NIDS研究中的验证差距。通过将NIST SP 800-94约束应用于MITRE ATTCK矩阵该方法将210种银行相关技术过滤成一个包含68种网络可观察行为的可复现基线。对五个基准数据集的实证评估表明虽然UNSW-NB15以82.2%的覆盖提供了最高的效用但其他数据集如CIC-DDoS2019对核心银行行为留下了89.9%的盲区。这些由可扩展的多LLM共识方法实现的发现强调了使数据集选择与行业特定威胁模型对齐以避免运营失败的必要性。该框架为未来以银行为中心的基准纳入SWIFT和ATM协议奠定了基础并建立了一种适用于所有关键基础设施领域安全验证的方法。局限性包括仅被动可见性假设和对模型共识的依赖这推动了未来在更新基线、加密流量推断以及开发包含SWIFT/ATM行为并带有明确ATTCK标签的银行原生数据集方面的工作。