拓冰建站拓冰建站
首页 / 资讯中心 / 正文

SLURM集群管理与作业调度系统详解

1. SLURM 基础概念解析SLURMSimple Linux Utility for Resource Management是当前最主流的开源集群管理和作业调度系统之一。我第一次接触SLURM是在2015年处理基因组数据分析时当时就被它强大的资源分配能力和灵活的作业管理方式所吸引。经过这些年的使用我发现无论是小型实验室服务器还是超算中心SLURM都能完美胜任资源调度任务。1.1 核心组件架构SLURM系统由三个关键组件构成slurmctld中央管理守护进程负责资源监控和作业调度slurmd节点守护进程在每个计算节点运行并执行具体任务数据库存储作业记账信息使用sacct命令查询这种架构设计使得SLURM可以轻松扩展到数千个计算节点。在实际部署中我建议至少配置两个控制节点做高可用避免单点故障导致整个集群不可用。1.2 核心概念解析**作业Job**是SLURM中最基本的执行单元。一个作业可以包含多个步骤Job Step比如预处理-计算-后处理这样的流水线操作。作业提交后会被分配唯一的JobID这是后续管理的重要依据。**分区Partition**相当于资源池的概念。我们实验室的集群就划分了debug快速测试、normal常规计算和bigmem大内存任务三个分区。合理设置分区可以显著提高资源利用率。**节点Node**是实际执行计算任务的物理或虚拟机。SLURM会实时监控各节点的CPU、内存、GPU等资源使用情况。在我的使用经验中节点配置最好保持同质化否则容易导致资源碎片问题。2. 核心命令实战指南2.1 sbatch作业提交的艺术sbatch是提交作业的核心命令。我常用的模板脚本如下#!/bin/bash #SBATCH --job-namemy_job # 作业名称 #SBATCH --outputoutput.log # 输出日志 #SBATCH --errorerror.log # 错误日志 #SBATCH --partitionnormal # 使用分区 #SBATCH --nodes2 # 节点数 #SBATCH --ntasks-per-node8 # 每节点任务数 #SBATCH --time1:00:00 # 最大运行时间 echo Starting at date module load intel/2020 # 加载环境 srun ./my_program # 并行执行 echo Finished at date几个实用技巧总是设置合理的--time参数避免短作业排队时间过长使用--array参数提交任务数组可以大幅简化批量作业管理--dependency参数可以建立作业间的依赖关系重要提示提交前务必用sbatch --test-only验证脚本语法避免占用资源后才发现错误。2.2 squeue作业监控利器squeue命令可以实时查看作业状态。我最常用的组合是squeue -u $USER -o %.10i %.20j %.10T %.10M %.10l %.6D %.4C %.10m %R --sorti这个格式化输出包含JobID、名称、状态、运行时间时间限制、节点数、CPU数内存需求、运行节点对于大型集群建议加上-p参数指定分区查看。如果发现作业长时间处于PDpending状态可以用scontrol show job 查看具体原因。2.3 scancel作业终止操作终止作业时这些经验可能帮到你终止单个作业scancel终止用户所有作业scancel -u $USER终止特定状态的作业scancel -t PENDING终止作业数组中的特定任务scancel _曾经有一次我不小心提交了1000个错误作业用scancel -u $USER -t PENDING 5秒就解决了问题避免了资源浪费。2.4 sacct历史作业分析sacct是分析已完成作业的瑞士军刀。典型用法sacct -S 2023-07-01 -E 2023-07-31 -u $USER --formatJobID,JobName,Partition,AllocCPUS,Elapsed,MaxRSS,State关键字段说明MaxRSS实际内存使用峰值发现内存申请过大的好指标Elapsed实际运行时间对比申请时间优化资源请求State退出状态排查失败作业我每月都会用这个命令统计课题组资源使用情况优化后续的资源申请策略。3. 高级使用技巧3.1 资源请求优化策略新手最常见的错误就是过度申请资源。根据我的经验CPU实际使用核数的1.2倍内存实测峰值×1.3可用MaxRSS反推时间平均时长×2但不超过24小时一个实用的测试方法# 先申请短时间测试资源需求 #SBATCH --time10:00 --ntasks4 --mem4G # 运行后通过seff jobid查看实际使用率3.2 任务并行化配置根据程序特性选择正确的并行模式MPI程序--ntasksN多线程程序--cpus-per-taskN混合并行--ntasksM --cpus-per-taskN我曾经优化过一个分子动力学模拟通过合理设置--ntasks和--cpus-per-task参数使计算效率提升了40%。3.3 常见错误排查作业卡在PD状态检查分区资源是否充足sinfo -p检查资源请求是否合理scontrol show job检查QOS限制sacctmgr show qos作业被强制终止检查是否超时sacct -j -o TimeLimit,Elapsed检查内存是否超限sacct -j -o MaxRSS,ReqMem程序运行异常检查环境变量env | grep -i slurm验证模块加载module list测试单节点运行srun -N1 --pty /bin/bash4. 单机环境部署指南虽然SLURM主要用于集群环境但在单机上部署也非常适合学习和测试。以下是CentOS 7下的快速安装步骤# 安装基础依赖 sudo yum install -y epel-release sudo yum install -y slurm slurm-devel slurm-munge slurm-perlapi # 创建配置文件单节点 sudo cat /etc/slurm/slurm.conf EOF ClusterNamelocalhost ControlMachinelocalhost SlurmUserslurm SlurmctldPort6817 SlurmdPort6818 AuthTypeauth/munge StateSaveLocation/var/spool/slurmctld SlurmdSpoolDir/var/spool/slurmd SwitchTypeswitch/none MpiDefaultnone SlurmctldPidFile/var/run/slurmctld.pid SlurmdPidFile/var/run/slurmd.pid ProctrackTypeproctrack/pgid CacheGroups0 ReturnToService1 SlurmctldTimeout300 SlurmdTimeout300 InactiveLimit0 MinJobAge300 KillWait30 Waittime0 SchedulerTypesched/backfill SelectTypeselect/linear SelectTypeParametersCR_CPU JobCompTypejobcomp/none NodeNamelocalhost CPUs4 RealMemory7984 Sockets1 CoresPerSocket2 ThreadsPerCore2 StateUNKNOWN PartitionNamedebug Nodeslocalhost DefaultYES MaxTimeINFINITE StateUP EOF # 启动服务 sudo systemctl start munge sudo systemctl start slurmctld sudo systemctl start slurmd # 验证安装 sinfo -a安装完成后你就可以在本机体验完整的SLURM功能了。我建议初学者先在单机环境熟悉基本操作再应用到生产集群。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门