青苗网络安全大学智能计算中心 · 天枢算力平台 工作台| 校外访问| 网络信息中心| 学校主页
智能计算中心 INTELLIGENT COMPUTING CENTER · 天枢 TENGSU CLUSTER
当前位置:首页 > 用户文档 > 作业调度

Slurm作业提交基础(sbatch/squeue/scancel)

分类:作业调度 · 更新日期:2026年09月15日

Slurm是平台的作业调度系统。常用命令:

sbatch run.sh:提交批处理作业;srun --pty bash -p debug:交互式占用资源;squeue -u $USER:查看自己的作业;squeue -p gpu-a100:查看某分区队列;scancel 300123:取消作业;sacct -j 300123:查看作业资源使用统计。

常用SBATCH指令:--partition分区、--job-name名称、--nodes节点数、--ntasks进程数、--cpus-per-task每进程线程数、--gres=gpu:N GPU卡数、--mem内存(如64G)、--time运行时限(如24:00:00)、--output输出文件。

作业状态含义:PENDING排队中;RUNNING运行中;COMPLETED正常结束;FAILED异常退出(看输出文件末尾);TIMEOUT超过申请时限被终止;CANCELLED被用户或管理员取消;NODE_FAIL节点故障,可重新提交。