GPU作业正确姿势
GPU作业必须在脚本中声明 --gres=gpu:N,且gpu分区N最大为8(单节点)。跨节点多卡训练请使用 --nodes=2 --ntasks-per-node=8 并配合分布式框架(torchrun/DeepSpeed)。
常见错误:脚本里没有--gres却在GPU分区运行,作业会被调度器拒绝;申请了GPU但进程用CPU跑满,会造成资源浪费并触发低效作业告警。
查看GPU实时占用:ssh到计算节点执行 nvidia-smi,或在srun交互会话中执行。
4090分区适合推理与中小模型调试,A100分区适合大模型训练。合理选择分区可显著缩短排队。