青苗网络安全大学智能计算中心 · 天枢算力平台 工作台| 校外访问| 网络信息中心| 学校主页
智能计算中心 INTELLIGENT COMPUTING CENTER · 天枢 TENGSU CLUSTER
当前位置:首页 > 用户文档 > 作业调度

GPU作业正确姿势

分类:作业调度 · 更新日期:2026年09月15日

GPU作业必须在脚本中声明 --gres=gpu:N,且gpu分区N最大为8(单节点)。跨节点多卡训练请使用 --nodes=2 --ntasks-per-node=8 并配合分布式框架(torchrun/DeepSpeed)。

常见错误:脚本里没有--gres却在GPU分区运行,作业会被调度器拒绝;申请了GPU但进程用CPU跑满,会造成资源浪费并触发低效作业告警。

查看GPU实时占用:ssh到计算节点执行 nvidia-smi,或在srun交互会话中执行。

4090分区适合推理与中小模型调试,A100分区适合大模型训练。合理选择分区可显著缩短排队。