FAQ:作业结果是NODE_FAIL怎么办?
NODE_FAIL表示运行节点故障,非用户原因。处理方式:直接重新提交即可,调度器会避开故障节点。
预防措施:训练脚本务必定期保存checkpoint(如每30分钟),重启脚本支持--resume参数,可将损失控制在半小时内。
同一作业连续两次NODE_FAIL请反馈至hpc@qmnu.edu.cn,并附sacct -j <jobid>输出。
NODE_FAIL表示运行节点故障,非用户原因。处理方式:直接重新提交即可,调度器会避开故障节点。
预防措施:训练脚本务必定期保存checkpoint(如每30分钟),重启脚本支持--resume参数,可将损失控制在半小时内。
同一作业连续两次NODE_FAIL请反馈至hpc@qmnu.edu.cn,并附sacct -j <jobid>输出。