本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
由于容量问题,作业停留在 “可运行” 状态
以下场景描述了如何 AWS Batch 识别容量不足的情况。
- 实例容量不足
-
AWS Batch 将 SageMaker 训练作业收到的两组响应解释为实例容量不足的情况。每当收到这些信息时,都会将对应
statusReason的 AWS Batch 设置为CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY。在这两种情况下,相应 AWS Batch 工作在提交作业和失败
SCHEDULED之间所花费的时间都累积在两次提交作业之间,以便与之进行比较maxTimeSeconds。场景
TrainingJobStatus指示器
训练作业因容量错误而失败
FAILEDfailedReason开始于CapacityError等待容量时,训练作业超时
STOPPEDsecondaryStatus表示任务在等待容量等待时已超时如果这两个案例中的任何一个都被击中,则 AWS Batch 会认为该工作容量不足。
-
作业卡住时的
statusReason消息:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY - Unable to provision requested compute resources -
用于
jobStateTimeLimitActions的reason:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY -
statusReason任务终止后的消息jobStateTimeLimitActions:Terminated by JobStateTimeLimit action due to reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY
-