翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
容量RUNNABLEが原因でジョブがスタックする
次のシナリオでは、 が容量不足の状態 AWS Batch を特定する方法について説明します。
- インスタンス容量が不十分
-
AWS Batch は、SageMaker Training ジョブが受信した 2 つのレスポンスセットを、インスタンス容量が不十分な場合に解釈します。これらが受信されるたびに、 は
statusReasonの対応する AWS Batch を設定しますCAPACITY:INSUFFICIENT_INSTANCE_CAPACITY。いずれの場合も、対応する AWS Batch ジョブがジョブの送信
SCHEDULEDと失敗の間に費やされた時間は、ジョブの送信の間に累積され、 と比較されますmaxTimeSeconds。シナリオ
TrainingJobStatusインジケータ
トレーニングジョブが容量エラーで失敗する
FAILEDfailedReasonで始まるCapacityErrorトレーニングジョブがキャパシティーの待機をタイムアウトする
STOPPEDsecondaryStatusは、キャパシティーの待機中にジョブがタイムアウトしたことを示します。これらのいずれかのケースがヒットした場合、 AWS Batch はジョブで容量不足が発生していると見なします。
-
ジョブがスタックしているときの
statusReasonメッセージ:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY - Unable to provision requested compute resources -
jobStateTimeLimitActionsに使用されるreason:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY -
statusReasonによってジョブが終了した後の メッセージjobStateTimeLimitActions:Terminated by JobStateTimeLimit action due to reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY
-