View a markdown version of this page

容量RUNNABLEが原因でジョブがスタックする - AWS Batch

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

容量RUNNABLEが原因でジョブがスタックする

次のシナリオでは、 が容量不足の状態 AWS Batch を特定する方法について説明します。

インスタンス容量が不十分

AWS Batch は、SageMaker Training ジョブが受信した 2 つのレスポンスセットを、インスタンス容量が不十分な場合に解釈します。これらが受信されるたびに、 は statusReasonの対応する AWS Batch を設定しますCAPACITY:INSUFFICIENT_INSTANCE_CAPACITY

いずれの場合も、対応する AWS Batch ジョブがジョブの送信SCHEDULEDと失敗の間に費やされた時間は、ジョブの送信の間に累積され、 と比較されますmaxTimeSeconds

シナリオ

TrainingJobStatus

インジケータ

トレーニングジョブが容量エラーで失敗する

FAILED

failedReason で始まる CapacityError

トレーニングジョブがキャパシティーの待機をタイムアウトする

STOPPED

secondaryStatus は、キャパシティーの待機中にジョブがタイムアウトしたことを示します。

これらのいずれかのケースがヒットした場合、 AWS Batch はジョブで容量不足が発生していると見なします。

  • ジョブがスタックしているときの statusReason メッセージ: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY - Unable to provision requested compute resources

  • jobStateTimeLimitActions に使用される reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY

  • statusReason によってジョブが終了した後の メッセージjobStateTimeLimitActions: Terminated by JobStateTimeLimit action due to reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY