翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
AWS Glue DataBrewプロファイルジョブの作成と操作
プロファイルジョブはデータセットに対して一連の評価を実行し、結果を Amazon S3 に出力します。データプロファイリングが収集する情報は、データセットを理解し、レシピジョブで実行するデータ準備ステップの種類を決定するのに役立ちます。
プロファイルジョブを実行する最も簡単な方法は、デフォルトの DataBrew 設定を使用することです。プロファイルジョブを実行する前に、必要な情報のみが返されるように設定できます。
DataBrew プロファイルジョブを作成するには、次の手順に従います。
プロファイルジョブを作成するには
にサインインAWS マネジメントコンソールし、https://console.aws.amazon.com/databrew/
で DataBrew コンソールを開きます。 ナビゲーションペインから JOBS を選択し、プロファイルジョブタブを選択し、ジョブの作成を選択します。
-
ジョブの名前を入力し、プロファイルジョブの作成を選択します。
ジョブ入力には、プロファイリングするデータセットの名前を指定します。
(オプション) データプロファイル設定ペインで以下を設定します。
-
データセットレベルの設定 – データセット内のすべての列のプロファイルジョブの詳細を設定します。
必要に応じて、データセット内の重複行を検出してカウントする機能をオンにできます。相関行列を有効にし、列を選択して、複数の列の値の関連性を確認することもできます。データセットレベルで設定できる統計の詳細については、「」を参照してくださいデータセットレベルで設定可能な統計。DataBrew コンソール、または DataBrew API またはAWS SDKs を使用して統計を設定できます。
-
列レベルの設定 – デフォルトのプロファイル設定を使用して、プロファイルジョブに含める列を選択できます。設定の上書きの追加を使用して、収集される統計の数を制限する列を選択するか、特定の統計のデフォルト設定を上書きします。列レベルで設定できる統計の詳細については、「」を参照してください列レベルで設定可能な統計。DataBrew コンソール、または DataBrew API またはAWS SDKs を使用して統計を設定できます。
指定した設定オーバーライドが、プロファイルジョブに含めた列に適用されることを確認してください。列に対して設定した異なるオーバーライド間に競合がある場合、最後の競合するオーバーライドが優先されます。
-
(オプション) データ品質ルールを作成し、このデータセットに関連付けられた追加のルールセットを適用するか、既に適用されているルールセットを削除できます。データ品質検証の詳細については、「」を参照してくださいでのデータ品質の検証AWS Glue DataBrew。
-
高度なジョブ設定ペインで、ジョブの実行方法のその他のオプションを選択できます。
-
最大ユニット数 – DataBrew は複数のコンピューティングノードを使用してジョブを処理し、並行して実行されます。ノードのデフォルト数は 5 です。ノードの最大数は 149 です。
-
ジョブのタイムアウト – ジョブの実行にここで設定した分数を超えると、タイムアウトエラーで失敗します。デフォルト値は 2,880 分、つまり 48 時間です。
-
再試行回数 – 実行中にジョブが失敗した場合、DataBrew は再度実行を試みることができます。デフォルトでは、ジョブは再試行されません。
-
ジョブの Amazon CloudWatch Logs を有効にする – DataBrew が CloudWatch Logs に診断情報を公開できるようにします。これらのログは、トラブルシューティングの目的や、ジョブの処理方法の詳細に役立ちます。
-
-
関連付けられたスケジュールでは、DataBrew ジョブスケジュールを適用して、ジョブを特定の時間または定期的に実行できます。詳細については、「スケジュールによるジョブ実行の自動化」を参照してください。
-
設定が目的どおりになったら、ジョブの作成を選択します。または、ジョブをすぐに実行する場合は、ジョブの作成と実行を選択します。