View a markdown version of this page

とはAWS Glue DataBrew - AWS Glue DataBrewデベロッパーガイド

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

とはAWS Glue DataBrew

AWS Glue DataBrewは、ユーザーがコードを記述せずにデータをクリーンアップおよび正規化できるようにするビジュアルデータ準備ツールです。DataBrew を使用すると、カスタム開発のデータ準備と比較して、分析と機械学習 (ML) のためのデータ準備にかかる時間を最大 80% 短縮できます。250 を超える既製の変換から選択して、異常のフィルタリング、データの標準形式への変換、無効な値の修正など、データ準備タスクを自動化できます。

DataBrew を使用すると、ビジネスアナリスト、データサイエンティスト、データエンジニアは、より簡単にコラボレーションして raw データからインサイトを得ることができます。DataBrew はサーバーレスであるため、技術的なレベルに関係なく、クラスターの作成やインフラストラクチャの管理を必要とせずに、テラバイトの未加工データを探索して変換できます。

直感的な DataBrew インターフェイスを使用すると、raw データをインタラクティブに検出、視覚化、クリーンアップ、変換できます。DataBrew は、検出が難しく、修正に時間がかかるデータ品質の問題を特定するのに役立つ賢明な提案を行います。DataBrew がデータを準備することで、時間を使って結果に対応し、より迅速に反復処理できます。変換をレシピのステップとして保存し、後で他のデータセットで更新または再利用して、継続的にデプロイできます。

次の図は、DataBrew が高レベルでどのように機能するかを示しています。

DataBrew の仕組みに関する簡単な図。DataBrew は、コードを記述することなく、データを視覚的にクリーンアップ、準備、変換できます。ボックスには、Amazon S3 から DataBrew に入るデータが表示されます。 Amazon S3 DataBrew が実行できるいくつかの変換のボックスが表示されます。変換ボックスには、データのフォーマット、クリーンアップ、標準化が含まれます。データを再構築して変換します。欠落しているデータや無効なデータを処理します。カテゴリ変数を処理します。数値変数を処理します。自然言語処理を使用します。この図は、データが準備済みデータセットとして S3 にエクスポートされていることを示しています。

DataBrew を使用するには、プロジェクトを作成し、データに接続します。プロジェクトワークスペースには、グリッドのようなビジュアルインターフェイスにデータが表示されます。ここでは、データを調べ、値の分布とグラフを表示して、そのプロファイルを理解できます。

データを準備するには、250 を超えるpoint-and-click変換から選択できます。これには、null の削除、欠損値の置換、スキーマの不整合の修正、関数に基づく列の作成などが含まれます。変換を使用して自然言語処理 (NLP) 手法を適用し、文をフレーズに分割することもできます。即時プレビューでは、変換前と変換後のデータの一部が表示されるため、データセット全体に適用する前にレシピを変更できます。

DataBrew がデータセットでレシピを実行すると、出力は Amazon Simple Storage Service (Amazon S3) に保存されます。準備済みデータセットが Amazon S3 にクリーンアップされると、別のデータストレージまたはデータ管理システムがそのデータセットを取り込むことができます。