View a markdown version of this page

AWS Glue DataBrew란 무엇인가요? - AWS Glue DataBrew개발자 안내서

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

AWS Glue DataBrew란 무엇인가요?

AWS Glue DataBrew는 사용자가 코드를 작성하지 않고도 데이터를 정리하고 정규화할 수 있는 시각적 데이터 준비 도구입니다. DataBrew를 사용하면 분석 및 기계 학습(ML)을 위한 데이터를 준비하는 데 걸리는 시간을 사용자 지정 개발 데이터 준비에 비해 최대 80% 줄일 수 있습니다. 250개 이상의 미리 만들어진 변환 중에서 선택하여 이상 필터링, 데이터를 표준 형식으로 변환, 잘못된 값 수정과 같은 데이터 준비 작업을 자동화할 수 있습니다.

DataBrew를 사용하면 비즈니스 분석가, 데이터 과학자 및 데이터 엔지니어가 더 쉽게 협업하여 원시 데이터에서 인사이트를 얻을 수 있습니다. DataBrew는 서버리스이므로 기술 수준에 관계없이 클러스터를 생성하거나 인프라를 관리할 필요 없이 테라바이트의 원시 데이터를 탐색하고 변환할 수 있습니다.

직관적인 DataBrew 인터페이스를 사용하면 원시 데이터를 대화식으로 검색, 시각화, 정리 및 변환할 수 있습니다. DataBrew는 찾기 어렵고 수정하는 데 시간이 많이 걸릴 수 있는 데이터 품질 문제를 식별하는 데 도움이 되는 스마트 제안을 제공합니다. DataBrew에서 데이터를 준비하면 시간을 사용하여 결과에 따라 작업하고 더 빠르게 반복할 수 있습니다. 변환을 레시피의 단계로 저장할 수 있으며, 나중에 다른 데이터 세트와 함께 업데이트하거나 재사용하고 지속적으로 배포할 수 있습니다.

다음 이미지는 DataBrew가 높은 수준에서 작동하는 방식을 보여줍니다.

DataBrew 작동 방식에 대한 간단한 다이어그램입니다. DataBrew는 코드를 작성할 필요 없이 데이터를 시각적으로 정리, 준비 및 변환할 수 있습니다. 상자에는 Amazon S3에서 DataBrew로 들어오는 데이터가 표시됩니다. DataBrew가 수행할 수 있는 몇 가지 변환에 대한 상자를 보여줍니다. 변환 상자에는 데이터 형식 지정, 정리 및 표준화가 포함됩니다. 데이터를 재구성하고 변환합니다. 누락되거나 잘못된 데이터를 처리합니다. 범주형 변수를 처리합니다. 숫자 변수를 처리합니다. 자연어 처리를 사용합니다. 다이어그램은 데이터가 준비된 데이터 세트로 S3로 내보내졌음을 보여줍니다.

DataBrew를 사용하려면 프로젝트를 생성하고 데이터에 연결합니다. 프로젝트 워크스페이스에는 그리드와 같은 시각적 인터페이스에 데이터가 표시됩니다. 여기에서 데이터를 탐색하고 값 분포 및 차트를 확인하여 프로파일을 이해할 수 있습니다.

데이터를 준비하려면 250개 이상의 point-and-click 변환 중에서 선택할 수 있습니다. 여기에는 null 제거, 누락된 값 대체, 스키마 불일치 수정, 함수를 기반으로 열 생성 등이 포함됩니다. 변환을 사용하여 자연어 처리(NLP) 기술을 적용하여 문장을 문구로 분할할 수도 있습니다. 즉시 미리 보기는 변환 전후의 데이터 일부를 표시하므로 전체 데이터 세트에 적용하기 전에 레시피를 수정할 수 있습니다.

DataBrew가 데이터 세트에서 레시피를 실행한 후 출력은 Amazon Simple Storage Service(Amazon S3)에 저장됩니다. 정리되고 준비된 데이터 세트가 Amazon S3에 있으면 다른 데이터 스토리지 또는 데이터 관리 시스템에서 데이터를 수집할 수 있습니다.