Managed Service for Apache Spark 주요 개념

이 문서에서는 Managed Service for Apache Spark의 주요 개념, 기본 구성요소, 핵심 기능, 이점을 설명합니다. 이러한 기본 사항을 이해하면 데이터 처리 작업에 Managed Service for Apache Spark를 효과적으로 사용할 수 있습니다.

클러스터 기반 모델

클러스터의 Managed Service for Apache Spark는 Managed Service for Apache Spark를 사용하는 표준적인 인프라 중심 방식입니다. 이를 통해 데이터 처리 작업을 위한 전용 가상 머신 집합을 완전히 제어할 수 있습니다.

  • 클러스터: 클러스터는 Cloud de Confiance by S3NS 가상 머신으로 구성된 개인 데이터 처리 엔진입니다. 클러스터를 만들면 Apache Spark 및 Apache Hadoop과 같은 오픈소스 프레임워크를 실행할 수 있습니다. 사용자는 클러스터 크기, 머신 유형, 구성을 완전히 제어할 수 있습니다.
  • 작업: 작업은 PySpark 스크립트 또는 Hadoop 쿼리와 같은 특정 작업입니다. 클러스터에서 직접 작업을 실행하는 대신 작업을 Managed Service for Apache Spark에 제출하면 Managed Service for Apache Spark가 사용자를 대신하여 작업 실행을 관리합니다. 클러스터에 여러 작업을 제출할 수 있습니다.
  • 워크플로 템플릿: 워크플로 템플릿은 일련의 작업(워크플로)을 조정하는 재사용 가능한 정의입니다. 예를 들어 데이터 정리 작업이 성공적으로 완료된 후에만 머신러닝 작업을 실행하도록 하는 등 작업 간 종속성을 정의할 수 있습니다. 템플릿화된 워크플로는 기존 클러스터나 워크플로를 실행하기 위해 생성된 후 워크플로가 완료되면 삭제되는 임시 클러스터에서 실행할 수 있습니다. 필요할 때마다 템플릿을 사용하여 정의된 워크플로를 실행할 수 있습니다.
  • 자동 확장 정책: 자동 확장 정책에는 클러스터 비용과 성능을 동적으로 최적화하기 위해 클러스터 워크로드에 따라 클러스터에서 작업자 머신을 추가하거나 삭제하도록 정의하는 규칙이 포함되어 있습니다.

환경 맞춤설정

클러스터의 Managed Service for Apache Spark는 애플리케이션 환경을 맞춤설정하는 데 사용할 수 있는 클러스터 기능과 구성요소를 제공합니다.

노트북 및 개발 환경

Managed Service for Apache Spark 서버리스 노트북과 IDE는 코드를 작성하고 실행할 수 있는 통합 개발 환경에 연결됩니다.

  • BigQuery Studio 및 Workbench: 통합 분석 및 노트북 환경입니다. 이를 통해 코드를 작성하고 (예: Jupyter 노트북 내) Managed Service for Apache Spark 클러스터 또는 서버리스 세션을 강력한 백엔드 엔진으로 사용하여 대규모 데이터 세트에서 코드를 실행할 수 있습니다.
  • Managed Service for Apache Spark JupyterLab 플러그인: 이 공식 JupyterLabextension은 노트북 환경 내에서 Managed Service for Apache Spark 서버리스의 제어판 역할을 합니다. 이를 사용하면 Jupyter 인터페이스를 벗어나지 않고도 클러스터를 탐색, 생성, 관리하고 작업을 제출할 수 있으므로 워크플로가 간소화됩니다.
  • Google Cloud Data Agent Kit: Data Agent Kit를 사용하면 데이터 과학자, 엔지니어, 개발자가 IDE 내에서 전체 데이터 워크로드 수명 주기를 관리할 수 있습니다. Data Agent Kit는 Managed Service for Apache Spark를 지원하므로 VS Code 또는 지원되는 에이전트 CLI에서 직접 코드를 개발하고, 대화형 세션을 만들고, 파이프라인을 빌드할 수 있습니다.
  • Managed Service for Apache Spark Connect Python 커넥터: 이 Python 라이브러리는 Managed Service for Apache Spark에서 Spark Connect를 사용하는 프로세스를 간소화합니다. 인증 및 엔드포인트 구성을 처리하므로 노트북이나 IDE와 같은 로컬 Python 환경을 대화형 개발을 위한 원격 Managed Service for Apache Spark 클러스터에 훨씬 간단하게 연결할 수 있습니다.