本文档介绍了 Managed Service for Apache Spark 的关键概念、基本构建块、核心功能和优势。了解这些基础知识有助于您有效地使用 Managed Service for Apache Spark 来完成数据处理任务。
基于集群的模型
在集群上使用 Managed Service for Apache Spark 是以基础设施为中心的标准方式。可让您完全控制一组专用的虚拟机,以执行数据处理任务。
- 集群:集群是您的个人数据处理引擎,由 Cloud de Confiance by S3NS 虚拟机组成。您可以创建集群来运行 Apache Spark 和 Apache Hadoop 等开源框架。您可以完全控制集群大小、机器类型和配置。
- 作业:作业是一项特定任务,例如 PySpark 脚本或 Hadoop 查询。 您无需直接在集群上运行作业,而是将作业提交给 Managed Service for Apache Spark,后者会为您管理作业执行。您可以将多个作业提交到集群。
- 工作流模板:工作流模板是一种可重复使用的定义,用于编排一系列作业(工作流)。它可以定义作业之间的依赖关系,例如仅在数据清理作业成功完成后才运行机器学习作业。模板化工作流可以在现有集群上运行,也可以在为运行工作流而创建的临时集群上运行,然后在工作流完成后删除该集群。您可以根据需要使用该模板运行定义的工作流。
- 自动扩缩政策:自动扩缩政策包含您定义的规则,用于根据集群工作负载向集群添加或从中移除工作器机器,以便动态优化集群成本和性能。
环境自定义
集群上的 Managed Service for Apache Spark 提供集群功能和组件,您可以使用这些功能和组件自定义应用环境。
笔记本和开发环境
Managed Service for Apache Spark 无服务器笔记本和 IDE 会链接到集成式开发环境,您可以在其中编写和执行代码。
- BigQuery Studio 和 Workbench:这些是统一的分析和笔记本环境。借助这些环境,您可以编写代码(例如在 Jupyter 笔记本中),并使用 Managed Service for Apache Spark 集群或无服务器会话作为强大的后端引擎,用于在大型数据集上执行代码。
- Managed Service for Apache Spark JupyterLab 插件:此官方
JupyterLabextension可充当笔记本环境中的 Managed Service for Apache Spark 无服务器控制面板。它简化了您的工作流程,让您无需离开 Jupyter 界面即可浏览、创建和管理集群以及提交作业。 - Google Cloud Data Agent Kit:借助 Data Agent Kit,数据科学家、工程师和开发者可以在 IDE 中管理整个数据工作负载生命周期。Data Agent Kit 为 Managed Service for Apache Spark 提供支持,使您能够直接从 VS Code 或受支持的智能体 CLI 开发代码、创建互动式会话和构建流水线。
- Managed Service for Apache Spark Connect Python 连接器:此 Python 库简化了将 Spark Connect 与 Managed Service for Apache Spark 搭配使用的流程。它可处理身份验证和端点配置,从而让您能够更轻松地将本地 Python 环境(例如笔记本或 IDE)连接到远程 Managed Service for Apache Spark 集群,以进行交互式开发。