Hinweise:
Version
2.3ist ein schlankes Image, das nur Kernkomponenten enthält. Dadurch wird das Risiko von Common Vulnerabilities and Exposures (CVEs) verringert. Wenn Sie höhere Sicherheitsanforderungen erfüllen müssen, verwenden Sie beim Erstellen eines Managed Service for Apache Spark-Clusters die Image-Version2.3oder höher.Wenn Sie beim Erstellen eines Managed Service for Apache Spark-Clusters mit dem
2.3-Image optionale Komponenten installieren, werden diese während der Clustererstellung heruntergeladen und installiert. Dadurch kann sich die Startzeit des Clusters verlängern. Um diese Verzögerung zu vermeiden, können Sie ein benutzerdefiniertes Image mit den vorinstallierten optionalen Komponenten erstellen. Dazu führen Siegenerate_custom_image.pymit dem Flag--optional-componentsaus.Die Image-Versionen
2.3.32,2.3.36und höher haben keine vorkonfigurierten Conda-Channels. Pakete können mit Conda nur installiert werden, wenn Channels während der Clusterinitialisierung manuell konfiguriert werden. Außerdem können Cluster mit der Image-Version2.3, die vorkonfigurierte Conda-Kanäle haben, einschließlich der Image-Versionen2.3.35und früher, aber ohne2.3.32, nach dem 25. August 2026 nicht mehr verwendet werden.- Möglicherweise müssen Sie vorhandene Cluster löschen und ersetzen. Nach dem 25. August 2026 müssen vorhandene Cluster, die mit Images mit vorkonfigurierten Conda-Channels erstellt wurden, gelöscht und durch neue Cluster ersetzt werden, die mit Images ohne vorkonfigurierte Conda-Channels erstellt oder neu erstellt wurden. Das gilt auch dann, wenn in Clusterjobs keine Conda-Channels zum Installieren von Paketen verwendet werden.
Die folgenden optionalen Komponenten werden in Nicht-ARM-Images der Version 2.3 unterstützt:
- Apache Flink
- Apache Hive WebHCat
- Apache Hudi
- Apache Iceberg
- Apache Pig
- Delta Lake
- Docker
- JupyterLab-Notebook
- Ranger
- Solr
- Trino
- Zeppelin-Notebook
- Zookeeper
2.3.x-*-arm-Images unterstützen nur die vorinstallierten Komponenten und die folgenden optionalen Komponenten. Die anderen optionalen 2.3-Komponenten und alle Initialisierungsaktionen werden nicht unterstützt:- Apache Hive WebHCat
- Apache Pig (ab
2.3.22-ubuntu22-arm) - Docker
- Zeppelin-Notebook
- Zookeeper (in Hochverfügbarkeitsclustern installiert; optionale Komponente in anderen Clustern)
Lightning Engine und Ausführung nativer Abfragen auf ARM: Unterstützt auf
2.3-ubuntu22-arm-Images.yarn.nodemanager.recovery.enabledund HDFS-Audit-Logging sind in 2.3-Images standardmäßig aktiviert.micromambawird anstelle voncondain früheren Bildversionen im Rahmen der Python-Installation installiert.Apache Iceberg-Version: In Version 2.3 ist Apache Iceberg in den Versionen
1.6.1und1.10verfügbar. Die Standardversion ist1.6.1. Ab der Image-Version2.3.35verwenden 2.3-Cluster, die mit aktivierter Lightning Engine erstellt wurden, standardmäßig die Iceberg-Version1.10. Wenn Sie die Iceberg-Version für einen beliebigen Cluster mit Version 2.3 angeben möchten, legen Sie beim Erstellen des Clusters die Cluster-Propertydataproc:dataproc.iceberg.versionauf1.10(oder1.6) fest.Probleme bei der Docker- und Zeppelin-Installation:
- Die Installation schlägt fehl, wenn der Cluster keinen öffentlichen Internetzugang hat. Als Workaround können Sie einen Cluster erstellen, der ein benutzerdefiniertes Image mit vorinstallierten optionalen Komponenten verwendet. Führen Sie dazu
generate_custom_image.pymit dem Flag--optional-componentsaus. - Die Installation kann fehlschlagen, wenn der Cluster an eine ältere untergeordnete Image-Version angepinnt ist: Pakete werden bei Bedarf aus öffentlichen OSS-Repositories installiert und ein Paket ist möglicherweise nicht upstream verfügbar, um die Installation zu unterstützen.
Erstellen Sie als Behelfslösung einen Cluster, der ein benutzerdefiniertes Image mit optionalen Komponenten verwendet, die im benutzerdefinierten Image vorinstalliert sind. Führen Sie dazu
generate_custom_image.pymit dem Flag--optional-componentsaus.
- Die Installation schlägt fehl, wenn der Cluster keinen öffentlichen Internetzugang hat. Als Workaround können Sie einen Cluster erstellen, der ein benutzerdefiniertes Image mit vorinstallierten optionalen Komponenten verwendet. Führen Sie dazu
Der Standard-Ressourcenrechner für YARN wurde von DefaultResourceCalculator in DominantResourceCalculator geändert. Dieser verwendet das Konzept der dominanten Ressource, um die Ressourcenzuweisung zu bestimmen, z. B. die Speicher- und CPU-Zuweisung. Diese Änderung wirkt sich auf den Autoscaler aus, der auf der Grundlage der dominanten Ressourcennutzung des Clusters skaliert wird.
Bildversion 2.3 der Komponenten für maschinelles Lernen (ML)
Das Managed Service for Apache Spark-Image 2.3-ml-ubuntu erweitert das Basis-Image 2.3 um ML-spezifische Software. Sie unterstützt optionale Komponenten von Image 2.3 und andere Funktionen von Version 2.3 und fügt die in den folgenden Abschnitten aufgeführten Komponentenversionen hinzu.
GPU-spezifische Bibliotheken
Für Managed Service for Apache Spark-Jobs, die GPU-VMs verwenden, sind die folgenden NVIDIA-Treiber und ‑Bibliotheken im 2.3-ml-ubuntu-Image verfügbar. Sie können sie für die folgenden Aufgaben verwenden:
- Spark-Batch-Arbeitslasten mit der NVIDIA Spark Rapids-Bibliothek beschleunigen
- Machine-Learning-Arbeitslasten trainieren
- Verteilte Batchinferenz mit Spark ausführen
| Paketname | Version |
|---|---|
| Spark Rapids | 25.04.0 |
| NVIDIA-Treiber | Ubuntu 22.04 LTS, beschleunigt mit NVIDIA-Treiberversion 570 |
| CUDA | 12.6.3 |
| cublas | 12.6.4 |
| cusolver | 11.7.1 |
| cupti | 12.6.80 |
| cusparse | 12.5.4 |
| cuDNN | 9.10.1 |
| NCCL | 2.27.5 |
XGBoost-Bibliotheken
Die folgenden Maven-Paketversionen sind im Image 2.3-ml-ubuntu verfügbar, damit Sie XGBoost mit Spark in Java oder Scala verwenden können.
| Gruppen-ID | Paketname | Version |
|---|---|---|
| ml.dmlc | xgboost4j-gpu_2.12 | 2.1.1 |
| ml.dmlc | xgboost4j-spark-gpu_2.12 | 2.1.1 |
Python-Bibliotheken
Das 2.3-ml-ubuntu-Image enthält die folgenden Bibliotheken, die verschiedene Phasen im ML-Lebenszyklus unterstützen.
| Paket | Version |
|---|---|
| beschleunigen | 1.8.1 |
| conda | 23.11.0 |
| cookiecutter | 2.5.0 |
| curl | 8.12.1 |
| cython | 3.0.12 |
| dask | 1.12.2023 |
| Datasets | 3.6.0 |
| deepspeed | 0.17.2 |
| delta-spark | 3.2.0 |
| evaluate | 0.4.5 |
| fastavro | 1.9.7 |
| fastparquet | 1.10.2023 |
| fiona | 1.10.0 |
| gateway-provisioners[yarn] | 0.4.0 |
| gcsfs | 2023.12.2.post1 |
| google-auth-oauthlib | 1.2.2 |
| google-cloud-aiplatform | 1.88.0 |
| google-cloud-bigquery[pandas] | 3.31.0 |
| google-cloud-bigquery-storage | 2.30.0 |
| google-cloud-bigtable | 2.30.1 |
| google-cloud-container | 2.56.1 |
| google-cloud-datacatalog | 3.26.1 |
| google-cloud-dataproc | 5.18.1 |
| google-cloud-datastore | 2.21.0 |
| google-cloud-language | 2.17.2 |
| google-cloud-logging | 3.11.4 |
| google-cloud-monitoring | 2.27.2 |
| google-cloud-pubsub | 2.29.1 |
| google-cloud-redis | 2.18.1 |
| google-cloud-spanner | 3.53.0 |
| google-cloud-speech | 2.32.0 |
| google-cloud-storage | 2.19.0 |
| google-cloud-texttospeech | 2.25.1 |
| google-cloud-translate | 3.20.3 |
| google-cloud-vision | 3.10.2 |
| huggingface_hub | 0.33.1 |
| httplib2 | 0.22.0 |
| ipyparallel | 8.6.1 |
| ipython-sql | 0.3.9 |
| ipywidgets | 8.1.7 |
| jupyter_contrib_nbextensions | 0.7.0 |
| jupyter_http_over_ws | 0.0.8 |
| jupyter_kernel_gateway | 2.5.2 |
| jupyter_server | 1.24.0 |
| jupyterhub | 4.1.6 |
| jupyterlab | 3.6.8 |
| jupyterlab-git | 0.44.0 |
| jupyterlab_widgets | 3.0.15 |
| Koalas | 0.22.0 |
| langchain | 0.3.26 |
| lightgbm | 4.6.0 |
| Markdown | 3.5.2 |
| matplotlib | 3.8.4 |
| mlflow | 3.1.1 |
| nbconvert | 7.14.2 |
| nbdime | 3.2.1 |
| nltk | 3.9.1 |
| Notebook | 6.5.7 |
| numba | 0.58.1 |
| numpy | 1.26.4 |
| oauth2client | 4.1.3 |
| onnx | 1.17.0 |
| openblas | 0.3.25 |
| opencv | 4.11.0 |
| orc | 2.1.1 |
| pandas | 2.1.4 |
| pandas-profiling | 3.0.0 |
| Papierfabrik | 2.4.0 |
| pyarrow | 16.1.0 |
| pydot | 2.0.0 |
| pyhive | 0.7.0 |
| pynvml | 12.0.0 |
| pysal | 23.7 |
| pytables | 3.9.2 |
| Python | 3.11 |
| regex | 25.12.2023 |
| Anfragen | 2.32.2 |
| requests-kerberos | 0.12.0 |
| rtree | 1.1.0 |
| scikit-image | 0.22.0 |
| scikit-learn | 1.5.2 |
| scipy | 1.11.4 |
| seaborn | 0.13.2 |
| sentence-transformers | 5.0.0 |
| setuptools | 79.0.1 |
| shap | 0.48.0 |
| wohlgeformt | 2.1.1 |
| spacy | 3.8.7 |
| spark-tensorflow-distributor | 1.0.0 |
| spyder | 5.5.6 |
| sqlalchemy | 2.0.41 |
| sympy | 1.13.3 |
| tensorflow | 2.18.0 |
| Tokenizer | 0.21.4.dev0 |
| Toree | 0.5.0 |
| Fackel | 2.6.0 |
| torch-model-archiver | 0.11.1 |
| torcheval | 0.0.7 |
| Tornado | 6.4.2 |
| torchvision | 0.21.0 |
| Traitlets | 5.14.3 |
| transformers | 4.53.1 |
| uritemplate | 4.1.1 |
| virtualenv | 20.26.6 |
| wordcloud | 1.9.4 |
| xgboost | 2.1.4 |
R-Bibliotheken
Die folgenden R-Bibliotheksversionen sind im 2.3-ml-ubuntu-Image enthalten.
| Paketname | Version |
|---|---|
| r-ggplot2 | 3.4.4 |
| r-irkernel | 1.3.2 |
| r-rcurl | 1.98-1.16 |
| r-recommended | 4.3 |