Beschränkungen
Metastores mit Hive 4.2:Die Image-Version
3.0unterstützt BigQuery Metastore, BigLake Metastore oder Dataproc Metastore mit Hive 4.2 nicht. Direkte Hive-Abfragen mit diesen Metastores werden nicht unterstützt.Delta Lake mit Hive: Delta Lake
4.x, das in der Image-Version3.0von Managed Service for Apache Spark enthalten ist, unterstützt Hive nicht. Abfragen für Delta Lake 4.2-Tabellen können nicht in Hive ausgeführt werden.Iceberg mit Hive:Die Managed Service for Apache Spark-Imageversion
3.0enthält Hive 4.2, das Iceberg über den Iceberg REST-Katalog unterstützt.GPU-Cluster:Alle
3.0-Imageversionen außer3.0-ml-ubuntuermöglichencgroups V2. Da YARN die GPU-Erkennung nicht unterstützt, wenncgroups V2aktiviert ist, müssen Sie das3.0-ml-ubuntu-Image verwenden, wenn Sie Cluster mit GPUs erstellen.
Hinweise:
Version
3.0ist ein schlankes Image, das nur Kernkomponenten enthält. Dadurch wird das Risiko von Common Vulnerabilities and Exposures (CVEs) verringert. Wenn Sie höhere Sicherheitsanforderungen erfüllen müssen, verwenden Sie beim Erstellen eines Managed Service for Apache Spark-Clusters die Image-Version2.3oder höher.Wenn Sie beim Erstellen eines Managed Service for Apache Spark-Clusters mit dem
3.0-Image optionale Komponenten installieren, werden diese während der Clustererstellung heruntergeladen und installiert. Dies kann die Startzeit des Clusters erhöhen. Um diese Verzögerung zu vermeiden, können Sie ein benutzerdefiniertes Image mit den vorinstallierten optionalen Komponenten erstellen. Dazu wirdgenerate_custom_image.pymit dem Flag--optional-componentsausgeführt.Die folgenden optionalen Komponenten werden in 3.0-Images unterstützt:
- Apache Flink
- Apache Hive WebHCat
- Apache Iceberg
- Apache Pig
- Apache Ranger
- Apache Solr
- Apache Zeppelin-Notebook
- Apache Zookeeper
- Delta Lake
- Docker
- JupyterLab-Notebook
- Trino
yarn.nodemanager.recovery.enabledund HDFS-Audit-Logging sind in Version 3.0-Images standardmäßig aktiviert.Pixi wird im Rahmen der Python-Installation installiert und zum Installieren von Python-Paketen anstelle von Conda verwendet.
Der Standardressourcenrechner für YARN wurde von DefaultResourceCalculator zu DominantResourceCalculator geändert. Dieser verwendet das Konzept der dominanten Ressource, um die Ressourcenzuweisung zu bestimmen, z. B. die Zuweisung von Arbeitsspeicher und CPU. Diese Änderung wirkt sich auf Autoscaler aus, der basierend auf der dominanten Ressourcennutzung des Clusters skaliert.
Ab der Imageversion
3.0wird beim Erstellen eines Clusters ohne Angabe eines Maschinentyps für einen Clusterknoten der Knoten mit einer sortierten Liste flexibler VM-Maschinentypen angegeben, z. B. eine sortierte Liste von Maschinentypen der Serien N4, N2 und E2. Die Liste ist für die Ressourcenverfügbarkeit optimiert.