인공지능 (AI), 머신러닝 (ML), 고성능 컴퓨팅 (HPC) 워크로드의 경우 추가 소프트웨어 패키지가 포함되고 최적의 성능을 위해 조정된 맞춤 이미지를 만들어야 하는 경우가 많습니다. 이제 Advanced Compute Images를 사용하여 AI/ML 또는 HPC 워크로드에 최적화된 환경을 설정할 수 있습니다.
Advanced Compute Images는 AI/ML 및 HPC 인프라를 위한 표준화된 이미지 스택을 제공합니다. 이러한 이미지를 사용하면 AI/ML 및 HPC 워크로드용 맞춤 이미지를 수동으로 빌드할 필요가 없습니다.
이점
Advanced Compute Images는 다음과 같은 이점을 제공합니다.
- AI/ML 또는 HPC 워크로드를 기본적으로 사용할 수 있는 컴퓨팅 인스턴스. 긴밀하게 결합된 AI/ML 또는 HPC 워크로드를 위해 수동으로 성능을 미세 조정하거나 인스턴스 재부팅을 관리하거나 Slurm 에이전트를 설치하거나 최신 Cloud de Confiance 업데이트를 유지할 필요가 없습니다.
- 일관되고 재현 가능한 성능 이미지 표준화를 통해 일관되고 재현 가능한 애플리케이션 수준 성능을 얻을 수 있습니다.
고급 컴퓨팅 이미지의 기능
Advanced Compute Images에는 AI/ML 및 HPC 워크로드 실행을 지원하는 여러 구성 레이어가 포함되어 있습니다.
- 운영체제 구성: 자동 업데이트 사용 중지, HPC에 최적화된 ulimit 설정, 커널 sysctl 매개변수 조정, SELinux와 같은 보안 설정 구성이 포함됩니다.
- 네트워크 조정: 다중 대기열 서비스 사용 설정과 같은 네트워크 조정에 필요한 스크립트가 포함되어 있습니다.
- Cloud de Confiance by S3NS integration: Google Cloud CLI 및 운영 에이전트를 설치하고 구성합니다.
- 컨테이너 도구: 다음을 포함한 모든 컨테이너 관련 소프트웨어를 설치하고 구성합니다.
- Docker
- NVIDIA Container Toolkit (버전 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA: 다음 도구를 설치합니다.
MPI: 메시지 전달 인터페이스 (MPI) 라이브러리를 설치합니다. Ubuntu 기반 이미지와 Rocky Linux 기반 이미지 모두에 Open MPI를 설치합니다. Rocky Linux 기반 이미지의 경우 사전 설치된 스크립트를 사용하여 Intel MPI 라이브러리를 설치하고 구성할 수도 있습니다.
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm: 다음을 비롯하여 Slurm 클러스터 노드를 만드는 데 필요한 핵심 구성요소를 설치합니다.
- Slurm 바이너리 (버전 25.11)
- 인증을 위한 Munge
- 프로세스 관리를 위한 PMIx
- JSON 웹 토큰 (JWT)
라이브러리 (
libjwt)
파일 시스템 클라이언트: Cloud Storage FUSE, NFS 유틸리티 (
nfs-utils), Lustre 클라이언트와 같은 다양한 파일 시스템에 액세스하기 위한 클라이언트 측 도구를 설치합니다.개발자 도구: 다음과 같은 일반적인 개발 및 디버깅 도구 체인과 유틸리티를 설치합니다.
환경 관리: 환경 관리 도구(주로 Lmod)를 설치하고 구성하며, 사용자가 모듈 명령어를 사용할 수 있도록 필요한 프로필 스크립트를 설정합니다.
RDMA: 다음을 비롯한 CPU (Rocky Linux 기반) 이미지에 원격 직접 메모리 액세스 (RDMA) 드라이버와 패키지를 설치합니다.
rdma-core및 개발 라이브러리libfabricperftestkmod-idpf-irdma- 지원되는 컴퓨팅 최적화 머신 유형용 Intel 이더넷 RDMA 드라이버infiniband-diags,libibverbs,librdmacm유틸리티
지원되는 하드웨어 및 이미지 계열
ACI는 두 가지 기본 하드웨어 플랫폼을 지원합니다.
CPU (HPC): CPU 워크로드를 지원하고 다음과 같은 특징이 있습니다.
- 컴퓨팅 집약적 워크로드에 최적화되어 있습니다.
- Rocky Linux 9 지원
- Cloud RDMA를 지원하는 RDMA 드라이버 및 유틸리티가 함께 제공됨
- Open MPI 및 구성 가능한 Intel MPI를 비롯한 사전 통합된 MPI 라이브러리가 제공됩니다.
GPU (AI/ML/HPC): GPU 워크로드를 지원하고 다음 특성이 있습니다.
- NVIDIA 가속기에 최적화되어 있습니다.
- Ubuntu LTS 22.04 및 Ubuntu LTS 24.04 지원
- CUDA 및 NVIDIA 드라이버가 사전 통합되어 제공됨
- GPU 간 통신을 위해 MRDMA를 지원하는 RDMA 드라이버 및 유틸리티 포함
- AI, ML 또는 HPC 워크로드에 적합
- Cluster Toolkit에서 A4X, A4, A3 Ultra 머신 유형용 Slurm 클러스터 블루프린트를 배포할 때 기본 이미지가 설치되나요?
| 하드웨어 | OS | 조정자 | 기능 | 아키텍처 | 지원되는 머신 시리즈 | 이미지 계열 |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | 없음 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 8 | 없음 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-8-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D, H3, H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
ARM64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 26.05 |
|
ARM64 | A4X | aci-gpu-u2404-slurm-2605-cuda-132-nvidia-595-arm64 |
| GPU | Ubuntu LTS 24.04 | 없음 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 22.04 | 없음 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
사전 설치된 패키지 (또는 RPM)
고급 컴퓨팅 이미지에는 다양한 도구, 라이브러리, 드라이버, 패키지가 사전 설치되어 있습니다. 이미지에 설치된 항목 목록을 확인하려면 해당 이미지의 매니페스트 파일을 참고하세요.
매니페스트 파일은 /usr/share/google/manifest.txt에서 확인할 수 있습니다.
이미지 계열 수명 주기 단계 및 지원
모든 고급 컴퓨팅 이미지 제품군은 보안, 안정성, 예측 가능한 유지보수 일정을 보장하기 위해 표준화된 수명 주기를 따릅니다. 수명 주기의 각 단계에서 이미지 패밀리는 다음 지원 상태 중 하나를 갖습니다.
- 지원됨:
- 중요한 보안 업데이트 및 버그 수정 수신
- Cloud Customer Care를 통해 지원됩니다.
- 컴퓨팅 인스턴스를 만드는 데 사용할 수 있습니다.
- 지원되지 않음:
- 더 이상 중요한 보안 업데이트나 버그 수정을 받지 않습니다.
- 새로운 기능이 없습니다.
- Cloud Customer Care를 통해 지원되지 않습니다.
- 컴퓨팅 인스턴스를 만드는 데 사용할 수 없습니다.
고급 컴퓨팅 이미지 제품군의 수명 주기는 다음 네 단계로 구성됩니다.
| 수명 주기 단계 | 지원 상태 | 설명 및 영향 |
|---|---|---|
| 활성 | 지원됨 | 새 배포에 권장됩니다. 출시일로부터 12개월 동안 이미지 패밀리가 완전히 지원됩니다. 중요한 보안 업데이트와 버그 수정을 받습니다. |
| 지원 중단됨 (EOS 날짜) | 지원되지 않음 | 지원되는 이미지 계열로 마이그레이션하는 것이 좋습니다. 활성 단계가 종료된 후 약 6개월 동안 이미지 계열이 지원 중단됩니다. 새로운 기능이나 패치가 출시되지 않습니다. 이 이미지 계열을 사용하는 인스턴스를 만들면 Cloud de Confiance 콘솔 및 Google Cloud CLI 경고가 표시됩니다. |
| 사용되지 않음 | 지원되지 않음 | 지원 중단 단계가 종료되면 이미지 계열이 지원 중단됩니다. 이 이미지 계열을 사용하여 더 이상 컴퓨팅 인스턴스를 만들 수 없습니다. 기존 컴퓨팅 인스턴스는 계속 실행되지만 Slurm 컨트롤러와의 비호환성 위험이 있습니다. |
| 삭제 | 지원되지 않음 | 이미지 계열이 지원 중단된 후 3개월이 지나면 기본 고급 컴퓨팅 이미지 이미지 리소스가 영구적으로 삭제됩니다. 기존 컴퓨팅 인스턴스는 계속 실행되지만 Slurm 컨트롤러와의 비호환성 및 취약성 위험이 있습니다. |
이미지 계열의 정확한 지원 종료일에 관한 자세한 내용은 지원되는 하드웨어 및 이미지 계열을 참고하세요.
가격 책정
고급 컴퓨팅 이미지는 추가 비용 없이 사용할 수 있습니다. 고급 컴퓨팅 이미지가 Compute Engine에서 실행되기 때문에 vCPU, GPU, TPU, 디스크, 메모리와 같은 Compute Engine 리소스에 대해 비용이 발생할 수 있습니다. 자세한 내용은 Compute Engine 가격 책정을 참조하세요.
다음 단계
- Advanced Compute Images로 인스턴스 만들기
고급 컴퓨팅 이미지로 턴키 Slurm 클러스터 청사진을 배포하는 방법을 알아보세요.