En esta página, se describe Rapid Bucket, una función que te permite almacenar objetos en la clase de almacenamiento Rapid si estableces una zona como la ubicación de un bucket. Este enfoque te permite ubicar tu almacenamiento de datos junto con tus recursos de procesamiento, lo que ofrece una latencia significativamente menor y una capacidad de procesamiento más alta en comparación con otras clases de almacenamiento en Cloud Storage. Las cargas de trabajo en otras zonas y regiones también pueden acceder al bucket, con un rendimiento relativo a la distancia de la red.
Para crear un bucket zonal con Rapid Bucket, consulta Crea buckets zonales. Puedes ver la lista de ubicaciones compatibles en Zonas. Para leer y agregar objetos en buckets zonales, consulta Usa objetos en buckets zonales.
Para que Rapid Bucket esté habilitado en un bucket, este también debe tener habilitado el espacio de nombres jerárquico y el acceso uniforme a nivel de bucket.
Funciones y beneficios
Rapid Bucket se creó para quitar los cuellos de botella de almacenamiento y es ideal para usar en tus aplicaciones con mayor uso de datos, como la IA y el AA, y el análisis de datos. Rapid Bucket admite una latencia inferior a un milisegundo, hasta 15 TB/s de capacidad de procesamiento agregada y 20 millones de consultas por segundo (QPS). La latencia ultrabaja permite la recuperación instantánea de datos y permite que las aplicaciones de inferencia en tiempo real se ejecuten a gran escala. La capacidad de procesamiento masiva y las QPS altas ayudan a mantener saturados por completo tus costosos clústeres de GPU, lo que reduce de forma drástica los tiempos de entrenamiento de modelos.
Además de proporcionar baja latencia y alta capacidad de procesamiento, los buckets zonales te permiten hacer lo siguiente:
Agregar objetos al bucket zonal sin realizar una reescritura completa del objeto
Abrir objetos y mantener una transmisión mientras realizas operaciones, lo que te permite acelerar las lecturas y escrituras posteriores
Casos de uso
Rapid Bucket es más adecuado para cargas de trabajo de IA y AA, o para otras cargas de trabajo con uso intensivo de datos. Algunos ejemplos de estas cargas de trabajo son el punto de control, la evaluación y la entrega de modelos, así como el registro y las colas de mensajes. También se puede usar para transmitir datos o para proporcionar almacenamiento para bases de datos.
Para aprovechar al máximo la baja latencia y la alta capacidad de procesamiento que proporciona Rapid Bucket, asegúrate de habilitar la conectividad directa de gRPC.
Terminología de Rapid Bucket
En la documentación de Cloud Storage, se usan los siguientes términos:
Rapid Bucket: Es el producto que permite crear buckets con una ubicación zonal y la clase de almacenamiento Rapid Storage.
Rapid Storage: Es la clase de almacenamiento que ofrece el mayor acceso a los datos y el rendimiento de las operaciones de E/S en Cloud Storage. Cuando usas Rapid Bucket, creas un bucket que usa Rapid Storage. Para obtener más información sobre Rapid Storage, consulta Clases de almacenamiento.
Bucket zonal: Es un bucket que se encuentra en una zona. Los objetos en buckets zonales siempre se almacenan en Rapid Storage y se pueden agregar.
Acceso a objetos en buckets zonales
Para obtener los beneficios de rendimiento de un bucket zonal, asegúrate de abrir objetos para la transmisión y mantener una transmisión mientras realizas operaciones en los objetos. Cuando estableces y mantienes una transmisión, puedes realizar operaciones de lectura o escritura posteriores en el objeto con una latencia muy baja. Por ejemplo, cuando lees un archivo Parquet, puedes realizar la lectura inicial de los metadatos del archivo (el pie de página) y la lectura posterior de filas específicas en una sola solicitud. Este enfoque es más eficiente que usar solicitudes separadas para cada paso.
Una vez establecidos, los flujos de objetos se mantienen abiertos de forma predeterminada cuando accedes a objetos de bucket zonales con Cloud Storage FUSE o las bibliotecas cliente de Cloud Storage.
Puedes abrir varios flujos de lectura a un objeto desde cualquier cantidad de hosts. No hay limitaciones en la cantidad de flujos de lectura que puedes establecer en un objeto.
Cómo agregar objetos
Puedes agregar datos a objetos en buckets zonales. Cuando agregas objetos, se aplica la siguiente semántica:
Los objetos que se pueden agregar aparecen en el espacio de nombres del bucket en cuanto comienzas a escribir en ellos y se pueden leer mientras se escriben.
No hay restricciones en la cantidad de agregaciones que puedes realizar en un objeto ni en la cantidad de bytes que puedes agregar a la vez. Puedes realizar agregaciones hasta que un objeto alcance su tamaño máximo de 5 TiB.
El tamaño de un objeto aumentará en tiempo real a medida que se escriban o vacíen de forma permanente las nuevas agregaciones. Cuando estableces un flujo de lectura, debes anticipar una demora mínima en la actualización del tamaño del objeto.
Los objetos que se pueden agregar solo pueden tener un escritor a la vez. Si se establece un flujo de escritura nuevo para un objeto que ya tiene un flujo de escritura existente, Cloud Storage muestra un error en el flujo original, y ya no se permitirá que el flujo original escriba. El nuevo escritor puede reanudar la agregación desde el último desplazamiento persistente sin otras agregaciones intercaladas al objeto.
Cómo finalizar objetos
Después de que se finaliza un objeto, ya no puedes agregarlo, pero puedes reemplazarlo con una versión nueva. Los metadatos de un objeto finalizado siguen siendo mutables; por ejemplo, se pueden agregar etiquetas nuevas y se puede cambiar el nombre del objeto.
Cómo activar buckets zonales
Puedes activar buckets zonales y acceder a ellos con Cloud Storage FUSE o el controlador CSI de Cloud Storage FUSE. Asegúrate de usar Cloud Storage FUSE versión 3.7.2 o posterior. Para usar el controlador CSI de Cloud Storage FUSE, tu versión de Google Kubernetes Engine debe ser 1.35.0-gke.3047001 o posterior.
Herramientas compatibles
Puedes trabajar con buckets zonales con la mayoría de las herramientas de Cloud Storage. Sin embargo, se aplican las siguientes limitaciones:
No puedes escribir en buckets zonales con las APIs de biblioteca cliente estándar que están destinadas a buckets no zonales. Para escribir en buckets zonales, debes modificar tu código para usar las APIs compatibles con buckets zonales. Para saber qué APIs debes usar, consulta las muestras de código de tu biblioteca cliente en Usa objetos en buckets zonales.
Cuando usas gRPC, solo puedes escribir en buckets zonales con las APIs de
BidiWriteObject. Los objetos que se pueden agregar solo son compatibles con la llamada a RPCBidiWriteObjecten modo de agregación. Otros métodos de escritura de gRPC (como las escrituras únicas o reanudables) y otras llamadas a RPC (comoWriteObject) no admiten objetos que se pueden agregar.No puedes escribir en buckets zonales con la API de JSON.
Rapid Bucket es compatible con las versiones 2026.3.0 y posteriores de la biblioteca de Python GCSFS.
Limitaciones de Google Cloud CLI:
Versión mínima compatible de Google Cloud CLI: La versión mínima de gcloud CLI que admite buckets zonales es 553.0.0. Las versiones anteriores no son compatibles con los buckets zonales. Te recomendamos que uses la versión más reciente de gcloud CLI para obtener las funciones y correcciones de errores más recientes. Las descargas de objetos segmentados y las optimizaciones de rendimiento para buckets zonales requieren la versión 583.0.0 o posterior de gcloud CLI. Para obtener más información, consulta Ajusta el rendimiento de gcloud CLI para buckets zonales.
Visibilidad de las cargas incompletas: A diferencia de los buckets en otras clases de almacenamiento, en los que los objetos solo aparecen en el espacio de nombres después de que se completa una carga, los objetos cargados parcialmente en buckets zonales son visibles de inmediato. Si un comando de carga de Google Cloud CLI falla o se interrumpe, es posible que veas objetos incompletos en tu bucket. Puedes reanudar estas cargas si vuelves a ejecutar el comando.
Reemplazos de objetos: El comportamiento estándar de Google Cloud CLI se aplica a los buckets zonales: cuando reemplazas un objeto, si existe un archivo o un objeto con el mismo nombre en el destino, los comandos
cp,mv, yrsyncde Google Cloud CLI lo reemplazarán de forma predeterminada. Para evitar reemplazos, usa la marca--no-clobber. Cuando se usa Google Cloud CLI, no se admite la adición de datos a un objeto existente; se debe volver a subir toda la fuente.Finalización de objetos: Los objetos subidos a un bucket zonal con Google Cloud CLI pueden experimentar una breve demora antes de que los metadatos del objeto se sincronicen por completo. Debido a que Cloud Storage usa un modelo de coherencia eventual, intentar descargar un objeto inmediatamente después de la carga puede generar un error de falta de coincidencia de hash si los metadatos aún no se actualizaron.
Si una descarga falla con un error de falta de coincidencia de hash poco después de una carga, vuelve a intentar el comando. Las descargas se realizan por completo o fallan de forma explícita; las descargas parciales o dañadas no se producirán de forma silenciosa.
Rendimiento de la validación de la suma de verificación: Los buckets zonales dependen exclusivamente de CRC32C para la validación de datos, lo que permite que el sistema realice la suma de verificación por fragmento y para toda la carga o descarga. De forma predeterminada, Google Cloud CLI usa la biblioteca de Python
google-crc32c, que viene preinstalada con Google Cloud CLI. Sin embargo, si usas una instalación de Python no agrupada, debes instalar de forma explícita la bibliotecagoogle-crc32cdesde PyPI. De lo contrario, Google Cloud CLI recurre al objeto binariogcloud-crc32c, lo que podría generar un rendimiento más lento para el cálculo de CRC por fragmento.
Incompatibilidades
Los buckets zonales son incompatibles con los siguientes productos y servicios:
Carga y administración de datos
Rapid Cache
Autoclass
Bloqueo del bucket
Objetos compuestos
Cargas multiparte de XML
Conservaciones de objetos
La acción
SetStorageClassde la Administración del ciclo de vida de los objetosBloqueo de retención de objetos
Reubicaciones de buckets
Cargas reanudables
Reescrituras de objetos
Pagos del solicitante
Metadatos
Los objetos en buckets zonales no tienen un hash MD5.
Las propiedades de metadatos asociadas con las funciones y los productos no compatibles no aparecen en la representación de recursos de un bucket zonal o un objeto que se puede agregar, o no se pueden escribir. Por ejemplo:
Las propiedades de metadatos
softDeleteTimeyhardDeleteTimeno aparecen en la representación de recursos del recursoObjectsporque el borrado no definitivo no es compatible con los objetos en buckets zonales.Los metadatos
storageClassde los objetos en buckets zonales siempre tienen un valor deRAPIDy no se pueden reescribir porque los buckets zonales siempre deben usar la clase de almacenamiento Rapid Storage.
Control de acceso
Listas de control de acceso (LCA) a nivel del objeto
Configuraciones de CORS
Claves de encriptación proporcionadas por el cliente (CSEK)
Claves HMAC
Protección de datos y recuperación ante desastres
Control de versiones de objetos
Borrar de forma no definitiva
Replicación entre bucket
Otros Cloud de Confiance by S3NS servicios
- BigQuery
Cuotas
Cada zona por proyecto tiene una cuota de capacidad de almacenamiento predeterminada. Cada zona por proyecto también tiene una cuota de salida predeterminada de Cloud Storage a S3NS los servicios. Para ver estas cuotas, consulta Cuotas y límites.
Para obtener información sobre cómo supervisar el uso de la salida de datos y solicitar más ancho de banda, consulta Supervisión del uso del ancho de banda.
Precios
El uso de Rapid Bucket genera cargos por almacenamiento de datos, operaciones y redes. Para obtener más información, consulta Precios.
Prácticas recomendadas
Para optimizar el rendimiento y el uso de recursos cuando trabajas con buckets zonales, ten en cuenta las siguientes prácticas recomendadas:
Optimiza las lecturas de objetos: Cuando lees objetos de buckets zonales con gcloud CLI, la CLI aplica automáticamente la simultaneidad predeterminada y las configuraciones de segmentación. Para ajustar aún más esta configuración para una carga de trabajo específica, consulta Ajusta el rendimiento de gcloud CLI para buckets zonales.
Controladores de archivos de Cloud Storage FUSE: Para ayudar a optimizar el rendimiento cuando usas buckets zonales con Cloud Storage FUSE, mantén un controlador de archivos abierto para los objetos en tu bucket zonal activado y úsalo para varias operaciones. Esta práctica mejora el rendimiento porque Cloud Storage FUSE evita los viajes de ida y vuelta innecesarios de la red para las lecturas repetidas.
¿Qué sigue?
- Obtén información para crear buckets zonales.
- Obtén información para usar objetos en buckets zonales.
- Ajusta el rendimiento de gcloud CLI para buckets zonales.