Introducción al framework de resolución de entidades de BigQuery
La resolución de entidades de BigQuery te permite correlacionar registros en conjuntos de datos compartidos que no tienen un identificador común. También puedes usar un proveedor de identidad de un socio de Cloud de Confiance by S3NS para aumentar tus datos compartidos con atributos adicionales. Por ejemplo, puedes vincular registros de clientes en diferentes conjuntos de datos para crear perfiles unificados de clientes, detectar fraudes financieros o analizar cadenas de suministro.
Antes de enviar datos a una sala limpia de datos, puedes usar la resolución de entidades para preparar y correlacionar tus registros. La resolución de entidades está disponible en los modelos de precios según demanda y basados en la capacidad en todas las ediciones de BigQuery. Para obtener más información sobre la implementación, consulta Configura y usa la resolución de entidades en BigQuery.
Beneficios de la resolución de entidades
La resolución de entidades proporciona ventajas operativas y de uso compartido de datos tanto para los usuarios finales como para los proveedores de identidad.
Beneficios para los usuarios finales
Cuando resuelves entidades en BigQuery, obtienes los siguientes beneficios para el usuario final:
- Resolución in situ: Resuelves entidades in situ sin tarifas de transferencia de datos. Un proveedor de identidad hace coincidir tus datos con su gráfico de identidad y escribe los resultados de la resolución de entidades en un conjunto de datos de tu proyecto Cloud de Confiance .
- Operaciones simplificadas: Evitas administrar canalizaciones de extracción, transformación y carga (ETL) o flujos de trabajo de replicación de datos personalizados.
Beneficios del proveedor de identidad
Cuando ofreces servicios de identidad en BigQuery, obtienes los siguientes beneficios del proveedor de identidad:
- Integración en Marketplace: Puedes ofrecer la resolución de entidades como un producto de software como servicio (SaaS) administrado en Google Cloud Marketplace.
- Protección de la propiedad intelectual: Usas tus gráficos de identidad y la lógica de coincidencias sin revelarlos a los usuarios finales. Esta arquitectura ayuda a proteger tu propiedad intelectual.
Arquitectura de resolución de entidades
BigQuery implementa la resolución de entidades llamando a funciones remotas que ejecutan procesos de correlación en el entorno de un proveedor de identidad. BigQuery no copia ni mueve tus datos durante este proceso.
En el siguiente diagrama, se ilustra el flujo de trabajo de resolución de entidades entre un proyecto Cloud de Confiance del usuario final y un proyecto Cloud de Confiance del proveedor de identidad:
El flujo de trabajo de resolución de entidades incluye los siguientes pasos:
- Otorga a la cuenta de servicio del proveedor de identidad acceso de lectura a tu conjunto de datos de entrada y acceso de escritura a tu conjunto de datos de salida.
- Llamas a la función remota para que coincida con tus datos de entrada con los datos del gráfico de identidad del proveedor de identidad. La función remota pasa tus parámetros de coincidencia al proveedor de identidad.
- La cuenta de servicio del proveedor de identidad lee y procesa tu conjunto de datos de entrada.
- La cuenta de servicio del proveedor de identidad escribe los resultados de la resolución de entidades en tu conjunto de datos de salida.
Para ejecutar este flujo de trabajo, la resolución de entidades se basa en componentes de tu entorno y del entorno del proveedor de identidad.
Componentes del usuario final
Tu proyecto Cloud de Confiance contiene los siguientes componentes para el usuario final:
- Llamada a función remota: Es una llamada que ejecuta un procedimiento que el proveedor de identidad define y, luego, implementa. Esta llamada inicia el proceso de resolución de entidades.
- Conjunto de datos de entrada: Es el conjunto de datos de origen que contiene los datos que deseas hacer coincidir. De manera opcional, el conjunto de datos de entrada puede contener una tabla de metadatos con parámetros adicionales. Los proveedores de identidad especifican los requisitos de esquema para los conjuntos de datos de entrada.
- Conjunto de datos de salida: Es el conjunto de datos de destino en el que el proveedor de identidad escribe los resultados coincidentes como una tabla de salida. De manera opcional, el proveedor de identidad puede escribir una tabla de estado del trabajo con detalles del trabajo en este conjunto de datos. El conjunto de datos de salida puede ser el mismo que el de entrada.
Componentes del proveedor de identidad
El entorno del proveedor de identidad contiene los siguientes componentes:
- Plano de control: Contiene una función remota de BigQuery que organiza el proceso de coincidencia. El proveedor de identidad puede implementar esta función como un trabajo de Cloud Run o una función de Cloud Run. El plano de control también puede contener servicios de autenticación y autorización.
- Plano de datos: Contiene el conjunto de datos del gráfico de identidad y el procedimiento almacenado que ejecuta la lógica de coincidencia. Un gráfico de identidades es una base de datos de referencia de identificadores y atributos de entidades conocidas. El proveedor de identidad puede implementar el procedimiento almacenado como un procedimiento almacenado en SQL o un procedimiento almacenado de Apache Spark. El conjunto de datos del gráfico de identidad contiene las tablas con las que el proveedor de identidad compara tus datos.
Consideraciones
Cuando planifiques la implementación de la resolución de entidades, ten en cuenta los siguientes factores:
- Coordinación con el proveedor de identidad: Antes de ejecutar trabajos de correlación, debes coordinarte con un proveedor de identidad compatible para obtener las credenciales de su cuenta de servicio y la firma de la función remota.
- Bases de datos externas: Por lo general, los proveedores de identidad alojan los gráficos de identidad en BigQuery, pero también pueden almacenarlos en bases de datos externas.
¿Qué sigue?
- Obtén más información para configurar y usar la resolución de entidades.
- Obtén más información para trabajar con funciones remotas.
- Obtén más información para trabajar con procedimientos almacenados de SQL.
- Obtén más información para compartir datos sensibles con salas limpias de datos.