Este guia oferece uma visão geral do uso do Cloud Run para hospedar apps, executar inferências e criar fluxos de trabalho de IA.
Cloud Run para hospedagem de aplicativos de IA, agentes e endpoints de API escalonáveis
O Cloud Run oferece uma plataforma totalmente gerenciada que dimensiona seus apps e cargas de trabalho de IA.
Ao hospedar apps de IA no Cloud Run, você geralmente tem os seguintes componentes de arquitetura:
- Serviço e orquestração: implante o código do aplicativo ou o contêiner no Cloud Run.
- Modelos de IA: você usa modelos de IA do Google, de código aberto ou personalizados com seu app.
- Integrações: você pode se conectar a serviços do Cloud de Confiance ou de terceiros para memória, bancos de dados, armazenamento, segurança e muito mais.
- Ferramentas: você pode se conectar a ferramentas para outras tarefas e operações.
O diagrama a seguir mostra uma visão geral de alto nível do uso do Cloud Run como uma plataforma de hospedagem para apps de IA:
Conforme mostrado no diagrama:
Na camada de serviço e orquestração, um serviço do Cloud Run atua como um endpoint de API escalonável para a lógica principal do aplicativo. Ele gerencia com eficiência vários usuários simultâneos usando o escalonamento automático, sob demanda e rápido de instâncias.
Para implantar no Cloud Run, você empacota o aplicativo e a dependência dele em um contêiner.
O app de IA funciona como um endpoint de API escalonável que processa solicitações recebidas e envia dados para um modelo de IA pré-treinado para processamento e retorna os resultados.
Se você tiver um modelo personalizado que treinou, também poderá usá-lo com seu recurso do Cloud Run.
Cloud de Confiance by S3NS oferece uma ampla variedade de soluções para apoiar a infraestrutura do seu aplicativo de IA.Você também pode fazer a integração com soluções de terceiros.
Com as ferramentas, seus apps e modelos de IA interagem com serviços, APIs ou sites que são executados externamente ou no Cloud Run.
Por exemplo, se o app de IA for um agente de IA, ele poderá enviar uma solicitação a um servidor MCP para executar uma ferramenta externa ou usar ferramentas em execução no contêiner, como execução de código, uso do computador, recuperação de informações etc.