Casos de uso de IA no Cloud Run

Seja para criar agentes, executar modelos de inferência ou integrar com vários serviços de IA, o Cloud Run oferece a escalonabilidade, a flexibilidade e a facilidade de uso necessárias para dar vida às suas inovações de IA.

Nesta página, destacamos alguns casos de uso de alto nível para hospedagem, criação e implantação de cargas de trabalho de IA no Cloud Run.

Por que usar o Cloud Run para cargas de trabalho de IA?

O Cloud Run oferece várias vantagens para garantir que seus aplicativos de IA sejam escalonáveis, flexíveis e gerenciáveis. Alguns destaques:

  • Suporte flexível a contêineres: empacote seu app e as dependências dele em um contêiner ou use qualquer linguagem, biblioteca ou framework compatível. Saiba mais sobre o contrato de ambiente de execução de contêineres do Cloud Run.
  • Endpoint HTTP: depois de implantar um serviço do Cloud Run, receba um endpoint URL do Cloud Run seguro e pronto para uso. O Cloud Run oferece streaming com suporte à codificação de transferência em partes HTTP, HTTP/2 e WebSockets.
  • Escalonamento automático ou manual: por padrão, o Cloud Run escalona automaticamente seu serviço com base na demanda, até zero. Assim, você paga apenas pelo que usa, o que é ideal para cargas de trabalho de IA imprevisíveis. Você também pode definir o escalonamento manual do serviço com base nas necessidades de tráfego e uso da CPU.

Principais casos de uso da IA

Confira algumas maneiras de usar o Cloud Run para potencializar seus aplicativos de IA:

Hospede agentes e bots de IA

O Cloud Run é uma plataforma ideal para hospedar a lógica de back-end de agentes de IA, chatbots e assistentes virtuais. Esses agentes podem orquestrar chamadas para modelos de IA como o Gemini na Vertex AI, gerenciar estados e se integrar a várias ferramentas e APIs.

  • Microsserviços para agentes: implante recursos individuais de agentes como serviços separados do Cloud Run. Consulte Hospedar agentes de IA para saber mais.
  • Servidores do Protocolo de Contexto de Modelo (MCP): implemente servidores MCP para fornecer contexto padronizado aos LLMs das suas ferramentas e fontes de dados. Consulte Servidores MCP de host para saber mais.

Disponibilizar modelos de IA/ML para inferência

Implante seus modelos treinados de machine learning como endpoints HTTP escalonáveis.

  • Inferência em tempo real: disponibilize previsões de modelos criados com frameworks como TensorFlow, PyTorch, scikit-learn ou usando modelos abertos como o Gemma.
  • Desvincule arquivos de modelos grandes do contêiner: o adaptador do Cloud Storage FUSE permite montar um bucket do Cloud Storage e o torna acessível como um diretório local dentro do contêiner do Cloud Run.

Hospedar APIs e back-ends com tecnologia de IA

Crie APIs e microsserviços que incorporam recursos de IA.

  • APIs inteligentes: desenvolva APIs que usam LLMs para compreensão de linguagem natural, análise de sentimento, tradução, resumo e assim por diante.
  • Fluxos de trabalho automatizados: crie serviços que acionam ações baseadas em IA com base em eventos ou solicitações.

Prototipar e testar ideias

Itere rapidamente ideias de IA.

  • Divisão de tráfego: use o recurso de divisão de tráfego do Cloud Run para fazer testes A/B com diferentes modelos, comandos ou configurações, e a Observabilidade do Google Cloud para monitorar métricas (latência, taxa de erros, custo) e medir o sucesso dos testes A/B.

A seguir

Dependendo da sua familiaridade com os conceitos de IA e do seu caso de uso de IA, confira os recursos de IA do Cloud Run.