Seja para criar agentes, executar modelos de inferência ou integrar com vários serviços de IA, o Cloud Run oferece a escalonabilidade, a flexibilidade e a facilidade de uso necessárias para dar vida às suas inovações de IA.
Nesta página, destacamos alguns casos de uso de alto nível para hospedagem, criação e implantação de cargas de trabalho de IA no Cloud Run.
Por que usar o Cloud Run para cargas de trabalho de IA?
O Cloud Run oferece várias vantagens para garantir que seus aplicativos de IA sejam escalonáveis, flexíveis e gerenciáveis. Alguns destaques:
- Suporte flexível a contêineres: empacote seu app e as dependências dele em um contêiner ou use qualquer linguagem, biblioteca ou framework compatível. Saiba mais sobre o contrato de ambiente de execução de contêineres do Cloud Run.
- Endpoint HTTP: depois de implantar um serviço do Cloud Run, receba um endpoint URL do Cloud Run seguro e pronto para uso. O Cloud Run oferece streaming com suporte à codificação de transferência em partes HTTP, HTTP/2 e WebSockets.
- Escalonamento automático ou manual: por padrão, o Cloud Run escalona automaticamente seu serviço com base na demanda, até zero. Assim, você paga apenas pelo que usa, o que é ideal para cargas de trabalho de IA imprevisíveis. Você também pode definir o escalonamento manual do serviço com base nas necessidades de tráfego e uso da CPU.
- Pronto para empresas: o Cloud Run oferece conectividade direta com a VPC, segurança granular e controles de rede.
Principais casos de uso da IA
Confira algumas maneiras de usar o Cloud Run para potencializar seus aplicativos de IA:
Hospede agentes e bots de IA
O Cloud Run é uma plataforma ideal para hospedar a lógica de back-end de agentes de IA, chatbots e assistentes virtuais. Esses agentes podem orquestrar chamadas para modelos de IA como o Gemini na Vertex AI, gerenciar estados e se integrar a várias ferramentas e APIs.
- Microsserviços para agentes: implante recursos individuais de agentes como serviços separados do Cloud Run. Consulte Hospedar agentes de IA para saber mais.
- Servidores do Protocolo de Contexto de Modelo (MCP): implemente servidores MCP para fornecer contexto padronizado aos LLMs das suas ferramentas e fontes de dados. Consulte Servidores MCP de host para saber mais.
Disponibilizar modelos de IA/ML para inferência
Implante seus modelos treinados de machine learning como endpoints HTTP escalonáveis.
- Inferência em tempo real: disponibilize previsões de modelos criados com frameworks como TensorFlow, PyTorch, scikit-learn ou usando modelos abertos como o Gemma.
- Desvincule arquivos de modelos grandes do contêiner: o adaptador do Cloud Storage FUSE permite montar um bucket do Cloud Storage e o torna acessível como um diretório local dentro do contêiner do Cloud Run.
Hospedar APIs e back-ends com tecnologia de IA
Crie APIs e microsserviços que incorporam recursos de IA.
- APIs inteligentes: desenvolva APIs que usam LLMs para compreensão de linguagem natural, análise de sentimento, tradução, resumo e assim por diante.
- Fluxos de trabalho automatizados: crie serviços que acionam ações baseadas em IA com base em eventos ou solicitações.
Prototipar e testar ideias
Itere rapidamente ideias de IA.
- Divisão de tráfego: use o recurso de divisão de tráfego do Cloud Run para fazer testes A/B com diferentes modelos, comandos ou configurações, e a Observabilidade do Google Cloud para monitorar métricas (latência, taxa de erros, custo) e medir o sucesso dos testes A/B.
A seguir
Dependendo da sua familiaridade com os conceitos de IA e do seu caso de uso de IA, confira os recursos de IA do Cloud Run.