Quer esteja a criar agentes, a executar modelos de inferência ou a integrar-se com vários serviços de IA, o Cloud Run oferece a escalabilidade, a flexibilidade e a facilidade de utilização necessárias para dar vida às suas inovações de IA.
Esta página realça alguns exemplos de utilização de nível superior para alojar, criar e implementar cargas de trabalho de IA no Cloud Run.
Por que motivo deve usar o Cloud Run para cargas de trabalho de IA?
O Cloud Run oferece várias vantagens para garantir que as suas aplicações de IA são escaláveis, flexíveis e geríveis. Alguns destaques incluem:
- Suporte de contentores flexível: crie pacotes da sua app e respetivas dependências num contentor ou use qualquer idioma, biblioteca ou framework suportado. Saiba mais acerca do contrato de tempo de execução de contentores do Cloud Run.
- Ponto final HTTP: após implementar um serviço do Cloud Run, recebe um ponto final do URL do Cloud Run seguro e pronto a usar. O Cloud Run oferece streaming através do suporte da codificação de transferência fragmentada HTTP, HTTP/2 e WebSockets.
- Escala automática ou manual: por predefinição, o Cloud Run dimensiona automaticamente o seu serviço com base na procura, mesmo até zero. Isto garante que paga apenas o que usa, o que o torna ideal para cargas de trabalho de IA imprevisíveis. Também pode definir o seu serviço para o escalamento manual com base nas suas necessidades de tráfego e utilização da CPU.
- Pronto para a empresa: o Cloud Run oferece conetividade VPC direta, segurança detalhada e controlos de rede.
Principais exemplos de utilização da IA
Seguem-se algumas formas de usar o Cloud Run para potenciar as suas aplicações de IA:
Alojamento de bots e agentes de IA
O Cloud Run é uma plataforma ideal para alojar a lógica de back-end para agentes de IA, chatbots e assistentes virtuais. Estes agentes podem orquestrar chamadas para modelos de IA, como o Gemini na Vertex AI, gerir o estado e integrar-se com várias ferramentas e APIs.
- Microsserviços para agentes: implemente capacidades de agentes individuais como serviços do Cloud Run separados. Consulte o artigo Alojamento de agentes de IA para saber mais.
- Servidores do protocolo Model Context Protocol (MCP): implemente servidores MCP para fornecer contexto padronizado aos MDIs das suas ferramentas e origens de dados. Consulte o artigo Alojamento de servidores MCP para saber mais.
Apresente modelos de IA/ML para inferência
Implemente os seus modelos de aprendizagem automática preparados como pontos finais HTTP escaláveis.
- Inferência em tempo real: disponibilize previsões a partir de modelos criados com frameworks como o TensorFlow, o PyTorch, o scikit-learn ou usando modelos abertos como o Gemma.
- Desassocie ficheiros de modelos grandes do seu contentor: o adaptador FUSE do Cloud Storage permite-lhe montar um contentor do Cloud Storage e torná-lo acessível como um diretório local no seu contentor do Cloud Run.
Alojamento de APIs e backends com tecnologia de IA
Crie APIs e microsserviços que incorporam capacidades de IA.
- APIs inteligentes: desenvolva APIs que usam MDIs para compreensão de linguagem natural, análise de sentimentos, tradução, resumo, entre outros.
- Fluxos de trabalho automatizados: crie serviços que acionam ações baseadas na IA com base em eventos ou pedidos.
Crie protótipos e experimente ideias
Iterar rapidamente ideias de IA.
- Divisão do tráfego: use a funcionalidade de divisão do tráfego do Cloud Run para fazer testes A/B de diferentes modelos, comandos ou configurações, e a Google Cloud Observability para monitorizar as métricas (latência, taxa de erro, custo) e medir o sucesso dos testes A/B.
O que se segue?
Consoante a sua familiaridade com os conceitos de IA e o seu exemplo de utilização de IA, explore os recursos de IA do Cloud Run.