在 Cloud Run 上运行 AI 解决方案

本指南概述了如何使用 Cloud Run 来托管应用、运行推理和构建 AI 工作流。

Cloud Run,用于托管 AI 应用、代理和可扩缩的 API 端点

Cloud Run 提供了一个全托管式平台,可扩缩 AI 应用和工作负载。

在 Cloud Run 上托管 AI 应用时,您通常会使用以下架构组件:

  • 提供服务和编排:将应用代码或容器部署到 Cloud Run。
  • AI 模型:您在应用中使用 Google 的 AI 模型、开源模型或自定义模型。
  • 集成:您可以连接到 Cloud de Confiance 服务或第三方服务,以实现内存、数据库、存储、安全等功能。
  • 工具:您可以连接到其他工具以执行其他任务和操作。

下图简要展示了如何使用 Cloud Run 作为 AI 应用的托管平台:

在 Cloud Run 上托管的 AI 应用的四个组成部分:
    1. 服务和编排,2. AI 模型集成工具
图 1:托管在 Cloud Run 上的 AI 应用的组件。

如图所示:

  1. 服务和编排层中,Cloud Run 服务充当应用核心逻辑的可扩缩 API 端点。它通过自动、按需、快速扩缩实例来高效管理多个并发用户。

    您可以通过将应用及其依赖项打包到容器中,将容器部署到 Cloud Run。

  2. 您的 AI 应用充当可扩缩的 API 端点,用于处理传入的请求并将数据发送到预训练的 AI 模型进行处理,然后返回结果。

    如果您有自己训练的自定义模型,也可以将该模型与 Cloud Run 资源搭配使用。

  3. Cloud de Confiance by S3NS 提供各种解决方案来支持 AI 应用的基础设施。您还可以与第三方解决方案集成。

  4. 借助工具,AI 应用和模型可以与外部或在 Cloud Run 上运行的服务、API 或网站进行交互。

    例如,如果您的 AI 应用是 AI 代理,您的代理可能会向 MCP 服务器发送请求以执行外部工具,或者使用在容器中运行的工具,例如代码执行、计算机使用、信息检索等。

后续步骤