Baik Anda sedang membangun agen, menjalankan model inferensi, atau berintegrasi dengan berbagai layanan AI, Cloud Run memberikan skalabilitas, fleksibilitas, dan kemudahan penggunaan yang diperlukan untuk mewujudkan inovasi AI Anda.
Halaman ini menyoroti beberapa kasus penggunaan tingkat tinggi untuk menghosting, membangun, dan men-deploy beban kerja AI di Cloud Run.
Mengapa menggunakan Cloud Run untuk beban kerja AI?
Cloud Run menawarkan beberapa keuntungan untuk memastikan aplikasi AI Anda skalabel, fleksibel, dan mudah dikelola. Beberapa sorotan mencakup:
- Dukungan container yang fleksibel: Kemas aplikasi dan dependensinya dalam container, atau gunakan bahasa, library, atau framework yang didukung. Pelajari lebih lanjut Kontrak runtime container Cloud Run.
- Endpoint HTTP: Setelah men-deploy layanan Cloud Run, terima endpoint URL Cloud Run yang aman dan siap pakai. Cloud Run menyediakan streaming melalui dukungan encoding transfer terpotong HTTP, HTTP/2, dan WebSockets.
- Penskalaan otomatis atau manual: Secara default, Cloud Run menskalakan layanan Anda secara otomatis berdasarkan permintaan, bahkan hingga nol. Hal ini memastikan Anda hanya membayar sesuai penggunaan, sehingga ideal untuk workload AI yang tidak dapat diprediksi. Anda juga dapat menyetel layanan ke penskalaan manual berdasarkan kebutuhan traffic dan penggunaan CPU.
- Siap digunakan perusahaan: Cloud Run menawarkan konektivitas VPC langsung, keamanan terperinci, dan kontrol jaringan.
Kasus penggunaan AI utama
Berikut beberapa cara Anda dapat menggunakan Cloud Run untuk mendukung aplikasi AI:
Menghosting agen dan bot AI
Cloud Run adalah platform yang ideal untuk menghosting logika backend bagi agen AI, chatbot, dan asisten virtual. Agen ini dapat mengatur panggilan ke model AI seperti Gemini di Vertex AI, mengelola status, dan berintegrasi dengan berbagai alat dan API.
- Microservice untuk agen: Deploy kemampuan agen individual sebagai layanan Cloud Run terpisah. Lihat Menghosting agen AI untuk mempelajari lebih lanjut.
- Server Model Context Protocol (MCP): Terapkan server MCP untuk memberikan konteks standar ke LLM dari alat dan sumber data Anda. Lihat Server MCP host untuk mempelajari lebih lanjut.
Menyajikan model AI/ML untuk inferensi
Men-deploy model machine learning terlatih Anda sebagai endpoint HTTP yang skalabel.
- Inferensi real-time: Sajikan prediksi dari model yang dibuat dengan framework seperti TensorFlow, PyTorch, scikit-learn, atau menggunakan model terbuka seperti Gemma.
- Pisahkan file model besar dari container Anda: Adaptor Cloud Storage FUSE memungkinkan Anda memasang bucket Cloud Storage, dan membuatnya dapat diakses sebagai direktori lokal di dalam container Cloud Run Anda.
Menghosting API dan backend yang didukung AI
Buat API dan microservice yang menyematkan kemampuan AI.
- Smart API: Mengembangkan API yang menggunakan LLM untuk pemahaman bahasa alami, analisis sentimen, terjemahan, ringkasan, dan sebagainya.
- Alur kerja otomatis: Buat layanan yang memicu tindakan berbasis AI berdasarkan peristiwa atau permintaan.
Membuat prototipe dan bereksperimen dengan ide
Melakukan iterasi ide AI dengan cepat.
- Pembagian traffic: Gunakan fitur pembagian traffic Cloud Run untuk melakukan pengujian A/B pada berbagai model, perintah, atau konfigurasi, dan Google Cloud Observability untuk memantau metrik (latensi, rasio error, biaya) guna mengukur keberhasilan pengujian A/B.
Langkah berikutnya
Bergantung pada pemahaman Anda tentang konsep AI dan kasus penggunaan AI Anda, pelajari resource AI Cloud Run.