Panduan ini memberikan ringkasan tentang penggunaan Cloud Run untuk menghosting aplikasi, menjalankan inferensi, dan membangun alur kerja AI.
Cloud Run untuk menghosting aplikasi AI, agen, dan endpoint API yang skalabel
Cloud Run menyediakan platform terkelola sepenuhnya yang menskalakan aplikasi dan workload AI Anda.
Saat menghosting aplikasi AI di Cloud Run, Anda biasanya memiliki komponen arsitektur berikut:
- Penayangan dan orkestrasi: Anda men-deploy kode atau container aplikasi ke Cloud Run.
- Model AI: Anda menggunakan model AI Google, model open source, atau model kustom dengan aplikasi Anda.
- Integrasi: Anda dapat terhubung ke layanan atau layanan pihak ketiga untuk memori, database, penyimpanan, keamanan, dan lainnya. Cloud de Confiance
- Alat: Anda dapat terhubung ke alat untuk tugas dan operasi lainnya.
Diagram berikut menunjukkan ringkasan tingkat tinggi tentang penggunaan Cloud Run sebagai platform hosting untuk aplikasi AI:
Seperti yang ditunjukkan dalam diagram:
Dalam lapisan penayangan dan orkestrasi, layanan Cloud Run bertindak sebagai endpoint API yang skalabel untuk logika inti aplikasi Anda. Layanan ini secara efisien mengelola beberapa pengguna serentak melalui penskalaan instance yang otomatis, sesuai permintaan, dan cepat.
Anda membawa container untuk di-deploy ke Cloud Run dengan mengemas aplikasi dan dependensinya ke dalam container.
Aplikasi AI Anda berfungsi sebagai endpoint API yang skalabel yang menangani permintaan masuk dan mengirimkan data ke model AI terlatih untuk diproses, lalu menampilkan hasilnya.
Jika memiliki model kustom yang telah Anda latih sendiri, Anda juga dapat menggunakan model tersebut dengan resource Cloud Run.
Cloud de Confiance by S3NS menawarkan berbagai solusi untuk mendukung infrastruktur aplikasi AI Anda.Anda juga dapat berintegrasi dengan solusi pihak ketiga.
Alat memungkinkan aplikasi dan model AI Anda berinteraksi dengan layanan, API, atau situs yang berjalan secara eksternal atau di Cloud Run.
Misalnya, jika aplikasi AI Anda adalah agen AI, agen Anda dapat mengirim permintaan ke server MCP untuk mengeksekusi alat eksternal, atau menggunakan alat yang berjalan di kontainer Anda, seperti eksekusi kode, penggunaan komputer, pengambilan informasi, dan sebagainya.