In dieser Anleitung wird gezeigt, wie Sie mit dem Data Science-Agenten für Colab Enterprise ein Modell für maschinelles Lernen (ML) mithilfe von Prompts in natürlicher Sprache erstellen.
In dieser Anleitung erstellen Sie ein ML-Modell, um den Spirituosenabsatz anhand des öffentlichen Datasets zum Einzelhandelsverkauf von Spirituosen in Iowa vorherzusagen. Mit dem KI-basierten Agenten können Sie Prompts in natürlicher Sprache verwenden, um Code direkt in einem Notebook zu schreiben, zu erklären und Fehler zu beheben. So können Sie Ihre Data-Science-Workflows beschleunigen.
Diese Anleitung richtet sich an Datenexperten.
Ziele
In dieser Anleitung erfahren Sie, wie Sie den Data Science Agent für die folgenden Aufgaben verwenden:
- Führen Sie eine explorative Datenanalyse (EDA) des öffentlichen Datasets zum Einzelhandelsverkauf von Spirituosen in Iowa durch, um Datenverteilungen zu analysieren, nach fehlenden Werten zu suchen und die allgemeine Datenqualität zu prüfen.
- Finden Sie die Geschäfte, in denen die meisten Gallonen Alkohol über alle Produkte hinweg verkauft wurden.
- Erstellen, trainieren und bewerten Sie ein Modell, mit dem sich der Spirituosenumsatz mit BigQuery ML vorhersagen lässt.
- Wichtige Informationen und die Modellleistung generieren und zusammenfassen
Kosten
In diesem Dokument verwenden Sie die folgenden kostenpflichtigen Komponenten von Cloud de Confiance by S3NS:
Nach Abschluss der in diesem Dokument beschriebenen Aufgaben können Sie weitere Kosten vermeiden, indem Sie die erstellten Ressourcen löschen. Weitere Informationen finden Sie unter Bereinigen.
Hinweis
-
In the Cloud de Confiance console, on the project selector page, select or create a Cloud de Confiance project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Cloud de Confiance project.
-
Aktivieren Sie die APIs für BigQuery, Gemini für Cloud de Confiance by S3NS, Dataform und Compute Engine, falls sie noch nicht aktiviert sind.
Rollen, die zum Aktivieren von APIs erforderlich sind
Zum Aktivieren von APIs benötigen Sie die Berechtigung
serviceusage.services.enable. Wenn Sie das Projekt erstellt haben, haben Sie diese Berechtigung wahrscheinlich bereits über die Rolle „Inhaber“ (roles/owner). Andernfalls können Sie diese Berechtigung über die Rolle „Service Usage-Administrator“ (roles/serviceusage.serviceUsageAdmin) erhalten. Informationen zum Zuweisen von RollenBei neuen Projekten ist die BigQuery API automatisch aktiviert.
Erforderliche Rollen
Wenn Sie ein neues Projekt erstellt haben, haben Sie alle erforderlichen Berechtigungen, um dieses Tutorial durchzuarbeiten. Wenn Sie ein vorhandenes Projekt verwenden, bitten Sie Ihren Administrator, Ihnen die folgenden Rollen zuzuweisen.
Berechtigungen zum Erstellen und Ausführen von Notebooks
Bitten Sie Ihren Administrator, Ihnen für das Projekt die IAM-Rolle BigQuery Studio User (roles/bigquery.studioUser) zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Erstellen und Ausführen von Notebooks benötigen.
Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.
Sie können die erforderlichen Berechtigungen auch über benutzerdefinierte Rollen oder andere vordefinierte Rollen erhalten.
Die Berechtigungen, die zum Erstellen und Ausführen von Notebooks erforderlich sind, finden Sie auf der Seite Notebooks erstellen in den Einrichtungsschritten.
Weitere Informationen zu BigQuery Identity and Access Management (IAM) finden Sie unter Zugriffssteuerung mit IAM.
Colab Enterprise-Notebook erstellen und eine Verbindung zu einer Laufzeit herstellen
Colab Enterprise-Notebooks sind BigQuery Studio-Code-Assets, die auf Dataform basieren. Sie können Notebooks verwenden, um Analyse- und ML-Workflows mithilfe von SQL, Python und anderen gängigen Paketen und APIs abzuschließen.
So erstellen Sie ein neues Notebook und verbinden es mit der Standardlaufzeit:
Rufen Sie die Seite BigQuery auf.
Maximieren Sie im linken Bereich Ihr Projekt und klicken Sie dann auf Notebooks.
Klicken Sie auf Neues Notebook > Leeres Notebook.
Klicken Sie auf Speichern.
Klicken Sie auf den Tab Notebooks, um das neue Notebook aufzurufen. Möglicherweise müssen Sie auf Aktualisieren Aktualisieren klicken .
Klicken Sie für Ihr unbenanntes Notebook auf more_vert Aktionen öffnen und wählen Sie dann Umbenennen aus.
Geben Sie unter Notebookname den Wert
predict_liquor_salesein und klicken Sie dann auf Umbenennen.Klicken Sie auf den Tab
predict_liquor_sales.Klicken Sie in der Notebook-Symbolleiste auf Verbinden, um Ihr Notebook mit der Standardlaufzeitumgebung zu verbinden.
Data Science Agent zum Analysieren der Daten verwenden
Der Data Science Agent ist ein auf Gemini basierender Assistent, der Code direkt in Ihrem Notebook schreiben, erklären und Fehler beheben kann. Sie können damit Aufgaben erledigen, die von der explorativen Datenanalyse bis hin zur Generierung von Vorhersagen und Prognosen für maschinelles Lernen reichen, einschließlich der folgenden:
- Pläne erstellen: Erstellen Sie einen Schritt-für-Schritt-Plan, um ein Data-Science-Problem zu lösen.
- Explorative Datenanalyse und ‑bereinigung: Fehlende Werte und Ausreißer ermitteln und Verteilungen visualisieren
- Feature Engineering: Kategoriale Merkmale umwandeln und neue erstellen
- Modelltraining und ‑bewertung Modelle wie die lineare Regression oder Random Forest trainieren und ihre Leistung vergleichen
In dieser Anleitung verwenden Sie den Data Science Agent, um Daten im öffentlichen Dataset „Iowa Liquor Retail Sales“ zu analysieren und ein Modell zu erstellen, mit dem sich der Spirituosenverkauf prognostizieren lässt.
So analysieren Sie die Daten mit Data Science Agent:
Wenn das Gemini-Chatfenster in Ihrem
predict_liquor_sales-Notebook nicht geöffnet ist, klicken Sie auf spark Gemini in Colab ein-/ausblenden, um den Chatdialog zu öffnen.Geben Sie in der Chatoberfläche den folgenden Prompt ein:
Analyze the liquor sales data from bigquery-public-data.iowa_liquor_sales.sales by performing exploratory data analysis. Find the stores that sold the most gallons of alcohol across all products. Then, create a model that predicts liquor sales by store by using BigQuery ML. Visualize the results, evaluate the model, summarize the model's performance, and provide any key insights.Achten Sie darauf, dass das Modell auf Gemini 3.0 Flash eingestellt ist.
Klicken Sie auf Senden.
Sehen Sie sich den vom Agenten generierten Plan an. Der Plan sieht ungefähr so aus.
„Ich habe die Anfrage nach Daten zum Spirituosenverkauf in Iowa analysiert und einen strategischen Plan erstellt. Da die Daten in BigQuery gespeichert sind und Sie BigQuery ML angegeben haben, beginnen wir mit der Datenexploration, ermitteln die leistungsstärksten Geschäfte und erstellen dann ein Regressionsmodell zur Vorhersage des Umsatzes. So gehst du vor:
- Datenanalyse und ‑profilerstellung: Führen Sie eine erste Analyse der Tabelle „bigquery-public-data.iowa_liquor_sales.sales“ durch, um die Datenverteilung zu verstehen, nach fehlenden Werten zu suchen und die Datenqualität für wichtige Spalten wie Geschäftsinformationen, verkaufte Menge und Umsatz in Dollar zu prüfen.
- Umsatzstärkste Geschäfte ermitteln: Aggregieren Sie die insgesamt verkaufte Menge an Alkohol nach Geschäft über alle Produkte hinweg und ermitteln Sie die umsatzstärksten Geschäfte.
- Datenvorbereitung: Bereiten Sie die Trainingsdaten vor, indem Sie den Spirituosenumsatz nach Geschäft zusammenfassen und relevante Features für das Vorhersagemodell auswählen.
- Modellentwicklung: Trainieren Sie mit BigQuery ML ein Regressionsmodell, um den Spirituosenumsatz für jedes Geschäft vorherzusagen.
- Modellbewertung: Bewerten Sie die Leistung des trainierten Modells anhand von Standardmesswerten für die Regression.
- Modellvorhersage: Generieren Sie mit dem trainierten Modell Vorhersagen für den Spirituosenverkauf.
- Visualisierung: Erstellen Sie ein Streudiagramm, in dem die vorhergesagten Spirituosenverkäufe mit den tatsächlichen Werten verglichen werden, um die Genauigkeit des Modells visuell zu bewerten.
- Aufgabe abschließen: Fassen Sie die Leistung des Modells zusammen, geben Sie wichtige Informationen zu den Ladenumsätzen an und schließen Sie die Analyse ab.“
Nachdem Sie den Plan überprüft haben, klicken Sie auf Akzeptieren und ausführen. Der Agent generiert die erste Unteraufgabe: Daten untersuchen und profilieren. Der Agent pausiert, bis Sie den Code überprüft und akzeptiert haben. Wenn der Agent auf eine Nutzereingabe wartet, werden die generierten Zellen mit einem grünen Hintergrund gerendert.
Sehen Sie sich die generierte Codezelle und die vom Agenten angegebene Begründung an.
Klicken Sie auf Akzeptieren und ausführen. Wenn der KI-Agent Probleme mit seinem Ansatz hat, gibt er eine Begründung dafür an, wie das Problem behoben werden kann, und fordert Sie auf, den geänderten Code zu akzeptieren.
Sehen Sie sich die Ausgabe in der Codezelle an.
Unter den Ergebnissen erstellt der Agent eine neue Zelle, um die nächste Teilaufgabe zu erledigen: die Geschäfte mit dem höchsten Spirituosenumsatz finden.
Sehen Sie sich den generierten SQL-Code an, mit dem die Daten für die umsatzstärksten Geschäfte nach verkauften Litern Alkohol abgefragt werden. Sie können die Überlegungen des KI-Agenten nachvollziehen, indem Sie sich die Textzelle Reasoning (Überlegungen) über dem Code ansehen. Wenn Sie sicher sind, dass der Code korrekt ist, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Abfrageergebnisse in der Ausgabe der Zelle an. Die Ergebnisse sehen in etwa so aus:
Sehen Sie sich den Code und die Begründung an, die vom Agenten für die nächste Teilaufgabe generiert wurden: Vorbereiten der Daten für das Modelltraining.
Wenn Sie sich vergewissert haben, dass der SQL-Code korrekt ist, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Ausgabe in der Codezelle an. Es wird eine Meldung ähnlich der folgenden angezeigt:
JOB ID 123456 successfully executed.Sehen Sie sich den Code und die Begründung an, die vom Agent für die nächste Teilaufgabe generiert wurden: das Trainieren des Regressionsmodells.
Nachdem Sie sich den Code und die Begründung angesehen haben, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Ausgabe in der Codezelle an. Es wird eine Meldung ähnlich der folgenden angezeigt:
JOB ID 123456 successfully executed.Sehen Sie sich den Code und die Begründung an, die vom Agenten für die nächste Teilaufgabe generiert wurden: die Modellbewertung.
Nachdem Sie sich den Code und die Begründung angesehen haben, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Ausgabe in der Codezelle an.
Sehen Sie sich den Code und die Begründung an, die vom Agent für die nächste Teilaufgabe generiert wurden: Vorhersagen erstellen.
Nachdem Sie sich den Code und die Begründung angesehen haben, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Ausgabe in der Codezelle an. Es wird eine Meldung ähnlich der folgenden angezeigt:
JOB ID 123456 successfully executed.Nachdem die Anfrage ausgeführt wurde, erstellt der KI-Agent eine Codezelle für die nächste Teilaufgabe: die Visualisierung der Daten.
Nachdem Sie sich den Code und die Begründung angesehen haben, klicken Sie auf Akzeptieren und ausführen.
Sehen Sie sich die Ausgabe in der Codezelle an. Sie sehen ein Diagramm, in dem der tatsächliche und der prognostizierte Spirituosenumsatz dargestellt sind. Das Diagramm sieht dann ungefähr so aus:
Nachdem das Diagramm generiert wurde, erstellt der KI‑Agent eine Zusammenfassung der Ergebnisse mit den wichtigsten Erkenntnissen.
Nachdem Sie die Zusammenfassung geprüft haben, klicken Sie auf Akzeptieren, um den Plan abzuschließen.
Bereinigen
Damit Ihrem Google Cloud-Konto die in dieser Anleitung verwendeten Ressourcen nicht in Rechnung gestellt werden, löschen Sie entweder das Projekt, das die Ressourcen enthält, oder Sie behalten das Projekt und löschen die einzelnen Ressourcen.
Wenn Sie vermeiden möchten, dass Ihrem Cloud de Confiance by S3NS Konto die in dieser Anleitung verwendeten Ressourcen in Rechnung gestellt werden, können Sie das erstellte Notebook löschen. So löschen Sie Ihr Notebook:Rufen Sie die Seite BigQuery auf.
Maximieren Sie im linken Bereich Ihr Projekt und klicken Sie dann auf Notebooks.
Klicken Sie für Ihr
predict_liquor_sales-Notebook auf more_vert Aktionen öffnen und wählen Sie dann Löschen aus.Klicken Sie auf Löschen, um das Notebook zu entfernen.