Datenpipelines benötigt? Azure Data Factory erstellen

Veröffentlicht am:

Ein Team erhält täglich Verkaufsdateien für ein Berichtssystem. Manuelles Kopieren verzögert Berichte; fehlgeschlagene Übertragungen müssen erkannt und wiederholt werden. Azure Data Factory (ADF) koordiniert diese Schritte in einer Pipeline, mit protokollierten Ausführungen und optionalen Zeitplänen. In dieser Übung kopierst du eine Datei zwischen Speicherordnern im Browser.

Factory erstellen

Öffne im Azure-Portal Data factories → Create:

Resource group: rg-cloudtrips-adf-test-weu
Name: adf-ctappweu
Region: West Europe
Version: V2
Git configuration: Configure Git later

Ergänze bei Bedarf einen eindeutigen Namenszusatz. Behalte öffentlichen Zugriff für die Übung, wähle Review + create → Create und danach Launch studio. Verwende Edge oder Chrome.

Azure Data Factory Studio mit adf-ctappweu und der Kachel Ingest

Prüfe den Factory-Namen. Ingest öffnet einen Assistenten zum Erstellen einer Kopierpipeline.

Kleine Datei vorbereiten

Erstelle in derselben Ressourcengruppe ein Speicherkonto:

Name: stctadfweu
Region: West Europe
Account kind: StorageV2 (general-purpose v2)
Performance: Standard
Redundancy: LRS
Public network access: Enabled from all networks
Allow Blob anonymous access: Disabled

Passe den Speichernamen bei Bedarf an. Erstelle unter Containers den Container pipeline mit privatem Zugriff. Speichere diesen Inhalt als reine Textdatei sales.csv auf deinem Computer:

order_id,product,amount
1,Notebook,12.50
2,Pen,2.00

Lade sie in pipeline hoch, mit Advanced → Upload to folder: input. Der Quellpfad lautet pipeline/input/sales.csv.

Öffne am Speicherkonto Access control (IAM) → Add role assignment. Weise Storage Blob Data Contributor an Managed identity → Data factory → adf-ctappweu zu. Damit liest und schreibt die Factory Blobs mit ihrer Azure-Identität. Warte einige Minuten auf die Wirksamkeit der Berechtigung.

Kopierpipeline erstellen

Wähle in Data Factory Studio Ingest → Built-in copy task → Run once now. Erstelle eine Verbindung vom Typ Azure Blob Storage:

Connection name: ls_ctstorage
Integration runtime: AutoResolveIntegrationRuntime
Authentication: System Assigned Managed Identity
Storage account: stctadfweu

Wähle Test connection, dann Create. Diese gespeicherte Verbindung heißt Linked Service; die Azure Integration Runtime führt die Übertragung aus.

Wähle pipeline/input/sales.csv als Quelle und aktiviere Binary copy, um die Datei unverändert zu kopieren. Verwende am Ziel ebenfalls ls_ctstorage und den Ordner pipeline/output. Nenne die Pipeline pl_copy_sales, prüfe die Angaben und schließe den Assistenten ab, um sie bereitzustellen und auszuführen.

Öffne Monitor, aktualisiere bis zum Abschluss und öffne die Aktivitätsdetails.

Data Factory Monitor mit pl_copy_sales Succeeded und Kopierdetails für eine Datei

Erwarte Succeeded, eine gelesene und eine geschriebene Datei. Gelesene und geschriebene Datenmenge sollten bei dieser unveränderten Datei übereinstimmen; Bytezahl und Dauer hängen von deiner Datei und Ausführung ab.

Ergebnis prüfen

Aktualisiere den Speichercontainer und öffne output/sales.csv. Lade die Datei herunter und vergleiche sie mit dem Original.

Speichercontainer pipeline mit sales.csv im Ordner output

Das Ziel sollte dieselbe Kopfzeile und zwei Verkaufsdatensätze enthalten. Run once now führt eine Übertragung aus; ein Zeitplantrigger kann die Pipeline für wiederkehrende Aufgaben automatisch starten.

Abschließen

Pipelineaktivitäten und Datenübertragungen verursachen nutzungsabhängige Kosten; auch Speicher verursacht Kosten. Behalte die Ressourcen für weitere Data-Factory-Trips oder lösche anschließend rg-cloudtrips-adf-test-weu.