Optimiser la performance des flux de données

Ingestion de données et modèles sémantiques avec Microsoft Fabric

Alex Kuntz

Head of Cloud Curriculum, DataCamp

Étagement dans Dataflows Gen2

Stocke temporairement les données pendant la transformation pour optimiser la performance

  • Artefacts d'étagement :
    • Stockage Lakehouse interne et caché utilisé durant les transformations
    • Géré automatiquement par les Dataflows ; aucun accès direct pour les utilisateurs
  • Quand utiliser l'étagement :
    • Activé par défaut pour améliorer la performance des points de terminaison SQL
    • Désactivé pour le chargement direct vers Lakehouse et hors entrepôt (peut être réactivé)
  • Retrait des données d'étagement :
    • Désactiver l'étagement et actualiser (purgé après 30 jours)
    • Supprimer le dataflow ou l'espace de travail pour un retrait immédiat
Ingestion de données et modèles sémantiques avec Microsoft Fabric

Accélérer l'ingestion avec Fast Copy

Une fonction d'ingestion à haute vitesse qui passe à l'échelle pour de grands ensembles de données

  • Architecture : Redistribue les charges lourdes de Power Query vers un pipeline haute performance pour accélérer le traitement
  • Avantage : Réduit le temps de traitement grâce à des ressources arrière-plan extensibles pour de gros volumes

Architecture de Fast Copy pour Dataflows Gen2

Ingestion de données et modèles sémantiques avec Microsoft Fabric

Optimiser Fast Copy : préalables et réglages clés

Préalables :

  • Fichiers : 100 Mo+ (CSV/Parquet)
  • Bases de données : 5 M+ de lignes (Azure SQL DB, PostgreSQL)
  • Connecteurs pris en charge : ADLS Gen2, Stockage d'objets Blob, SQL DB, Lakehouse, PostgreSQL, SQL Server local, Warehouse, Oracle
  • Transformations prises en charge : Combiner des fichiers, Sélectionner des colonnes, Changer les types, Renommer/Supprimer des colonnes

Exiger l'option Fast Copy :

  • Force l'usage de Fast Copy, échoue immédiatement si les critères ne sont pas remplis
  • Économise du temps en évitant les longues attentes avec un traitement plus lent
Ingestion de données et modèles sémantiques avec Microsoft Fabric

Destination par défaut de Dataflow Gen2

  • Créez des Dataflows autonomes pour des destinations précises (Lakehouse, Warehouse ou base de données KQL).

  • Les réglages préconfigurés de destination s'appliquent automatiquement, ce qui accélère le développement !

Comportements préréglés : comportements par défaut, non modifiables

  • Lakehouse : Méthode de mise à jour Remplacer, Schéma dynamique
  • Warehouse/Base de données KQL : Méthode de mise à jour Ajouter, Schéma fixe

Destination de données par défaut dans Dataflows Gen2

Ingestion de données et modèles sémantiques avec Microsoft Fabric

Passons à la pratique !

Ingestion de données et modèles sémantiques avec Microsoft Fabric

Preparing Video For Download...