Data Pipeline
Un Data Pipeline est une chaîne automatisée qui collecte, déplace, transforme, contrôle et publie des données entre une ou plusieurs sources et leurs destinations.
Comment cela fonctionne
Le pipeline peut fonctionner par lots ou en continu. Il orchestre des étapes, gère les dépendances, journalise les exécutions et traite les erreurs. Un pipeline fiable est idempotent lorsque c’est possible, observable, testable et documenté. Il prévoit la reprise, les alertes et les engagements de fraîcheur attendus par les consommateurs.
Exemple concret
Toutes les heures, un pipeline récupère les nouveaux tickets du CRM, contrôle les identifiants client, enrichit les données avec le référentiel puis actualise les tables utilisées par le tableau de bord relation client.
Principaux avantages
- Traitements reproductibles
- Données actualisées automatiquement
- Contrôles industrialisés
Points de vigilance
- Dépendances fragiles
- Supervision nécessaire
- Coûts de calcul et de transfert
Questions fréquentes
Batch ou temps réel ?
Le choix dépend de la décision à prendre. Le temps réel ajoute du coût et de la complexité ; un traitement horaire ou quotidien suffit souvent.
Comment mesurer sa fiabilité ?
Suivez les échecs, retards, volumes inattendus, contrôles de qualité, temps de reprise et respect des engagements de fraîcheur.
Termes associés
Pour approfondir : AWS - Qu’est-ce qu’un pipeline de données ?