Data Lake
Un Data Lake stocke de grands volumes de données brutes, structurées ou non structurées, dans leur format d’origine afin de permettre des usages analytiques, exploratoires et de machine learning.
Comment cela fonctionne
Les sources déposent leurs données dans un stockage distribué et économique. Les fichiers sont souvent organisés par zones correspondant au niveau de traitement : brut, contrôlé puis prêt à l’usage. Les moteurs de calcul lisent ces données à la demande. Un catalogue, des droits d’accès et des contrôles de qualité sont indispensables pour éviter que le lac ne devienne un ensemble opaque de fichiers difficiles à réutiliser.
Exemple concret
Une entreprise industrielle peut conserver les mesures de capteurs, les journaux d’équipements, les images de contrôle et les données de maintenance. Les data scientists exploitent ensuite cet historique pour rechercher les signaux précédant une panne.
Principaux avantages
- Stockage flexible de formats variés
- Coût adapté aux grands volumes
- Base utile pour l’exploration et l’IA
Points de vigilance
- Qualité non garantie par défaut
- Découverte parfois difficile
- Gouvernance et sécurité indispensables
Questions fréquentes
Un Data Lake remplace-t-il un Data Warehouse ?
Pas systématiquement. Le lac privilégie la flexibilité, tandis que l’entrepôt apporte des modèles et performances adaptés au reporting gouverné.
Qu’est-ce qu’un data swamp ?
C’est un Data Lake mal documenté et mal gouverné, dans lequel les utilisateurs ne savent plus quelles données sont fiables ni comment les interpréter.
Termes associés
Pour approfondir : AWS - Qu’est-ce qu’un Data Lake ?