Concept : pipelines de jeux de données
Les jeux de données contiennent un ou plusieurs pipelines. Un pipeline est un conteneur de stades qui modélise le flux de transformation des données dans un jeu de données. Il se compose d’une liste ordonnée de stades, dont chacun définit comment modifier les données à ce stade dans la filière. Les filières peuvent contenir un ou plusieurs stades.
Chaque jeu de données comporte un pipeline principal et peut avoir zéro ou plus de pipelines supplémentaires.
La première étape d’un pipeline apporte des données provenant de la source du jeu de données. Les stades répertoriés après le premier stade d’un pipeline utilisent la sortie du pipeline précédent comme donnée entrante du stade actuel. Si vous connaissez les flux des travaux ETL (extraction, transformation et chargement), chaque stade est une étape dans un pipeline de développement.
Le dernier stade de tout pipeline est la sortie de ce pipeline. La sortie du pipeline principal est la sortie de l'ensemble du jeu de données. Par conséquent, lorsque vous publiez un jeu de données, la sortie du pipeline principal est matérialisée sous forme de données dans la source de données Prism.