Concetto: Pipeline di set di dati
I set di dati contengono una o più pipeline. Una pipeline è un contenitore di fasi che modella il flusso di trasformazione dei dati in un set di dati. È costituito da un elenco ordinato di fasi, ognuna delle quali definisce come modificare i dati in quel punto della pipeline. Le pipeline possono contenere una o più fasi.
Ogni set di dati ha una pipeline principale e potrebbe avere zero o più pipeline aggiuntive.
La prima fase di una pipeline importa i dati dall'origine del set di dati. Le fasi elencate dopo la prima fase di una pipeline utilizzano l'output della pipeline precedente come input per la fase corrente. Se si ha familiarità con i workflow ETL (estrazione, trasformazione e caricamento), ogni fase è uno step di una pipeline di sviluppo.
L'ultima fase di qualsiasi pipeline è l'output della pipeline. L'output della pipeline principale è l'output dell'intero set di dati. Pertanto, quando si pubblica un set di dati, l'output della pipeline principale viene materializzato come dati nell'origine dati Prism.