Étapes : configurer des sources de données à base de script
Les sources de données à base de script vous permettent de résoudre des scénarios complexes et personnalisés d’extraction et de transformation des données. Vous pouvez écrire des scripts Kettle ETL pour spécifier les sources d’information à partir desquelles les données doivent être extraites, puis appliquer des règles de gestion propres au client aux données extraites. Avant de configurer une source de données à base de script, Data Agent doit être installé sur un serveur Windows local sur le réseau. Voir : Concept : agents de données pour plus d'informations.
La plateforme ou les scripts utilisés dans Kettle ne sont pas mis à niveau ou ne migrent pas automatiquement. Si vous comptez utiliser l’agent de données existant (avec Kettle 4.4), cliquez sur le lien de la section Télécharger l’agent hérité dans l’interface utilisateur d’Intégration. Si vous voulez effectuer la mise à niveau à Kettle 6, vous devez réinstaller le nouvel agent de données et la nouvelle version de Kettle sur un système sur lequel aucune version de Kettle n’a jamais été installée auparavant.
Les sources de données à base de script sont destinées aux chargés d’implémentation ETL avancés qui savent parfaitement rédiger des scripts Pentaho Kettle et utiliser l’interface utilisateur Spoon. Pour obtenir plus d’information sur Pentaho Kettle et Spons, notamment une documentation détaillée et des tutoriels, voir https://docs.hitachivantara.com/p/tentaho-ia.
Pour configurer une source de données à base de script, procédez comme suit :
- Accédez au concepteur de données en sélectionnantIntégration > Concevoir des intégrations.
- Dans le dossier Source de données de la bibliothèque de composants du côté droit de l’écran, cliquez surCréer une nouvelle source de données. La boîte de dialogue Créer s’affiche.
- SélectionnezSource de données à base de scriptcomme type de source de données et entrez un nom.
- Cliquez surCréer. La zone centrale de l’écran affiche les paramètres de votre nouvelle source de données, ainsi que d’autres informations.
- Entrez l’information de la source de données :
- Agent associé :sélectionnez l’agent dans la liste déroulante.
- Point d’entrée :sélectionnez un point d’entrée dans la liste déroulante. Le point d’entrée est un script ETL dans le système. Vous pourrez le modifier ultérieurement.
- Niveau de journalisation :sélectionnez un niveau de journalisation dans la liste déroulante afin de préciser les détails de journalisation pour cette source de données. Vos options sont les suivantes :
- Erreur :consigne uniquement les erreurs graves.
- Informations :consigne toute l’information de base. Par exemple, lorsque la source de données a été mise à jour.
- Mode détaillé: fournit de l’information très détaillée sur toutes les phases et actions. (Ce niveau est principalement utilisé pour le débogage ou l’audit, car il génère souvent trop d’informations pour une utilisation normale.)
- URI source :entrez les URI auxquelles vos scripts se connectent en les séparant par un point-virgule (;). Ce champ vous permet de déterminer et de documenter les systèmes sources sous-jacents auxquels vos scripts se connectent et n’est pas utilisé par le logiciel à d’autres fins.
- Cliquez surEnregistrerdans le menu Actions.
Démarrer Spoon
Après avoir enregistré l’information standard de la source de données à base de script, vous pouvez démarrer Spoon, l’éditeur de scripts ETL, travailler avec le script et ajouter des tables à la source de données à base de script.
Pour afficher et modifier un script, procédez comme suit :
- Dans le menu Démarrer de Windows, cliquez surTous les programmes.
- Ouvrez le dossier Workday Adaptive Planning Data Agent. Pour les versions 7.1.44 et antérieures de Data Agent, ouvrez le dossier Adaptive Data Agent.
- Cliquez sur Adaptive Script Editor. Après la fenêtre d’attente de Pentaho et un truc de démarrage, l’écran Spoon s’affiche.
- Entrez votreAdaptive Planningl’adresse de courriel et le mot de passe de connexion, puis cliquez surOuvrir une session/Actualiser la liste du locataire. Si vous avez synchronisé les utilisateurs depuis Workday, voir Ouvrir une session dans l’agent de données et l’éditeur de scripts avec des données d’identification Workday.
- Sélectionnez le locataire dans la liste déroulante. Il n’y a généralement qu’un seul locataire. Spoon actualise la liste des locataires.
- Sélectionnez l’agent que vous utilisez pour cette source de données dans la liste déroulante. Spoon actualise la liste des agents.
- Dans Edit Script, sélectionnez la source de données à base de script que vous venez de créer dans la liste déroulante.
Maintenant que vous êtes connecté et avez indiqué à Spoon l’agent et la source de données sur lesquels vous travaillez, vous pouvez commencer à modifier le script.
- Cliquez sur Data Integration dans le coin supérieur droit de l’écran Spoon. La perspective Integration de Spoon s’affiche.
- SélectionnezFichier > Ouvriret accédez au script que vous souhaitez afficher et modifier, puis cliquez surOK. Les exemples de scripts d’une source de données à base de script fournis avec Intégration donnent de l’information sur la structure des scripts et les connexions de bases de données qui peuvent vous être utiles pour le développement de vos propres scripts.
- Modifiez le script, le cas échéant, puis enregistrez-le.
- Cliquez sur Adaptive en haut à droite pour revenir à la perspective Adaptive. L’écran Spoon s’affiche à nouveau.
- Cliquez surPublish Agent Changes. Cela reporte le script jusqu'auAdaptive Planningserveur, où il est stocké dans le référentiel de scripts.
Les modes d’importation de données suivants sont pris en charge. Les paramètres peuvent varier selon la table.
- Tous les enregistrements sont remplacés dès que des données sont importées.
- L’agent distant analyse tous les enregistrements source et transmet les enregistrements modifiés dès que les données doivent être synchronisées.
- Tous les enregistrements qui appartiennent à la plage de périodes sont transmis.
Ajouter des tables et des colonnes à une source de données à base de script
Une fois le script en place, vous pouvez ajouter des tables et des colonnes à votre source de données dans l’intégration.
Les colonnes définies dans la source de données doivent correspondre exactement aux colonnes définies dans le script ETL, sinon le chargement de données échouera.
Pour ajouter des tables à une source de données à base de script, procédez comme suit :
- Développez l’entrée Table personnalisée dans le menu Composants de données.
- Glissez-déposez l’élémentTable à base de scriptdans la zone Tables à importer. Lorsque vous déposez cet élément, la boîte de dialogue Table à base de script s’affiche.
- Entrez les paramètres de table :
- Nom :entrez le nom de la table.
- Mode d’importation des données :sélectionnez l’un des modes d’importation suivants :
- Tous les enregistrements sont remplacés à chaque exécution d’une importation de données :il s’agit du paramètre par défaut. Chaque fois que vous importez des données, tous les enregistrements de la zone intermédiaire sont remplacés.
- Cache distant utilisé pour déterminer et envoyer des enregistrements modifiés lors de l’importation :Intégration examine la zone intermédiaire et la compare aux enregistrements du tableur ou de la base de données et importe uniquement les enregistrements modifiés.
- Tous les enregistrements qui se situent dans la période sont transmis :lorsque vous sélectionnez ce mode, vous êtes invité à entrer une plage de périodes et une colonne d’intégration à laquelle s’applique cette période. Tous les enregistrements qui remplissent ce critère de sélection sont importés.
- Filtre d’importation des données :utilisez cette option pour entrer une expression SQL qui filtre ou formate l’information en cours d’importation. Le filtre SQL est appliqué avant que les données ne soient extraites de la base de données afin de réduire la quantité de données devant être importées, ce qui vous donne un niveau de contrôle supplémentaire concernant les données à introduire dans la zone intermédiaire. Cliquez sur le champ pour faire afficher la boîte de dialogue Modifier le filtre SQL, décrite précédemment. (Le filtre que vous entrez ici s’applique aux données réelles de la base de données et non aux données de l’aperçu dans la zone intermédiaire.)
- Cliquez surAppliquerpour appliquer les paramètres.
Pour ajouter des colonnes à une source de données à base de script, procédez comme suit :
- Développez l’entrée Colonne personnalisée dans le menu Composants de données.
- Glissez-déposez l’un des types de colonnes dans la zone Tables à importer. Lorsque vous déposez cet élément, la boîte de dialogue Colonnes personnalisées s’affiche.
- Entrez les paramètres de colonne suivants :
- Nom :entrez le nom de la colonne. Les noms de colonne doivent correspondre exactement aux noms de colonnes spécifiés dans le script Spoon, majuscules et espaces intégrés inclus.
- Type de colonne :champ en mode affichage uniquement qui détermine le type de colonne.
- Convertir le type de colonne :vous ne pouvez pas modifier cette valeur, sauf pour les colonnes SQL. Pour les colonnes SQL, vous pouvez sélectionner une demi-douzaine d’options de conversion.
- Cliquez surAppliquerpour appliquer les paramètres.
Gérer les colonnes
Si une table sur laquelle vous travaillez comporte un grand nombre de colonnes, vous pouvez utiliser Gérer les colonnes pour modifier rapidement les colonnes à importer. La boîte de dialogue Gérer les colonnes affiche les colonnes disponibles dans une table afin que vous puissiez cocher ou décocher les colonnes à importer.
Pour gérer les colonnes à importer, procédez comme suit :
- Cliquez sur la flèche de l’onglet situé à droite du nom de la table. Un menu flottant comportant plusieurs options s’affiche.
- Cliquez surGérer les colonnesdans le menu flottant. La boîte de dialogue Gérer les colonnes s’affiche.
- Cochez la case située à côté d’une colonne pour l’importer. Lorsque vous cochez une colonne, celle-ci s’affiche également dans la fenêtre d’aperçu une fois que le contenu contextuel est enregistré. Si vous décochez une colonne, la colonne sera retirée de la fenêtre d’aperçu. Vous ne pouvez pas changer le statut de l’importation dans les champs générés par le système, tels queisDeleted. Vous pouvez également modifier le statut d’importation de colonnes individuelles en sélectionnant les propriétés de colonne et en définissant la propriété ou en faisant glisser les colonnes jusqu’au concepteur.
Personnaliser les tables
Pour chaque table, vous pouvez personnaliser le mode d’importation des données.
Pour personnaliser les paramètres d’une table, procédez comme suit :
- Cliquez sur la flèche de l’onglet situé à droite du nom de la table. Un menu flottant comportant plusieurs options s’affiche.
- Cliquez surParamètres de tabledans le menu flottant.
- Cliquez surAppliquerpour appliquer les paramètres.
- Répétez les étapes 1 à 3 pour chaque table.
- Cliquez surEnregistrerpour enregistrer les paramètres dans la source de données.
Paramétrer les options de colonne
Lorsque vous utilisez la section Tables à importer, vous pouvez voir un aperçu des données telles qu’elles se trouvent dans la source de données ou dans la zone intermédiaire après leur importation. Vous pouvez modifier les options de chaque colonne en passant la souris sur son titre, puis en cliquant sur le menu déroulant à côté de son nom. Ces options sont les suivantes :
- Trier par ordre croissant :triez l’ensemble de la table en fonction de cette colonne dans l’ordre croissant.
- Trier par ordre décroissant: triez l’ensemble de la table en fonction de cette colonne dans l’ordre décroissant.
- Paramètres de colonne :cette boîte de dialogue permet de modifier les propriétés de la colonne dans la table intermédiaire.
- Nom :nom de la colonne, tel qu’il est affiché dans l’en-tête.
- Type de colonne: type de données utilisées dans la colonne.
- Convertir le type de colonne :sélectionnez le nouveau type dans ce menu déroulant.
- Exclure la colonne de l’importation: sélectionnez cette option pour retirer cette colonne des données importées.
- Supprimer une colonne personnalisée: sélectionnez cette option pour supprimer la colonne. (Disponible uniquement pour les colonnes personnalisées.)
Télécharger des données depuis une table intermédiaire
Vous pouvez télécharger des données à partir d’une seule table intermédiaire.
Pour télécharger des données à partir d’une seule table intermédiaire, procédez comme suit :
- Cliquez sur la flèche vers le bas située dans un en-tête de table de la section Tables à importer.
- Cliquez surTélécharger les données.
- À l’invite,cette opération enverra un courriel avec une adresse URL pour télécharger les données, cliquez surEnvoyer.Adaptive Planningenvoie un courriel contenant une adresse URL au compte de courriel associé au concepteur de données.
- Ouvrez le courriel et cliquez sur l’URL. Les données sont téléchargées au format .csv.
Utiliser le filtre avancé
Sous le menu déroulant Source, vous pouvez cliquer sur
Filtre avancé
afin d’afficher des options permettant de filtrer les données dans la zone d’aperçu Tables à importer
. L’option Filtre avancé fournit des outils pour afficher et parcourir un sous-ensemble des données dans une table intermédiaire ou dans le script. (Lorsque vous sélectionnez Script dans la liste déroulante Source, la demande d’aperçu est envoyée à l’agent pour traitement.) En modifiant les propriétés du filtre, vous pouvez modifier la vue des données affichées dans la fenêtre d’aperçu sans modifier les données dans la zone intermédiaire.La zone d’aperçu est spécifiquement destinée à l’affichage d’un aperçu d’une petite partie des données de la zone intermédiaire. Vous pouvez explorer les données disponibles dans le tableur et vérifier que vous obtenez les données que vous attendez en examinant la zone intermédiaire. (Les filtres définis dans la fonction d’aperçu n’ont aucune incidence sur les données réelles de la zone intermédiaire.)
Les options de filtre avancé sont les suivantes :
- Lignes distinctes: cochez cette case pour masquer les lignes dupliquées.
- Nombre maximum de lignes :limitez le nombre de lignes affichées dans la zone d’aperçu en entrant un nombre dans la zone de texte.
- Colonnes :sélectionnez ou désélectionnez les colonnes dans ce menu déroulant pour afficher ou masquer les colonnes affichées.
Même si vous retirez une colonne de cette liste, la colonne ne sera pas retirée de la liste de l’importation.
- Filtre SQL: cliquez sur la grande zone de texte pour afficher la boîte de dialogue Modifier le filtre SQL (décrite précédemment), dans laquelle vous pouvez entrer un filtre SQL pour limiter le nombre de lignes de l’aperçu. Cliquez surAppliquerpour vérifier automatiquement la syntaxe SQL du filtre. (S’il y a des erreurs, celles-ci sont indiquées dans l’expression.) Pour obtenir de l’aide sur la syntaxe SQL, cliquez sur l’aide en ligne dans la section Notes.
Cliquez sur
Supprimer le filtre
(à côté du menu déroulant Source) pour effacer tous les paramètres de filtre avancé.Dans le cadre du processus de personnalisation de table, vous pouvez également créer des tables de jointure et des colonnes personnalisées en utilisant des expressions SQL.
Ajouter et modifier des paramètres
Vous pouvez utiliser des paramètres pour transmettre de l’information au script Kettle sous-jacent. Ces paramètres peuvent être définis avec une valeur par défaut. Le script peut ensuite utiliser ces paramètres pour contrôler les transformations et le filtrage dans les scripts ETL.
Pour ajouter un paramètre, procédez comme suit :
- Cliquez sur l’icôneModifier les paramètresà droite de l’en-tête Paramètres. La boîte de dialogue Éditeur de paramètres s’affiche.
- Dans le panneau de gauche, cliquez sur le dossier auquel vous souhaitez ajouter un paramètre. Le nom du dossier s’affiche dans le panneau de droite.
- Cliquez surAjouteret sélectionnez l’une des options suivantes dans le menu flottant :
- Dossier :créez un nouveau dossier.
- Booléen: créez un paramètre booléen (vrai/faux).
- Entier: créez un paramètre de nombre entier.
- Texte: créez un paramètre de texte.
- Mot de passe: créez un paramètre de mot de passe.
- Plage de périodes: créez un paramètre de plage de périodes (dates de/à).
- Dimension: créez une dimension.
- Version des chiffres réels: créez une version des chiffres réels.
- Version du plan: créez une version du plan.
- Dans le panneau de droite, entrez de l’information pour l’option que vous avez sélectionnée.
- Cliquez surAppliquer.
Vous pouvez modifier chaque paramètre individuel ou les dossiers en cliquant deux fois sur celui que vous souhaitez modifier dans le panneau de gauche et en modifiant l’information dans les champs, puis en cliquant sur Appliquer pour les enregistrer.
Vous pouvez également créer des dossiers pour regrouper des paramètres, puis faire glisser les paramètres dans le dossier.
Importer des données avec une source de données à base de script
Après avoir configuré et enregistré votre source de données à base de script, vous pouvez importer des données.
Pour importer des données avec une source de données à base de script, procédez comme suit :
- Cliquez surImporter des donnéesdans le menu Actions. Les données sélectionnées sont filtrées par les scripts ETL, ainsi que par toutes les expressions SQL, puis chargées dans la zone intermédiaire. Vous pouvez afficher un aperçu des données dans la zone intermédiaire.
L’information reste dans la zone intermédiaire jusqu’à ce que vous les effaciez ou jusqu’à ce qu’un chargement de données ultérieur entraîne leur suppression en fonction du paramètre actif Mode d’importation des données.
Pour effacer des données de la zone intermédiaire :
- Cliquez surEffacer les tables intermédiairesdans le menu Actions. La zone intermédiaire est effacée pour toutes les tables dans la source de données.