Étapes : configurer des sources de données par script
Les sources de données par script vous permettent de résoudre des scénarios complexes et personnalisés d'extraction et de transformation des données. Vous pouvez écrire des scripts Kettle ETL pour spécifier les sources d'informations à partir desquelles les données doivent être extraites, puis appliquer des règles de gestion spécifiques du client aux données extraites. Avant de configurer une source de données par script, l'agent de données doit être installé sur un serveur Windows local sur le réseau. Voir Concept : agents de données pour plus d'informations.
La mise à niveau ou la migration de la plateforme ou des scripts utilisé(e)s dans Kettle n'est pas automatique. Si vous comptez utiliser l'agent de données existant (avec Kettle 4.4), cliquez sur le lien de la section Télécharger l'agent hérité dans l'interface utilisateur d'Intégration. Si vous voulez effectuer la mise à niveau avec Kettle 6, vous devez réinstaller le nouvel agent de données et la nouvelle version de Kettle dans un système où aucune version de Kettle n'a jamais été installée.
Les sources de données par script sont destinées aux chargés d'implémentation ETL avancés qui savent parfaitement rédiger des scripts Pentaho Kettle et utiliser l'interface utilisateur Spoon. Pour plus d'informations sur Pentaho Kettle et Spoon, notamment des documents et tutoriels détaillés, consultez https://docs.hitachivantara.com/p/pentaho-da.
Pour configurer une source de données par script, procédez comme suit :
- Accédez au concepteur de données en sélectionnantIntégration > Concevoir des intégrations.
- Dans le dossier Source de données de la Bibliothèque de composants à droite de l'écran, cliquez surCréer une nouvelle source de données. La boîte de dialogue Créer apparaît.
- SélectionnezSource de données par scriptcomme type de source de données et saisissez un nom.
- Cliquez surCréer. La zone centrale de l'écran affiche les paramètres de votre nouvelle source de données, ainsi que d'autres informations.
- Saisissez les informations de la source de données :
- Agent associé :sélectionnez l'agent dans la liste déroulante.
- Point d'entrée :sélectionnez un point d'entrée dans la liste déroulante. Le point d'entrée est un script ETL sur le système. Vous pourrez le modifier ultérieurement.
- Niveau de journalisation :sélectionnez un niveau de journalisation dans la liste déroulante afin de spécifier les détails de journalisation de cette source de données. Vos options sont les suivantes :
- Erreur :consigne uniquement les erreurs graves.
- Informations :consigne toutes les informations de base. Par exemple, lorsque la source de données a été mise à jour.
- Mode détaillé: fournit des informations très détaillées sur toutes les phases et actions. (Ce périmètre est principalement utilisé pour le débogage ou l'audit car il génère souvent trop d'informations pour une utilisation normale.)
- URI source :saisissez les URI auxquelles vos scripts se connectent en les séparant par un point-virgule ( ;). Ce champ vous permet d'identifier et de documenter les systèmes sources sous-jacents auxquels vos scripts se connectent et ne sert pas à une quelconque autre finalité.
- Cliquez surEnregistrerdans le menu Actions.
Démarrer Spoon
Après avoir enregistré les informations standard de la source de données par script, vous pouvez démarrer Spoon, l'éditeur de scripts ETL, travailler avec le script et ajouter des tables à la source de données par script.
Pour afficher et modifier un script, procédez comme suit :
- Dans le menu Démarrer de Windows, cliquez surTous les programmes.
- Ouvrez le dossier Workday Adaptive Planning Data Agent Pour les versions 7.1.44 et antérieures de Data Agent, ouvrez le dossier Adaptive Data Agent.
- Cliquez sur Adaptive Script Editor. Après l'écran de présentation de Pentaho et un conseil de démarrage, l'écran Spoon apparaît.
- Saisissez votreAdaptive PlanningE-mail et mot de passe de connexion, puis cliquez surLogin Now/Refresh Tenant List. Si vous avez synchronisé des utilisateurs dans Workday, consultez Se connecter à l'agent de données et à l'éditeur de script avec Workday Credentials.
- Sélectionnez l'environnement client dans la liste déroulante. Il n'y a généralement qu'un seul environnement client. Spoon actualise la liste des environnements client.
- Sélectionnez l'agent que vous utilisez pour cette source de données dans la liste déroulante. Spoon actualise la liste des agents.
- Dans Edit Script, sélectionnez la source de données par script que vous venez de créer dans la liste déroulante.
Maintenant que vous êtes connecté et avez indiqué à Spoon l'agent et la source de données sur lesquels vous travaillez, vous pouvez commencer à modifier le script.
- Cliquez sur Intégration des données dans le coin supérieur droit de l'écran Spoon. La perspective Integration de Spoon apparaît.
- SélectionnezFichier > Ouvriret accédez au script que vous souhaitez afficher et modifier, puis cliquez surOK. Les exemples de scripts d'une source de données par script fournis avec Integration donnent des informations sur la structure des scripts et les connexions de bases de données qui peuvent vous être utiles pour le développement de vos propres scripts.
- Modifiez le script, le cas échéant, puis enregistrez-le.
- Cliquez sur Adaptive en haut à droite pour revenir à la perspective Adaptive. L'écran Spoon s'affiche à nouveau.
- Cliquez surPublier les modifications d'agent. Le script revient auAdaptive Planningserveur, où elle est stockée dans le référentiel de scripts.
Les modes d'import de données suivants sont pris en charge. Les paramètres peuvent varier selon la table.
- Tous les enregistrements sont remplacés dès que des données sont importées.
- L'agent distant analyse tous les enregistrements sources et transmet les enregistrements modifiés dès que les données doivent être synchronisées.
- Tous les enregistrements qui appartiennent à la plage de périodes sont transmis.
Ajouter des tables et des colonnes à une source de données par script
Une fois le script en place, vous pouvez ajouter des tables et des colonnes à votre source de données dans l'intégration.
Les colonnes définies dans la source de données doivent correspondre exactement aux colonnes définies dans le script ETL, sinon la charge de données échouera.
Pour ajouter des tables à une source de données par script, procédez comme suit :
- Développez l'entrée Table personnalisée dans le menu Composants de données.
- Faites glisser l'élémentTable basée sur un scriptjusqu'à la zone Tables à importer. Lorsque vous déposez cet élément, la boîte de dialogue Table basée sur un script apparaît.
- Saisissez les paramètres de la table :
- Nom :saisissez le nom de la table.
- Mode d'import des données :sélectionnez l'un des modes d'import suivants :
- Tous les enregistrements sont remplacés à chaque exécution d'un import de données: il s'agit du paramètre par défaut. Chaque fois que vous importez des données, tous les enregistrements de la zone de stockage temporaire sont remplacés.
- Cache distant utilisé pour identifier et envoyer des enregistrements modifiés lors de l'import :Integration examine la zone de stockage temporaire et la compare aux enregistrements de la feuille de calcul ou de la base de données et importe uniquement les enregistrements modifiés.
- Tous les enregistrements qui appartiennent à une plage de périodes sont transmis :lorsque vous sélectionnez ce mode, vous êtes invité à saisir une plage de périodes et une colonne d'intégration à laquelle s'applique cette plage. Tous les enregistrements qui remplissent ce critère de sélection seront importés.
- Filtre d'import des données :utilisez cette option pour saisir une expression SQL qui filtre ou formate les informations en cours d'import. Le filtre SQL est appliqué avant que les données ne soient extraites de la base de données afin de réduire la quantité de données devant être importées, ce qui vous donne un niveau de contrôle supplémentaire concernant les données à introduire dans la zone de stockage temporaire. Cliquez sur le champ pour faire apparaître la boîte de dialogue Modifier le filtre SQL, décrite précédemment. (Le filtre que vous saisissez ici s'applique aux données réelles de la base de données et non aux données de prévisualisation de la zone de stockage temporaire.)
- Cliquez surAppliquerpour appliquer les paramètres.
Pour ajouter des colonnes à une source de données par script, procédez comme suit :
- Développez l'entrée Colonne personnalisée dans le menu Composants de données.
- Faites glisser et déposez l'un des types de colonnes dans la zone Tables à importer. Lorsque vous déposez cet élément, la boîte de dialogue Colonnes personnalisées s'affiche.
- Saisissez les paramètres de colonne suivants :
- Nom :saisissez le nom de la colonne. Les noms de colonne doivent correspondre exactement aux noms de colonnes spécifiés dans le script Spoon, capitalisation et espaces intégrés inclus.
- Type de colonne :champ en mode affichage uniquement qui identifie le type de colonne.
- Convertir le type de colonne :vous ne pouvez pas modifier cette valeur, sauf les colonnes SQL. Pour les colonnes SQL, vous pouvez sélectionner une demi-douzaine d'options de conversion.
- Cliquez surAppliquerpour appliquer les paramètres.
Gérer les colonnes
Si une table sur laquelle vous travaillez comporte un grand nombre de colonnes, vous pouvez utiliser Gérer les colonnes pour modifier rapidement les colonnes à importer. La boîte de dialogue Gérer les colonnes affiche les colonnes disponibles dans une table afin que vous puissiez cocher ou décocher les colonnes à importer.
Pour gérer les colonnes à importer, procédez comme suit :
- Cliquez sur la flèche de l'onglet situé à droite du nom de la table. Un menu flottant comportant plusieurs options apparaît.
- Cliquez surGérer les colonnesdans le menu flottant. La boîte de dialogue Gérer les colonnes s'affiche.
- Cochez la case en regard d'une colonne pour l'importer. Lorsque vous cochez une colonne, celle-ci apparaît également dans la fenêtre d'aperçu une fois que le contenu contextuel est sauvegardé. Si vous décochez une colonne, la colonne sera supprimée de la fenêtre d'aperçu. Vous ne pouvez pas modifier le statut d'import sur des champs générés par le système, tels que :isDeleted. Vous pouvez également modifier le statut d'import de colonnes individuelles en sélectionnant les propriétés de colonne et en définissant la propriété ou en faisant glisser les colonnes jusqu'au concepteur.
Personnaliser les tables
Pour chaque table, vous pouvez personnaliser le mode d'import des données.
Pour personnaliser les paramètres d'une table, procédez comme suit :
- Cliquez sur la flèche de l'onglet situé à droite du nom de la table. Un menu flottant comportant plusieurs options apparaît.
- Cliquez surParamètres de la tabledans le menu flottant.
- Cliquez surAppliquerpour appliquer les paramètres.
- Répétez les étapes 1 à 3 pour chaque table.
- Cliquez surEnregistrerpour enregistrer les paramètres dans la source de données.
Paramétrer les options des colonnes
Lorsque vous utilisez la section Tables à importer, vous pouvez voir un aperçu des données telles qu'elles se trouvent dans la source de données ou dans la zone de stockage temporaire après leur import. Vous pouvez modifier les options de chaque colonne en passant la souris sur son titre, puis en cliquant sur le menu déroulant en regard de son nom. Ces options sont les suivantes :
- Trier par ordre croissant :triez l'ensemble de la table en fonction de cette colonne dans l'ordre croissant.
- Trier par ordre décroissant: triez l'ensemble de la table en fonction de cette colonne dans l'ordre décroissant.
- Paramètres de la colonne :cette boîte de dialogue permet de modifier les propriétés de la colonne dans la table temporaire.
- Nom :nom de la colonne, tel qu'il est affiché dans l'en-tête.
- Type de colonne: type de données utilisées dans la colonne.
- Convertir le type de colonne :sélectionnez le nouveau type dans ce menu déroulant.
- Exclure la colonne de l'import: sélectionnez cette option pour supprimer cette colonne des données importées.
- Supprimer une colonne personnalisée: sélectionnez cette option pour supprimer la colonne. (Disponible uniquement pour les colonnes personnalisées.)
Télécharger des données depuis une table temporaire
Vous pouvez télécharger des données à partir d'une seule table temporaire.
Pour télécharger des données à partir d'une seule table temporaire, procédez comme suit :
- Cliquez sur la flèche bas située dans un en-tête de table de la section Tables à importer.
- Cliquez surTélécharger les données.
- Lorsque vous y êtes invité, cliquez surEnvoyer.Cette opération va envoyer un e-mail contenant une adresse URL pour télécharger les données.Adaptive Planningenvoie un e-mail contenant une URL au compte de messagerie associé au concepteur de données.
- Ouvrez l'e-mail et cliquez sur l'URL. Les données sont téléchargées au format .csv.
Utiliser le filtre avancé
Sous le menu déroulant Source, vous pouvez cliquer sur
Filtre avancé
afin d'afficher des options permettant de filtrer les données dans la zone de prévisualisation Tables à importer
. L'option Filtre avancé fournit des outils pour afficher et parcourir un sous-ensemble des données dans une table temporaire ou dans le script. (Lorsque vous sélectionnez Script dans la liste déroulante Source, la demande d'aperçu est envoyée à l'agent pour traitement.) En modifiant les propriétés du filtre, vous pouvez modifier la vue des données affichées dans la fenêtre de prévisualisation sans modifier les données dans la zone de stockage temporaire.La zone de prévisualisation est spécifiquement destinée à prévisualiser une petite partie des données de la zone de stockage temporaire. Vous pouvez explorer les données disponibles dans la feuille de calcul et vérifier que vous obtenez les données que vous attendez en examinant la zone de stockage temporaire. (Les filtres définis dans la fonction d'aperçu n'ont aucune incidence sur les données réelles de la zone de stockage temporaire.)
Les options de filtre avancé sont les suivantes :
- Lignes distinctes: cochez cette case pour masquer les lignes dupliquées.
- Nombre maximum de lignes: limitez le nombre de lignes affichées dans la zone d'aperçu en saisissant un nombre dans la zone de texte.
- Colonnes: cochez ou décochez les colonnes dans ce menu déroulant pour afficher ou masquer les colonnes affichées.
Si vous supprimez une colonne de cette liste, la colonne ne sera pas supprimée de la liste de l'import.
- Filtre SQL: cliquez sur la grande zone de texte pour afficher la boîte de dialogue Modifier le filtre SQL (décrite précédemment) dans laquelle vous pouvez saisir un filtre SQL pour limiter le nombre de lignes prévisualisées. Cliquez surAppliquerpour vérifier automatiquement la syntaxe SQL du filtre. (S'il y a des erreurs, celles-ci sont indiquées dans l'expression.) Pour obtenir de l'aide sur la syntaxe SQL, cliquez sur l'aide en ligne dans la section Remarques.
Cliquez sur
Supprimer le filtre
(en regard du menu déroulant Source) pour effacer tous les paramètres de filtre avancé.Dans le cadre du processus de personnalisation de table, vous pouvez également créer des tables de jointure et des colonnes personnalisées en utilisant des expressions SQL.
Ajouter et modifier des paramètres
Vous pouvez utiliser des paramètres pour transmettre des informations au script Kettle sous-jacent. Ces paramètres peuvent être définis avec une valeur par défaut. Le script peut ensuite utiliser ces paramètres pour contrôler les transformations et le filtrage dans les scripts ETL.
Pour ajouter un paramètre, procédez comme suit :
- Cliquez sur l'icôneModifier les paramètresà droite de l'en-tête Paramètres. La boîte de dialogue Éditeur de paramètres apparaît.
- Cliquez sur le dossier dans le panneau de gauche auquel vous souhaitez ajouter un paramètre. Le nom du dossier apparaît dans le panneau de droite.
- Cliquez surAjouteret sélectionnez l'une des options suivantes dans le menu flottant :
- Dossier :créez un nouveau dossier.
- Booléen: créez un paramètre booléen (True/False).
- Entier: créez un paramètre de nombre entier.
- Texte: créez un paramètre de texte.
- Mot de passe: créez un paramètre de mot de passe.
- Plage de périodes: créez un paramètre de plage de périodes (dates de/à).
- Dimension: créez une dimension.
- Version de montants réels: créez une version de montants réels.
- Version de plan: créez une version de plan.
- Dans le panneau de droite, saisissez des informations pour l'option que vous avez sélectionnée.
- Cliquez surAppliquer.
Vous pouvez modifier chaque paramètre individuel ou les dossiers en cliquant deux fois sur celui que vous souhaitez modifier dans le panneau gauche et en modifiant les informations des différents champs, puis en cliquant sur Appliquer pour les enregistrer.
Vous pouvez également créer des dossiers pour regrouper des paramètres, puis faire glisser les paramètres dans le dossier.
Importer des données avec une source de données par script
Après avoir configuré et enregistré votre source de données par script, vous pouvez importer des données.
Pour importer des données avec une source de données par script, procédez comme suit :
- Cliquez surImporter des donnéesdans le menu Actions. Les données sélectionnées sont filtrées par les scripts ETL, ainsi que par toutes les expressions SQL, et chargées dans la zone de stockage temporaire. Vous pouvez prévisualiser les données dans la zone de stockage temporaire.
Les informations restent dans la zone de stockage temporaire jusqu'à ce que vous les effaciez ou jusqu'à ce qu'un chargement de données ultérieur entraîne leur suppression en fonction du paramètre Mode d'import des données actif.
Pour effacer des données de la zone de stockage temporaire :
- Cliquez surEffacer les tables temporairesdans le menu Actions. La zone de stockage temporaire pour toutes les tables dans la source de données est effacée.