Passer au contenu principal
Administrator Guide
Dernière mise à jour : 2023-06-23
Convertir du texte en version XML avec un fichier de schéma de texte

Convertir du texte en version XML avec un fichier de schéma de texte

Créez un assemblage contenant une étape
textschema
. Obtenez l’exemple de texte qui constituera la base de votre schéma de texte.
L’étape
textschema
vous permet de convertir du texte en version XML à l’aide d’un schéma de texte. Pour développer un schéma de texte, vous devez connaître la structure des données que vous souhaitez transformer. Le processus est considérablement simplifié grâce à un petit exemple de document contenant des données représentatives. Cette rubrique suppose que vous avez un tel exemple.
Vous pouvez utiliser l’étape
textschema
pour convertir la version XML en texte ou pour transformer des fichiers délimités, mais dans la plupart des cas, il est plus simple d’utiliser l’étape
XTT
et l’étape
csv-to-xml
, respectivement.
  1. Dans la vue
    Properties
    de l’étape
    textschema
    , cliquez sur
    Create Text Schema File
    .
  2. Sélectionnez un dossier parent pour le fichier de schéma de texte et entrez un nom de fichier. Si nécessaire, indiquez l’URI de l’espace de noms cible.
  3. Studio ouvre l’éditeur de schéma de texte et affiche le nouveau schéma de texte dans son
    arborescence
    .
  4. Coupez et collez votre exemple de texte dans la zone supérieure droite de l’éditeur de schéma de texte, en le remplaçant par
    initial-text
    .
    Pour retirer le saut de ligne de fin d'emploi des fichiers d'entrée, ajoutez cet attribut à l'élément de schéma racine :
    ts:eofStrip="
"
    .
  5. Commencez à décrire l’exemple de texte. Sélectionnez le premier champ, puis cliquez sur celui-ci avec le bouton droit de la souris et sélectionnez
    Create Field
    .
    Si vous ne disposez pas d’un échantillon du texte à convertir mais que vous en connaissez la structure, vous pouvez modifier directement la vue
    Source
    du schéma de texte.
  6. Dans la page
    Identity
    du
    Create Field Wizard
    , fournissez une description de base du champ. Pour la tâche, tenez compte des éléments suivants :
    Option Description
    Nom
    Un nom pour le champ.
    Occurrence
    Les options sont les suivantes :
    • Default
       : le champ est obligatoire et n’apparaît qu’une seule fois.
    • Required
       : identique à la valeur par défaut.
    • Optional
       : le champ est facultatif et ne peut apparaître qu’une seule fois.
    • Multiple Optional
       : le champ est facultatif et peut apparaître plusieurs fois.
    • Multiple Required
       : le champ est obligatoire et peut apparaître plusieurs fois.
    Start Tag
    Une expression rationnelle qui définit le texte à l’origine de la génération d’un élément. Notez que le texte correspondant à cette expression ne fait pas partie de la valeur de sortie. Si vous voulez que le texte mis en correspondance soit affiché dans la valeur de sortie, utilisez la fonction
    ts:format
    option.
    Marqueur de fin
    Une expression rationnelle qui définit le texte marquant la fin d’un élément. Notez que le texte correspondant à cette expression ne fait pas partie de la valeur de sortie. Si vous voulez que le texte mis en correspondance soit affiché dans la valeur de sortie, utilisez la fonction
    ts:format
    option.
    Tronquer
    Indique s’il faut tronquer les données en dépassement dans un champ de longueur fixe ou lancer une erreur. La valeur par défaut est
    true
    .
    Séparateur
    Une expression rationnelle qui définit le caractère qui sépare les champs répétés. Activée uniquement si vous sélectionnez les options d’occurrence
    Multiple Optional
    ou
    Multiple Required
    .
    Omit
    Indique s’il faut omettre le champ de la sortie dans une transformation
    text-to-XML
    ou
    XML-to-text
    . La valeur par défaut est no omission.
  7. Dans la page
    Delimit
    de
    Create Field Wizard
    , décrivez le nombre de caractères de l’exemple de texte qui représentent un champ :
    Option Description
    Format
    Une expression rationnelle qui désigne des modèles de texte valides pour un champ. Utilisez cette expression comme alternative à
    Start Tag
    et
    End Tag
    pour vous assurer que tout le texte correspondant s’affiche dans la sortie. Vous pouvez également l’utiliser lorsque vous traitez des valeurs à occurrences multiples, de manière à ce que la fin de la séquence soit claire.
    Fixed Length
    Indique la longueur des champs de longueur fixe. Inclut les guillemets et les caractères d’échappement.
    Quoted
    Indique si les valeurs des chaînes sont traitées comme des chaînes entre guillemets. Les options sont les suivantes :
    • Default
       :
    • always
       :
    • always-including-empty
       :
    • optional
       :
    • never
       :
    Padding
    Une expression rationnelle qui identifie tout texte de remplissage dans les champs de longueur fixe.
    Preferred Padding
    Indique la valeur à utiliser si l’expression de
    Padding
    peut correspondre à plus d’une (1) chaîne possible.
    Align
    Indique l’alignement des champs de longueur fixe qui nécessitent un remplissage.
  8. Dans la page
    Interpret
    du
    Create Field Wizard
    , décrivez le nombre de caractères de l’exemple de texte qui représentent un champ :
    Option Description
    Type
    Le type de données du champ.
    Valeur par défaut
    Une valeur par défaut pour le champ.
    Date Format
    Indique un modèle pour les dates ou les dates et les heures. Prend en charge tous les modèles autorisés par Java
    SimpleDateFormat
    .
    Date et langue
    Indique la langue de la date à utiliser lors de l’interprétation des dates. Assure que le nom est traité dans la langue appropriée lorsque le format de date utilise les noms de mois. La valeur par défaut est
    EN
    .
    Année à deux chiffres
    Indique une valeur pour interpréter les dates d’une année à deux (2) chiffres. L’analyseur du schéma de texte interprète les dates d’année à 2 chiffres antérieures à cette valeur comme étant dans le siége actuel. Exemple : si vous entrez
    18
    , l'analyseur interprète
    14
    en tant que
    2014
    et
    96
    en tant que
    1996
    .
    Format de nombre
    Indique un modèle pour les nombres. Prend en charge tous les modèles autorisés par Java
    DecimalFormat
    .
    Signe décimal
    Indique le séparateur utilisé pour les nombres décimaux.
    Grouping Separator
    Indique le séparateur des groupes de milliers pour les nombres.
  9. Répétez les étapes 6 à 9 pour chaque champ de l’exemple de texte, en ajoutant de nouveaux éléments dans l’
    arborescence
    . Quand vous avez créé toutes les définitions de champs obligatoires, supprimez les définitions restantes.
    Unparsed
    élément enfant.
  10. Pour envelopper tous les éléments que vous avez créés dans un type complexe, sélectionnez-les, cliquez avec le bouton droit de la souris, puis sélectionnez
    Éléments d’enveloppement
    . Fournissez ensuite un nom et une valeur d’occurrence pour l’élément de regroupement.
  11. Dans la vue
    des propriétés
    de l’élément d’enveloppe, sélectionnez
    /n
    dans la liste déroulante
    Marqueur de fin
    .
  12. L'élément racine du schéma par défaut est nommé
    File
    . Dans l’onglet
    Schéma
    de la vue
    des propriétés
    de l’élément, fournissez un nom plus significatif.
  13. Dans la vue
    des propriétés
    du niveau supérieur
    schema
    élément, la propriété
    Élément racine
    a la valeur
    tns:File
    . Remplacer
    File
    avec le nom significatif que vous avez sélectionné pour l'élément racine.
  14. Pour retirer des espaces supplémentaires de la sortie générée, sélectionnez la vue
    Propriétés
    du niveau supérieur.
    schema
    élément. Sélectionnez
    +
    dans la liste déroulante
    Remplissage
    . Enregistrez le schéma.