Pasos: configuración de orígenes de datos con secuencia de comandos
Los orígenes de datos con secuencias de comandos le permiten resolver situaciones hipotéticas de extracción y transformación de datos personalizadas y complejas. Puede escribir una secuencia de comandos ETL de Kettle para especificar orígenes de información de los que extraer datos y luego aplicar reglas de negocio específicas de cliente a los datos extraídos. Antes de configurar un origen de datos con secuencia de comandos, debe tener el agente de datos instalado en un servidor Windows local en la red. Consulte Concepto: agentes de datos para obtener más información.
La plataforma o las secuencias de comandos utilizadas en Kettle no se actualizan ni migran automáticamente. Si utiliza el agente de datos heredado (con Kettle 4.4), debe usar el vínculo de la sección Descargar agente heredado en la interfaz de usuario de agente de Integración. Si desea actualizar a Kettle 6, debe volver a instalar el nuevo agente de datos y la nueva versión de Kettle en un sistema que nunca antes haya tenido ninguna versión de Kettle instalada.
Los orígenes de datos con secuencia de comandos están diseñados para implementadores de ETL avanzados con experiencia en la escritura de secuencia de comandos de Pentaho Kettle y en el uso de la interfaz de usuario de Spoon. Para obtener más información sobre Pentaho Kettle y Spoon, incluida una amplia documentación y tutoriales, consulte https://docs.hitachivantara.com/p/pentaho-dia.
Para configurar un origen de datos con secuencia de comandos, haga lo siguiente:
- Acceda al Diseñador de datos enIntegración > Diseño de integraciones.
- En la carpeta Origen de datos de la Biblioteca de componentes en el lado derecho de la pantalla, haga clic enCrear nuevo origen de datos. Aparece el cuadro de diálogo Crear nuevo.
- SeleccioneOrigen de datos con secuencia de comandoscomo tipo de origen de datos e introduzca un nombre para el origen de datos.
- Haga clic enCrear. En el centro de la pantalla se mostrará la configuración del nuevo origen de datos y otra información.
- Introduzca la siguiente información del origen de datos:
- Agente asociado:seleccione el agente de la lista desplegable.
- Punto de entrada:seleccione un punto de entrada de la lista desplegable. El punto de entrada es una secuencia de comandos ETL del sistema. Puede editar esta configuración más tarde.
- Nivel de registro:seleccione un nivel de registro de la lista desplegable para especificar los detalles de registro para este origen de datos. Tiene las siguientes opciones:
- Error:solo registra errores graves.
- Información:registra toda la información básica, como el momento en que se actualiza el origen de datos.
- Detallado:proporciona información muy detallada sobre todas las fases y acciones. (Este nivel se utiliza principalmente para la depuración o la auditoría, ya que puede generar más información de registro de la que resulta práctica para el uso habitual).
- URI de origen:introduzca las URI a las que se conectarán las secuencia de comandos separadas por punto y coma (;). Este campo solo se utiliza para ayudarle a identificar y documentar los sistemas de origen subyacentes a los que se conectan sus secuencias de comandos, el software no lo utiliza para ningún otro fin.
- Haga clic enGuardaren el menú Acciones.
Inicio de Spoon
Una vez que haya guardado la información básica del origen de datos con secuencia de comandos, puede iniciar Spoon, el editor de secuencia de comandos ETL, trabajar con la secuencia de comandos y añadir tablas al origen de datos con secuencia de comandos.
Para ver y editar la secuencia de comandos, haga lo siguiente:
- En el menú Inicio de Windows, haga clic enTodos los programas.
- Abra la carpeta del agente de datos de Workday Adaptive Planning. Para las versiones de agente de datos 7.1.44 y anteriores, abra la carpeta del agente de datos de Adaptive.
- Haga clic en el editor de secuencia de comandos de Adaptive. Después de una pantalla de bienvenida de Pentaho y una sugerencia de inicio, aparece la pantalla de Spoon.
- Introduzca suAdaptive Planningel correo electrónico y la contraseña de inicio de sesión y haga clic enIniciar sesión ahora/Actualizar lista de entorno de cliente. Si ha sincronizado usuarios de Workday, consulte Inicio de sesión en el agente de datos y el editor de secuencia de comandos con credenciales de Workday.
- Seleccione el entorno de cliente en el menú desplegable. Por lo general, solo hay un entorno de cliente. Spoon actualizará la lista de entornos de cliente.
- Seleccione el agente que está utilizando para este origen de datos en la lista desplegable. Spoon actualizará la lista de agentes.
- Seleccione el origen de datos con secuencia de comandos que acaba de crear en el menú desplegable de edición de secuencia de comandos.
Una vez que ha iniciado sesión y le ha indicado a Spoon el agente y origen de datos en los que está trabajando, puede comenzar a editar la secuencia de comandos.
- Haga clic en Data Integration, en la esquina superior derecha de la pantalla de Spoon. Aparece la perspectiva de integración de Spoon.
- SeleccioneFile > Open, busque la secuencia de comandos que desea ver y editar, y haga clic enOK. Las muestra de secuencias de comandos del origen de datos con secuencia de comandos incluidas con Integración proporcionan información sobre la estructura de la secuencia de comandos, así como sobre las conexiones a bases de datos que pueden serle útiles a la hora de desarrollar sus propias secuencias de comandos.
- Edite la secuencia de comandos según corresponda y guárdela.
- Haga clic en Adaptive en la parte superior derecha para volver a la perspectiva de Adaptive. Volverá a aparecer la pantalla de Spoon.
- Haga clic enPublish Agent Changes. Esto vuelve a enviar la secuencia de comandos a laAdaptive Planningservidor, donde se almacena en el repositorio de secuencias de comandos.
Se admiten los siguientes modos de importación de datos. La configuración puede variar según la tabla.
- Se sustituyen todos los registros cada vez que se importan los datos.
- El agente remoto escanea todos los registros de origen y transmite los registros modificados cada vez que se deben sincronizar los datos.
- Se transmiten todos los registros incluidos en un rango de periodo.
Introducción de tablas y columnas en un origen de datos con secuencia de comandos
Con la secuencia de comandos implementada, puede añadir tablas y columnas a su origen de datos en la Integración.
Es esencial que las columnas definidas en el origen de datos coincidan exactamente con las columnas definidas en la secuencia de comandos ETL; de lo contrario, la carga de datos dará error.
Para añadir tablas a un origen de datos con secuencia de comandos, siga estos pasos:
- Expanda la entrada Tabla personalizada en el menú Componentes de datos.
- Arrastre y suelte el elementoTabla con secuencia de comandosen la zona Tablas para importar. Cuando suelte el elemento, aparecerá el cuadro de diálogo Tablas con secuencia de comandos.
- Introduzca la configuración de tabla:
- Nombre:introduzca el nombre de la tabla.
- Modo de importación de datos:seleccione uno de los modos de importación:
- Todos los registros se sustituyen cada vez que se ejecuta una importación de datos:este es el valor por defecto. Siempre que importe datos, se sustituirán todos los registros de la zona de almacenamiento provisional.
- Remote cache used to identify and send changed records on import:la integración examina la zona de almacenamiento provisional y la compara con los registros de la hoja de cálculo o base de datos, e importa solo los registros modificados.
- Se han transmitido todos los registros incluidos en un rango de periodo:cuando selecciona este modo, se le solicitará que introduzca un rango de periodo y una columna a la que se aplicará el rango en la integración. Se importarán todos los registros que cumplan este criterio de selección.
- Filtro de importación de datos:utilice esta opción para introducir una expresión SQL que filtre o aplique formato a la información que se va a importar. El filtro SQL se aplica antes de extraer los datos de la base de datos para reducir la cantidad de datos que hay que importar, lo que le proporciona un nivel adicional de control de los datos que se van a introducir en la zona de almacenamiento provisional. Haga clic en el campo para que aparezca el cuadro de diálogo Editar filtro SQL, descrito anteriormente. (El filtro que introduzca aquí se aplicará a los datos reales de la base de datos y no a los datos de vista previa de la zona de almacenamiento provisional).
- Haga clic enAplicarpara aplicar la configuración.
Para añadir columnas a un origen de datos con secuencia de comandos, siga estos pasos:
- Expanda la entrada Columna personalizada del menú Componentes de datos.
- Arrastre y suelte uno de los tipos de columna en la zona Tablas para importar. Al soltar el elemento, aparece el cuadro de diálogo Columnas personalizadas.
- Introduzca la siguiente configuración para las columnas:
- Nombre:introduzca el nombre de la columna. Los nombres de las columnas deben coincidir exactamente con los que se especifican en la secuencia de comandos de Spoon, incluidas las mayúsculas y los espacios insertados.
- Tipo de columna:un campo de solo visualización que identifica el tipo de columna.
- Convertir tipo de columna:no puede cambiar este valor excepto en las columnas SQL. En las columnas SQL, puede seleccionar cualquiera de las seis opciones de conversión.
- Haga clic enAplicarpara aplicar la configuración.
Gestión de columnas
Si la tabla con la que está trabajando tiene un gran número de columnas, puede usar Gestionar columnas para editar rápidamente las columnas que desea importar. El cuadro de diálogo Gestionar columnas muestra las columnas de una tabla para que pueda marcarlas o desmarcarlas para la importación.
Para gestionar columnas para la importación, siga estos pasos:
- Haga clic en la flecha de la ficha situada a la derecha del nombre de la tabla. Aparece un menú flotante con varias opciones.
- Haga clic enGestionar columnasen el menú flotante. Aparece el cuadro de diálogo Gestionar columnas.
- Marque la casilla que está junto a la columna para importarla. Cuando marca una columna, la columna también aparece en la ventana de vista previa después de que se guarde el contenido de la ventana emergente. Al desmarcar una columna, se elimina de la ventana de vista previa. No puede cambiar el estado de importación en campos generados por el sistema comoisDeleted. También puede cambiar el estado de importación en columnas individuales seleccionando las propiedades de columna y estableciendo la propiedad o arrastrando y soltando las columnas en el diseñador.
Personalización de tablas
Puede personalizar la forma en la que se importan los datos en cada tabla.
Para personalizar la configuración de la tabla, siga estos pasos:
- Haga clic en la flecha de la ficha situada a la derecha del nombre de la tabla. Aparece un menú flotante con varias opciones.
- Haga clic enConfiguración de tablaen el menú flotante.
- Haga clic enAplicarpara aplicar la configuración.
- Repita los pasos 1 a 3 con cada tabla.
- Haga clic enGuardarpara guardar la configuración en el origen de datos.
Configuración de opciones de columna
Cuando usa la sección Tablas para importar, aparece una vista previa de los datos tal y como están en el origen de datos o en la zona de almacenamiento provisional después de haberlos importado. Puede cambiar las opciones de cada columna colocando el puntero sobre la cabecera de la columna y luego haciendo clic en el menú desplegable junto al nombre. Las opciones son las siguientes:
- Orden ascendente:ordene toda la tabla en función de esta columna en orden ascendente.
- Orden descendente:ordene toda la tabla en función de esta columna en orden descendente.
- Configuración de columnas:este cuadro de diálogo se utiliza para cambiar las propiedades de la columna dentro de la tabla de almacenamiento provisional.
- Nombre:el nombre de la columna que se muestra en la cabecera.
- Tipo de columna:el tipo de datos utilizados en la columna.
- Convertir tipo de columna:seleccione el nuevo tipo en este menú desplegable.
- Excluir columna de la importación:seleccione esta opción para eliminar esta columna de los datos que se están importando.
- Eliminar columna personalizada:seleccione esta opción para eliminar la columna. (Disponible solo para columnas personalizadas).
Descarga de datos de una tabla de almacenamiento provisional
Puede descargar datos de una sola tabla de almacenamiento provisional.
Para descargar datos de una sola tabla de almacenamiento provisional, siga estos pasos:
- Haga clic en la flecha situada bajo la cabecera de la tabla en la sección Tablas para importar.
- SeleccioneDescargar datos.
- En la lista de valoresEsta operación enviará un correo electrónico con una URL para descargar los datos, haga clic enEnviar.Adaptive Planningenvía un correo electrónico que contiene una URL a la cuenta de correo electrónico asociada al diseñador de datos.
- Abra el correo electrónico y haga clic en la URL. Los datos se descargan en formato .csv.
Uso del filtro avanzado
Bajo el menú desplegable Origen, puede hacer clic en
Filtro avanzado
para que aparezcan las opciones de filtrado de datos en el área de vista previa Tablas para importar
. El filtro avanzado proporciona herramientas para ver y explorar un subconjunto de los datos dentro de una tabla de almacenamiento provisional o desde la secuencia de comandos. (Cuando selecciona una secuencia de comandos en el menú desplegable Origen, se envía al agente la solicitud de vista previa para su procesamiento). Al cambiar las propiedades de filtro, puede cambiar la vista de los datos que se muestran en la ventana de vista previa sin cambiar los datos en la zona de almacenamiento provisional.El área de vista previa está diseñada específicamente para obtener una vista previa de una pequeña parte de los datos de la zona de almacenamiento provisional. Puede explorar los datos que están disponibles en la hoja de cálculo y verificar que está obteniendo los datos que espera examinando la zona de almacenamiento provisional. (Los filtros definidos en la función de vista previa no afectan a los datos reales de la zona de almacenamiento provisional).
Las opciones disponibles para el filtro avanzado son las siguientes:
- Filas distintas: marque esta casilla para ocultar las filas duplicadas.
- Máximo de filas: limite el número de filas que se muestran en el área de vista previa introduciendo un número en el cuadro de texto.
- Columnas: marque o desmarque las columnas en este menú desplegable para mostrar u ocultar las columnas que aparecen.
Al eliminar una columna de esta lista, no se elimina la columna de la lista de importación.
- Filtro SQL: haga clic en el cuadro de texto grande para que aparezca el cuadro de diálogo Editar filtro SQL (descrito anteriormente), donde podrá introducir un filtro SQL para restringir las filas que se previsualizan. Haga clic enAplicarpara comprobar automáticamente la sintaxis SQL del filtro. (Si hay algún error, se indica en la expresión). Para obtener ayuda detallada sobre la sintaxis SQL, puede hacer clic en la ayuda en línea de la sección Notas.
Haga clic en
Eliminar filtro
(junto al menú desplegable Origen) para borrar toda la configuración de filtros avanzados.Como parte del proceso de personalización de la tabla, también puede crear tablas combinadas y columnas personalizadas mediante expresiones SQL.
Introducción y edición de parámetros
Puede usar parámetros para pasar información a la secuencia de comandos de Kettle subyacente. Estos parámetros se pueden definir con un valor por defecto. La secuencia de comandos puede usar los parámetros para controlar las transformaciones y el filtrado en las secuencias de comandos ETL.
Para añadir un parámetro, haga lo siguiente:
- Haga clic en el iconoEditar parámetrosa la derecha de la cabecera Parámetros. Aparecerá el cuadro de diálogo Editor de parámetros.
- Haga clic en la carpeta del panel izquierdo a la que desea añadir un parámetro. El nombre de la carpeta aparece en el panel derecho.
- Haga clic enAñadiry seleccione una de las siguientes opciones en el menú flotante:
- Carpeta:crea una nueva carpeta.
- Booleano: crea un parámetro booleano (verdadero/falso).
- Entero: crea un parámetro de valor entero.
- Texto: crea un parámetro de texto.
- Contraseña: crea un parámetro de contraseña.
- Rango de periodo: crea un parámetro de rango de periodo (fechas inicial y final).
- Dimensión: crea una dimensión.
- Versión de cifras reales: crea una versión de cifras reales.
- Versión de plan: crea una versión de plan.
- En el panel derecho, introduzca la información de la opción que ha seleccionado.
- Haga clic enAplicar.
Puede editar las carpetas o parámetros individuales haciendo doble clic en el elemento que desea editar en el panel izquierdo y realizando los cambios en la información de los campos. A continuación, haga clic en Aplicar para guardar los cambios.
También puede crear carpetas para agrupar parámetros y luego arrastrarlos a la carpeta.
Importación de datos con un origen de datos con secuencia de comandos
Una vez que haya configurado y guardado el origen de datos con secuencia de comandos, podrá importar datos.
Para importar datos con un origen de datos con secuencia de comandos, haga lo siguiente:
- Haga clic enImportar datosen el menú Acciones. Los datos seleccionados se filtran mediante las secuencias de comandos ETL, así como cualquier expresión SQL, y se cargan en la zona de almacenamiento provisional. Puede obtener una vista previa de los datos de la zona de almacenamiento provisional.
La información permanece en la zona de almacenamiento provisional hasta que la borre o hasta que una carga de datos posterior haga que se borre según la configuración activa del modo de importación de datos.
Para borrar datos de la zona de almacenamiento provisional, haga lo siguiente:
- Haga clic enBorrar tablas de almacenamiento provisionalen el menú Acciones. Se borra el contenido de la zona de almacenamiento provisional de todas las tablas del origen de datos.