Mostrando entradas con la etiqueta qualitystage. Mostrar todas las entradas
Mostrando entradas con la etiqueta qualitystage. Mostrar todas las entradas

miércoles, 2 de julio de 2014

What’s new in IBM InfoSphere Information Server v11.3


Si v11.3, parece que se saltearon la v10. Esto se debe a que IBM busca la sincronización de las versiones de los productos de la suite de Governance, entre ellos InfoSphere Information Server (InfoSphere MDM también sacó su v11.3).
Dejando de lado la cuestión de números, les cuento que el 24/6 anunciaron la liberación al mercado de la versión 11.3 de InfoSphere Information Server.
A continuación les hago un resumen de las nuevas características más relevantes según mi opinión. Igualmente les dejo dos links con información complementaria, uno más resumido y otro más detallado sobre las nuevas características de esta nueva versión:
 Mejoras generales de la suite:
  • Single sign-on para todos los clientes del tipo Web
  • Opción de instalar WebSphere Application Server Liberty Profile, una versión mucho más liviana, más rápida de instalar y más fácil de mantener que la versión clásica de WAS y que WAS ND por supuesto
  • Opción de implementar InfoSphere Information Server en la nube
Nuevo producto: InfoSphere Information Governance Catalog (InfoSphere Business Glossary, InfoSphere Business Glossary Anywhere e InfoSphere Metadata Workbench consolidados)
  • Mejor visualización de los reportes de linaje de datos debido a cambios en la arquitectura y a un nuevo visualizador (no requiere Adobe Flash Player). También se pueden ver desde iPhones, iPads y otros dispositivos móviles
  • Mejoras en el workflow de creación, aprobación y publicación del glosario de negocio
  • Copia automática al repositorio de metadatos de la metadata operacional  generada por la ejecución de procesos InfoSphere DataStage e InfoSpehre QualityStage
Mejoras en InfoSphere Information Governance Dashboard
  • Vistas SQL, reportes y dashboards de Cognos incluidos durante la instalación
  • Documentación completa de los objetos que se pueden consultar en el repositorio de metadatos
Mejoras en InfoSphere DataStage e InfoSphere QualityStage:
  • Soporte a REST webservices using HTTP (usando el Hierarchical Data stage)
  • Mejoras en la performance del Sort stage
  • Escritura de archivos Microsoft Excel (usando el Unstructured Data stage)
Mejoras en InfoSphere Information Analyzer:
  • Mejoras en la performance del análisis de múltiples columnas para clave primaria, de la ejecución de reglas de datos, del análisis de columnas y de la interfaz de usuario
  • Soporte a fuentes de datos Netezza y Hive
Mejoras en Data Quality Console:
  • Soporte a los registros “Clericals” generados en los procesos de “Match” para facilitar su gestión a través de la consola

lunes, 7 de enero de 2013

What’s new in IBM InfoSphere Information Server 9.1

Como ya algunos sabran el ultimo 15 de diciembre se liberó al mercado la version 9.1 de la plataforma de integracion de datos IBM InfoSphere Information Server. La liberación se produjo en simultaneo para todas las plataformas soportadas.

A continuación les dejo un link a un PDF con información detallada sobre esta nueva version.

http://www-01.ibm.com/software/data/integration/info_server/v91.html

jueves, 29 de septiembre de 2011

Information Server Workgroup Edition 8.5

En un mundo cada vez más inteligente como en el que nos movemos, en donde existen más y más instrumentos interconectados a través de la Web y por lo menos con algo de inteligencia, es imposible no estar relacionado con la cantidad de datos que estos instrumentos producen a cada instante.

Las organizaciones y empresas de cualquier segmento del mercado no son ajenas a esta explosión de  información (grandes organizaciones como pequeñas y medianas empresas), más aun cuando existe un claro reconocimiento de la importancia de convertir todos estos datos en activos valiosos de información para la toma de decisiones estratégicas. Sin embargo, y a pesar de esta importancia, también reconocen que no cuentan con las herramientas que les permitan alcanzar y desarrollar esta madurez en sus sistemas tecnológicos para la integración de datos.

Es aquí donde IBM por medio de su ya reconocida plataforma para la integración de datos: IBM Infosphere Information Server lanzó en el primer semestre de este año una nueva edición dirigida a los clientes del mercado medio que buscan las funcionalidades y características (descubrimiento y análisis, limpieza, transformación y entrega de datos) de una plataforma de integración de datos a un precio asequible.

IBM InfoSphere Information Server Workgroup Edition V8.5 ofrece una plataforma completa de integración de datos diseñada para cubrir de forma flexible los requisitos específicos de los clientes al tiempo que ayuda a dichos clientes a alcanzar nuevos y mejorados niveles de integración.

IBM InfoSphere Information Server Workgroup Edition V8.5:

  • Ofrece opciones avanzadas de integración de datos, con una solución diseñada específicamente para las necesidades de implementacion pequeñas a un precio excelente.
  • Permite que los clientes que comienzan con InfoSphere Information Server Workgroup Edition  escalen hasta el producto correspondiente de IBM InfoSphere Information Server V8.5 en cualquier momento.
Los siguientes componentes del producto están disponibles como parte de InfoSphere Information Server Workgroup Edition V8.5 para ayudar a los clientes a comprender, transformar, limpiar y proporcionar información en sus propios entornos: 

  • IBM InfoSphere DataStage Workgroup Edition
  • IBM InfoSphere QualityStage Workgroup Edition
  • IBM InfoSphere DataStage and QualityStage Designer Workgroup Edition
  • IBM InfoSphere Information Analyzer Workgroup Edition
  • IBM InfoSphere Information Analyzer Workbench Workgroup Edition
  • IBM InfoSphere Metadata Workbench Workgroup Edition
  • IBM InfoSphere FastTrack Workgroup Edition
  • IBM InfoSphere Discovery Workgroup Edition 
Para mas información:
http://www-01.ibm.com/software/data/infosphere/info-server/workgroup/

viernes, 11 de marzo de 2011

Desayuno What's New in InfoSphere DataStage 8.5

Estamos organizando un desayuno en las oficinas de Focus para el 22 de marzo de 9 a 13hs.

La idea es presentar las nuevas funcionalidades de DataStage & QualityStage 8.5, así como también, las nuevas funcionalidades de la plataforma Information Server relacionadas con el manejo de metadatos y con nuevas herramientas que están disponibles en esta nueva versión.

Además vamos a presentar como un cliente debería encarar un proyecto de migración, incluyendo los pasos a seguir y haciendo especial enfásis a las migraciones de versión 7.5.x a 8.5 donde hubo cambios de arquitectura de la plataforma.

Pueden anotarse mandar un mail a
eventos@focusbs.com (Asunto: Desayuno What's New in DataStage 8.5)

Los esperamos!

martes, 15 de febrero de 2011

El Proceso de Matching: Características y Particularidades

Cuando se utiliza una herramienta de calidad de datos, usualmente se utilizan algoritmos y reglas de matching que nos permiten determinar si dos o más registros son o no un match. 

Esto es usualmente útil cuando necesitamos determinar clientes, productos, personas duplicadas o personas, clientes que compartan por ejemplo el mismo domicilio. 

Con una búsqueda por igual, tal cual podemos ejecutar en una herramienta de ETL o sobre cualquier motor de base de datos no vamos a poder alcanzar el nivel de exactitud y certeza que necesitamos ya que usualmente nos encontraremos con nombres y apellidos de personas mal escritos, errores de tipeo, diferentes formas de escribir una dirección. Esto hace que la búsqueda por igual no sirva para resolver esta problematica.

Es en este punto donde los algoritmos probabilísticos son realmente útiles. Estos algoritmos permiten elevar el grado de exactitud en el matching y permiten ponderar con pesos (positivos y negativos) los errores enunciados anteriormente, pudiéndose determinar si dos o más registros son los mismos.

Pero no todo es tan sencillo como suena ya que hay un conjunto de condiciones que hay que manejar y que son un desafío importante para quien desarrolla una regla de matching.

Las distintas herramientas de calidad difieren en como asignan los pesos para determinar si dos o más registros son o no un match pero en general hay tres resultados posibles en este proceso:
  • Registros sin Relación (llamados Residuales en QualityStage)
  • Match
  • Sospechoso (llamados Clericals en QualityStage)
En términos generales si la suma de los pesos generados al comparar dos registros son positivos esto es un Match, por lo contrario, si los pesos son cero o negativos es un Residual.

Ahora bien… ¿y cuando se generan registros Sospechosos o Clericals?

Para ser más estricto y complicar un poco el tema, no siempre que se genere un peso positivo va indicar que dos  registros son un match. Hay veces que el peso es muy cercado a cero y difiere mucho de la media de los pesos de los registros que si son efectivamente un match. Es en estos casos donde es posible configurar la herramienta para modificar el comportamiento default de la misma y tratar a esos registros como Sospechosos o directamente Residuales (No Match).

Este proceso es un proceso iterativo que requiere mucho de prueba y ajuste de la regla de matching para evitar errores en el proceso o lo que se conoce como falsos positivos y falsos negativos, es decir registros que dieron Match pero no lo son o registros que no dieron Match pero si lo son.

Las herramientas de calidad de datos brindan interfases para ayudar a “tunear” la regla para hacerla más exacta y eficiente.

A continuación se ve la interfaz del Match Designer de QualityStage desde donde podemos definir la regla de match así como probarla, ajustarla y definir los umbrales de No Match, Clerical y Match.

 
De lo anteriormente explicado, queda claro que todo proceso de matching se va a componer de registros que serán procesados automáticamente (Match y Residuales) y también registros que requerirán un tratamiento manual. Tal es el caso de los Clericals o Sospechosos.

Para estos registros la herramienta no ha podido determinar automáticamente si son o no un  match y es por ello que requiere revisión manual.

En este punto el desafío mas importante para el diseñador y desarrollador de la regla es  ajustar la misma lo más posible para limitar la cantidad de sospechosos pero teniendo en cuenta de no cometer errores de matching (falsos positivos y negativos). Otro punto muy importante a tener en cuenta es definir claramente un procedimiento para el tratamiento de estos registros sospechosos.

Muchas de las herramientas también brindan funcionalidades que permiten analizar y procesar manualmente, de una manera sencilla, estos registros a fin de que luego se conviertan definitivamente en un Match o no.