Saltar al contenido

Sistemas de información

Los cuatro tipos de sistema de información según a quién sirven, y la cadena que va del dato en bruto a la decisión: almacén de datos, procesos ETL, cubos OLAP y minería de datos.

Los cuatro tipos de sistema de información

Una organización no tiene un solo sistema de información, sino varios apilados. Se suelen dibujar como una pirámide porque cada uno sirve a un escalón distinto de la empresa: abajo hay muchos usuarios que registran muchísimas operaciones pequeñas, y arriba hay pocas personas que toman pocas decisiones muy grandes. Cuanto más se sube, menos volumen de datos y más resumen.

SistemaA quién sirveQué hace
TPS (Transaction Processing System)Nivel de operacionesRegistra las transacciones del día a día: una venta, un alta, un pago. Es el sistema transaccional donde nacen los datos.
MIS (Management Information System)Gerencia de operacionesEstá especializado en generar informes a partir de lo que registran los TPS. Herramienta típica: Power BI.
DSS (Decision Support System)Gerencia intermediaSistema de apoyo a las decisiones, de alcance táctico y a corto plazo. Es donde encaja el análisis OLAP.
EIS (Executive Information System)Alta direcciónEstratégico, a medio y largo plazo. Se apoya en aprendizaje automático, estadística y cuadros de mando.

La pirámide, de la cúspide a la base

EIS

  • Alta dirección: estratégico, a medio y largo plazo.

DSS

  • Gerencia intermedia: táctico, a corto plazo, con OLAP.

MIS

  • Gerencia de operaciones: informes sobre lo que registran los TPS.

TPS

  • Nivel de operaciones: el transaccional donde nacen los datos.

De abajo arriba: TPS, MIS, DSS y EIS. Táctico y a corto plazo es el DSS; estratégico y a largo plazo es el EIS.

Para el examen

  • TPS: registra las transacciones del día a día

  • MIS: informa a los mandos intermedios

  • DSS: apoya la decisión táctica, a corto plazo

  • EIS: apoya la decisión estratégica de la dirección, a largo plazo

Del dato al conocimiento: almacén, BI y minería

La parte analítica de la pirámide, es decir, el MIS y el DSS con su OLAP, no trabaja contra la base de datos donde se registran las ventas. Trabaja contra un almacén aparte, el Data Warehouse (DWH), pensado para consultar y no para dar de alta. Sobre ese almacén se monta la inteligencia de negocio.

ConceptoQué es
Data WarehouseEl almacén de datos de la organización: reúne y consolida en un mismo sitio la información que producen los sistemas transaccionales.
Business Intelligence (BI)El conjunto de técnicas y herramientas que convierten esos datos en información de alto nivel para decidir. Power BI entiende la estructura de un almacén y genera informes sobre ella.
Data MiningLa minería de datos: buscar en el almacén patrones que nadie ha pedido explícitamente, con redes neuronales, estadística o árboles de decisión.

La diferencia entre BI y minería de datos está en quién hace la pregunta. En inteligencia de negocio la pregunta la pone la persona («cuánto he vendido este trimestre por provincia»). En minería de datos el objetivo es que el propio algoritmo saque a la luz relaciones que nadie sospechaba.

Para el examen

  • Contra qué se analiza: contra el Data Warehouse, nunca contra el sistema transaccional

  • Business Intelligence: pregunta la persona

  • Data Mining: el algoritmo encuentra patrones que nadie pidió

ETL: cómo se llena el almacén

El almacén no se llena solo. Los datos llegan desde los sistemas transaccionales mediante procesos ETL, que son tres pasos en este orden:

Extract: extraer

Se saca la información de los sistemas de origen.

Transform: transformar

Se limpia y se le da un formato común: fechas unificadas, códigos corregidos, registros incompletos fuera.

Load: cargar

Los datos, ya consolidados, entran en el almacén.

La transformación es el paso que más trabajo da, porque es donde se unifican formatos de fecha, se corrigen códigos que cada sistema escribe a su manera y se descartan registros incompletos. Si esa fase falla, el almacén se llena de datos inconsistentes y todo el análisis posterior queda inservible.

Herramienta ETLEntorno
KettleEs el ETL integrado en la suite Pentaho Data Integration (PDI), del mundo Java.
SSIS (SQL Server Integration Services)Es la propuesta equivalente de Microsoft.

Extract, Transform and Load. El orden importa: primero se saca, luego se adapta y solo al final se carga.

Para el examen

  • Qué significa y en qué orden: Extract, Transform, Load

  • ETL de Pentaho: Kettle (Pentaho Data Integration)

  • ETL de Microsoft: SSIS

Análisis OLAP: el cubo, los hechos y las dimensiones

OLAP significa procesamiento analítico en línea (OnLine Analytical Processing). Su idea es organizar la información de negocio en un cubo: una estructura que resume grandes volúmenes y permite mirarlos desde varios ángulos a la vez, en lugar de recorrer fila a fila una tabla enorme.

Un cubo se apoya en dos piezas. La tabla de hechos guarda lo que se mide: el importe de cada venta, las unidades, el margen. Las tablas de dimensiones guardan los ejes por los que se quiere mirar esa medida: la fecha, la zona geográfica, el tipo de cliente o el producto. Sumarizar el cubo es hacer una foto del negocio y luego poder abrirla por cualquiera de esos ejes.

Para consultar cubos no se usa SQL sino MDX, un lenguaje con operadores propios que trata las estructuras multidimensionales como si fueran tablas. La consulta ya no pide filas y columnas planas: pide una medida cruzada con los ejes que interesan.

mdx
SELECT
  { [Measures].[Importe] } ON COLUMNS,
  { [Fecha].[Trimestre].Members } ON ROWS
FROM [VentasCubo]
WHERE ( [Cliente].[Tipo].[Mayorista] )

Los hechos son lo que se mide; las dimensiones, los ejes por los que se mira. Un cubo es una medida cruzada con varios ejes.

Para el examen

  • Tabla de hechos: guarda las medidas

  • Tablas de dimensiones: los ejes por los que se analiza

  • Lenguaje de consulta: MDX, no SQL

Las variantes de OLAP

Todas las variantes hacen análisis multidimensional; lo que cambia es dónde vive el cubo y cómo se accede a él. Las siglas se construyen siempre igual: una letra que indica la variante, más OLAP.

SiglaQué la distingue
MOLAPMultidimensional: el cubo se almacena precalculado en una estructura propia. Consulta rápida, cubo pesado.
ROLAPRelacional: no hay cubo físico, se consulta directamente contra la base de datos relacional. Escala mejor, responde más despacio.
HOLAPHíbrido: guarda precalculados los resúmenes y deja el detalle en el relacional.
WOLAPWeb: el análisis se consume desde un navegador.
RTOLAPReal Time: analiza sobre datos que llegan en tiempo real, sin esperar a una carga nocturna.
SOLAPEspacial: incorpora la dimensión geográfica.
DOLAPDe escritorio: el cubo se descarga y se explora en local.

Para el examen

  • MOLAP: guarda el cubo precalculado

  • ROLAP: consulta directamente el modelo relacional

  • HOLAP: resúmenes precalculados y detalle en relacional

Las cinco operaciones sobre un cubo

Explorar un cubo consiste en repetir cinco movimientos. Dos cambian el nivel de detalle, dos recortan el cubo y el quinto solo cambia el punto de vista.

OperaciónQué hace
Drill downBaja un nivel de detalle: se ve más detalle. Por ejemplo, del año al trimestre.
Drill upSube un nivel: se ve menos detalle, más agregado. Por ejemplo, del trimestre al año.
SliceSelecciona una dimensión y devuelve un subcubo nuevo. Es cortar una rebanada.
DiceSelecciona dos o más dimensiones a la vez y devuelve un subcubo nuevo.
PivotReorienta las dimensiones en el informe: no cambia los datos, cambia qué va en filas y qué en columnas.

La confusión típica es slice frente a dice: una dimensión es slice, dos o más es dice. Y pivot no filtra nada, solo gira la vista.

Para el examen

  • Drill down: bajar al detalle

  • Drill up (roll up): agregar

  • Slice: cortar por UNA dimensión

  • Dice: cortar por dos o más

  • Pivot: girar la vista, sin cambiar los datos