Sistemas de información
Los cuatro tipos de sistema de información según a quién sirven, y la cadena que va del dato en bruto a la decisión: almacén de datos, procesos ETL, cubos OLAP y minería de datos.
Los cuatro tipos de sistema de información
Una organización no tiene un solo sistema de información, sino varios apilados. Se suelen dibujar como una pirámide porque cada uno sirve a un escalón distinto de la empresa: abajo hay muchos usuarios que registran muchísimas operaciones pequeñas, y arriba hay pocas personas que toman pocas decisiones muy grandes. Cuanto más se sube, menos volumen de datos y más resumen.
| Sistema | A quién sirve | Qué hace |
|---|---|---|
| TPS (Transaction Processing System) | Nivel de operaciones | Registra las transacciones del día a día: una venta, un alta, un pago. Es el sistema transaccional donde nacen los datos. |
| MIS (Management Information System) | Gerencia de operaciones | Está especializado en generar informes a partir de lo que registran los TPS. Herramienta típica: Power BI. |
| DSS (Decision Support System) | Gerencia intermedia | Sistema de apoyo a las decisiones, de alcance táctico y a corto plazo. Es donde encaja el análisis OLAP. |
| EIS (Executive Information System) | Alta dirección | Estratégico, a medio y largo plazo. Se apoya en aprendizaje automático, estadística y cuadros de mando. |
La pirámide, de la cúspide a la base
EIS
- Alta dirección: estratégico, a medio y largo plazo.
DSS
- Gerencia intermedia: táctico, a corto plazo, con OLAP.
MIS
- Gerencia de operaciones: informes sobre lo que registran los TPS.
TPS
- Nivel de operaciones: el transaccional donde nacen los datos.
De abajo arriba: TPS, MIS, DSS y EIS. Táctico y a corto plazo es el DSS; estratégico y a largo plazo es el EIS.
Para el examen
TPS: registra las transacciones del día a día
MIS: informa a los mandos intermedios
DSS: apoya la decisión táctica, a corto plazo
EIS: apoya la decisión estratégica de la dirección, a largo plazo
Del dato al conocimiento: almacén, BI y minería
La parte analítica de la pirámide, es decir, el MIS y el DSS con su OLAP, no trabaja contra la base de datos donde se registran las ventas. Trabaja contra un almacén aparte, el Data Warehouse (DWH), pensado para consultar y no para dar de alta. Sobre ese almacén se monta la inteligencia de negocio.
| Concepto | Qué es |
|---|---|
| Data Warehouse | El almacén de datos de la organización: reúne y consolida en un mismo sitio la información que producen los sistemas transaccionales. |
| Business Intelligence (BI) | El conjunto de técnicas y herramientas que convierten esos datos en información de alto nivel para decidir. Power BI entiende la estructura de un almacén y genera informes sobre ella. |
| Data Mining | La minería de datos: buscar en el almacén patrones que nadie ha pedido explícitamente, con redes neuronales, estadística o árboles de decisión. |
La diferencia entre BI y minería de datos está en quién hace la pregunta. En inteligencia de negocio la pregunta la pone la persona («cuánto he vendido este trimestre por provincia»). En minería de datos el objetivo es que el propio algoritmo saque a la luz relaciones que nadie sospechaba.
Para el examen
Contra qué se analiza: contra el Data Warehouse, nunca contra el sistema transaccional
Business Intelligence: pregunta la persona
Data Mining: el algoritmo encuentra patrones que nadie pidió
ETL: cómo se llena el almacén
El almacén no se llena solo. Los datos llegan desde los sistemas transaccionales mediante procesos ETL, que son tres pasos en este orden:
Extract: extraer
Se saca la información de los sistemas de origen.
Transform: transformar
Se limpia y se le da un formato común: fechas unificadas, códigos corregidos, registros incompletos fuera.
Load: cargar
Los datos, ya consolidados, entran en el almacén.
La transformación es el paso que más trabajo da, porque es donde se unifican formatos de fecha, se corrigen códigos que cada sistema escribe a su manera y se descartan registros incompletos. Si esa fase falla, el almacén se llena de datos inconsistentes y todo el análisis posterior queda inservible.
| Herramienta ETL | Entorno |
|---|---|
| Kettle | Es el ETL integrado en la suite Pentaho Data Integration (PDI), del mundo Java. |
| SSIS (SQL Server Integration Services) | Es la propuesta equivalente de Microsoft. |
Extract, Transform and Load. El orden importa: primero se saca, luego se adapta y solo al final se carga.
Para el examen
Qué significa y en qué orden: Extract, Transform, Load
ETL de Pentaho: Kettle (Pentaho Data Integration)
ETL de Microsoft: SSIS
Análisis OLAP: el cubo, los hechos y las dimensiones
OLAP significa procesamiento analítico en línea (OnLine Analytical Processing). Su idea es organizar la información de negocio en un cubo: una estructura que resume grandes volúmenes y permite mirarlos desde varios ángulos a la vez, en lugar de recorrer fila a fila una tabla enorme.
Un cubo se apoya en dos piezas. La tabla de hechos guarda lo que se mide: el importe de cada venta, las unidades, el margen. Las tablas de dimensiones guardan los ejes por los que se quiere mirar esa medida: la fecha, la zona geográfica, el tipo de cliente o el producto. Sumarizar el cubo es hacer una foto del negocio y luego poder abrirla por cualquiera de esos ejes.
Para consultar cubos no se usa SQL sino MDX, un lenguaje con operadores propios que trata las estructuras multidimensionales como si fueran tablas. La consulta ya no pide filas y columnas planas: pide una medida cruzada con los ejes que interesan.
SELECT
{ [Measures].[Importe] } ON COLUMNS,
{ [Fecha].[Trimestre].Members } ON ROWS
FROM [VentasCubo]
WHERE ( [Cliente].[Tipo].[Mayorista] )Los hechos son lo que se mide; las dimensiones, los ejes por los que se mira. Un cubo es una medida cruzada con varios ejes.
Para el examen
Tabla de hechos: guarda las medidas
Tablas de dimensiones: los ejes por los que se analiza
Lenguaje de consulta: MDX, no SQL
Las variantes de OLAP
Todas las variantes hacen análisis multidimensional; lo que cambia es dónde vive el cubo y cómo se accede a él. Las siglas se construyen siempre igual: una letra que indica la variante, más OLAP.
| Sigla | Qué la distingue |
|---|---|
| MOLAP | Multidimensional: el cubo se almacena precalculado en una estructura propia. Consulta rápida, cubo pesado. |
| ROLAP | Relacional: no hay cubo físico, se consulta directamente contra la base de datos relacional. Escala mejor, responde más despacio. |
| HOLAP | Híbrido: guarda precalculados los resúmenes y deja el detalle en el relacional. |
| WOLAP | Web: el análisis se consume desde un navegador. |
| RTOLAP | Real Time: analiza sobre datos que llegan en tiempo real, sin esperar a una carga nocturna. |
| SOLAP | Espacial: incorpora la dimensión geográfica. |
| DOLAP | De escritorio: el cubo se descarga y se explora en local. |
Para el examen
MOLAP: guarda el cubo precalculado
ROLAP: consulta directamente el modelo relacional
HOLAP: resúmenes precalculados y detalle en relacional
Las cinco operaciones sobre un cubo
Explorar un cubo consiste en repetir cinco movimientos. Dos cambian el nivel de detalle, dos recortan el cubo y el quinto solo cambia el punto de vista.
| Operación | Qué hace |
|---|---|
| Drill down | Baja un nivel de detalle: se ve más detalle. Por ejemplo, del año al trimestre. |
| Drill up | Sube un nivel: se ve menos detalle, más agregado. Por ejemplo, del trimestre al año. |
| Slice | Selecciona una dimensión y devuelve un subcubo nuevo. Es cortar una rebanada. |
| Dice | Selecciona dos o más dimensiones a la vez y devuelve un subcubo nuevo. |
| Pivot | Reorienta las dimensiones en el informe: no cambia los datos, cambia qué va en filas y qué en columnas. |
La confusión típica es slice frente a dice: una dimensión es slice, dos o más es dice. Y pivot no filtra nada, solo gira la vista.
Para el examen
Drill down: bajar al detalle
Drill up (roll up): agregar
Slice: cortar por UNA dimensión
Dice: cortar por dos o más
Pivot: girar la vista, sin cambiar los datos