Material docente
Tecnología de Computación de Datos Masivos
Apuntes, transparencias y materiales de las sesiones del curso 2026/2027.
Información de la asignatura
Presentación (sesión 0)
Organización, planificación, evaluación y bibliografía del curso.
Sesión 1
Primer contacto con el clúster Hadoop
Por qué existe Big Data, el modelo de programación MapReduce, y la puesta en marcha del clúster simulado: HDFS, YARN, ejecución de MapReduce y recuperación del entorno.
Sesión 2
Exploración de TPC-DS en Parquet
Introducción de TPC-DS, el dataset de gestión empresarial que se usa en el resto del curso (una empresa minorista que vende en tiendas, por catálogo y por web), organización de un data lake en HDFS, las distintas interfaces de acceso a HDFS, y lectura de datos con WebHDFS, PyArrow, Polars y DuckDB.
Sesión 3
Un data lake sobre almacenamiento S3-compatible
Objetos Parquet, prefijos, API S3 y acceso con distintas bibliotecas.
Sesión 4
Spark como motor distribuido
DataFrames, ejecución perezosa, particiones y despliegue sobre YARN.
Sesión 5
Arquitectura medallion y particionado físico
Recorrido de TPC-DS desde raw hasta conjuntos silver y gold.
Sesión 6
Hive Metastore, tablas Hive y Trino
Catálogo compartido, particiones, estadísticas y consultas desde varios motores.
Sesión 7
Iceberg: lakehouse, evolución y optimización
Snapshots, evolución de esquema y optimizaciones observables.
Sesión 8
Ingesta continua con Spark Structured Streaming
Micro-lotes de ficheros y actualización incremental de tablas Iceberg.