Material docente

Tecnología de Computación de Datos Masivos

Apuntes, transparencias y materiales de las sesiones del curso 2026/2027.

Información de la asignatura

Presentación (sesión 0)

Organización, planificación, evaluación y bibliografía del curso.

Sesión 1

Primer contacto con el clúster Hadoop

Por qué existe Big Data, el modelo de programación MapReduce, y la puesta en marcha del clúster simulado: HDFS, YARN, ejecución de MapReduce y recuperación del entorno.

Sesión 2

Exploración de TPC-DS en Parquet

Introducción de TPC-DS, el dataset de gestión empresarial que se usa en el resto del curso (una empresa minorista que vende en tiendas, por catálogo y por web), organización de un data lake en HDFS, las distintas interfaces de acceso a HDFS, y lectura de datos con WebHDFS, PyArrow, Polars y DuckDB.

Sesión 3

Un data lake sobre almacenamiento S3-compatible

Objetos Parquet, prefijos, API S3 y acceso con distintas bibliotecas.

Sesión 4

Spark como motor distribuido

DataFrames, ejecución perezosa, particiones y despliegue sobre YARN.

Sesión 5

Arquitectura medallion y particionado físico

Recorrido de TPC-DS desde raw hasta conjuntos silver y gold.

Sesión 6

Hive Metastore, tablas Hive y Trino

Catálogo compartido, particiones, estadísticas y consultas desde varios motores.

Sesión 7

Iceberg: lakehouse, evolución y optimización

Snapshots, evolución de esquema y optimizaciones observables.

Sesión 8

Ingesta continua con Spark Structured Streaming

Micro-lotes de ficheros y actualización incremental de tablas Iceberg.