Un mismo recorrido de datos durante las sesiones
Las sesiones trabajan sobre un dataset común y reproducible:
TPC-DS SF1 Relación de municipios del INE
(ventas, clientes, fechas) (municipio y provincia españoles)
\ /
\ cruce determinista /
↓
/datalake/raw/tpcds en HDFS
Parquet con ciudades y provincias españolas
↓
S3 -> Spark/YARN -> silver/gold -> Hive/Trino -> Iceberg/streaming
S2 realiza la descarga, normalización y materialización; las sesiones
posteriores consumen el estado que deja el notebook anterior. El CI ejecuta
esos mismos notebooks y comprueba sus salidas, mientras que el arranque de
contenedores queda como preparación del entorno