Buscamos un/a Data Engineer Senior para diseñar y operar la plataforma de datos que alimenta un sistema de pricing dinámico e inteligencia de negocio en entornos retail de alto volumen. La persona seleccionada será el referente técnico de la arquitectura de datos: desde la ingesta de fuentes operacionales (ERP, POS, e-commerce, footfall) hasta la exposición de datos listos para consumo por modelos de ML y herramientas de BI.
Arquitectura y plataforma de datos
Gobierno de la plataforma: Unity Catalog, gestión de permisos, linaje de datos y calidad (Great Expectations o similar).
Modelado de datos
Definición de tablas de hechos y dimensiones: transacciones POS, catálogo de productos, maestro de tiendas, calendario promocional.
Colaboración con el equipo de ML para diseñar y mantener el feature store sobre la capa Gold.
Documentación del modelo de datos en un catálogo semántico accesible para usuarios de negocio y analítica.
Construcción de pipelines de ingesta desde fuentes heterogéneas: ERP (SAP u otros), POS, APIs de e-commerce, feeds de Retail Media, NPS.
Uso de Azure Data Factory para orquestación de movimientos de datos entre sistemas origen y el lakehouse — con preferencia por mantener la lógica de transformación en Databricks (PySpark / SQL).
Testing de pipelines: validaciones de schema, checks de completitud y pruebas de regresión sobre datos.
Operación y fiabilidad
Soporte a incidencias de datos en producción (on-call rotatorio con el equipo).
Trabajo estrecho con Data Scientists para garantizar que el feature store cubra los requisitos de los modelos de pricing y recomendación.
Acompañamiento a analistas de negocio en la definición de métricas y KPIs sobre la capa Gold.
Participación en code reviews, definición de convenciones de nombrado y estándares de calidad del equipo.
5+ años de experiencia en ingeniería de datos en entornos productivos.
~ Databricks: experiencia sólida con Databricks como plataforma principal; Delta Lake, Databricks Workflows, Unity Catalog.
~ Modelado de datos: dominio de modelado dimensional (Kimball); Lenguajes: PySpark y SQL avanzado (window functions, CTEs, optimización de queries).
~ Azure Data Factory: conocimiento funcional para orquestación y movimiento de datos; Experiencia con patrones de ingesta incremental: CDC, watermark, Delta Merge / upsert.
~ Familiaridad con control de versiones (Git) y prácticas de DataOps básicas.
Experiencia en retail, travel retail o sectores con datos transaccionales de alto volumen.
Conocimiento de herramientas de calidad de datos: Great Expectations, Soda o similar.
Experiencia con dbt (data build tool) para transformaciones SQL sobre la capa Silver/Gold.
Familiaridad con eventos en streaming: Kafka, Event Hubs o Databricks Structured Streaming.
Conocimiento de herramientas de catálogo y linaje: Purview, Alation o Unity Catalog avanzado. xsgfvud
Experiencia colaborando con equipos de ML en el diseño de feature stores (Feast, Tecton o solución custom).
#