Position Overview
We are looking for a Senior Data Engineer / Data Lead with strong experience in Hadoop, PySpark, Data Governance, Fraud, and Financial Crime.
The ideal candidate will have hands-on experience building and managing large-scale data pipelines and distributed data platforms, along with strong knowledge of data governance and data quality. Experience supporting Fraud, Financial Crime, AML, KYC, or Risk initiatives within the banking or financial services industry is highly preferred.
The role will involve working closely with business stakeholders, data teams, and technology teams to deliver scalable and high-quality data solutions.
Key Responsibilities:
- Design, develop, and maintain scalable data pipelines using Hadoop, PySpark, Spark, Python, and SQL.
- Develop data ingestion, transformation, cleansing, enrichment, and integration processes.
- Work with large volumes of structured and unstructured data in distributed data environments.
- Build and optimize batch and near-real-time data processing pipelines.
- Support data initiatives related to Fraud, Financial Crime, AML, KYC, and Risk Management.
- Implement and maintain Data Governance and Data Quality processes.
- Perform data profiling, validation, reconciliation, and quality assessments.
- Support data lineage, metadata management, data cataloging, and data standards.
- Work with enterprise data lakes and Hadoop-based data platforms.
- Analyze complex datasets and identify data issues, gaps, and anomalies.
- Optimize PySpark/Spark jobs for performance and scalability.
- Collaborate with Data Architects, Data Engineers, Business Analysts, Data Scientists, and business stakeholders.
- Translate business and data requirements into scalable technical solutions.
- Participate in architecture discussions, code reviews, Agile ceremonies, and production support.
- Provide technical guidance and mentorship to junior team members.