Lead Data Engineer- Governance
About This Opportunity Responsibilities:
- Lead the design, implementation, and continuous improvement of enterprise-wide data quality frameworks, standards, and best practices.
- Define, monitor, and report on data quality KPIs, scorecards, and SLAs to measure data health across critical business domains.
- Develop and maintain automated data quality checks, validation rules, reconciliation processes, and exception reporting frameworks.
- Perform data profiling, anomaly detection, root-cause analysis, and impact assessments to identify and resolve data quality issues.
- Write and optimize complex SQL queries to analyze, validate, and reconcile large and complex datasets across multiple source systems.
- Develop Python-based automation solutions to streamline data validation, monitoring, reconciliation, and issue remediation processes.
- Leverage AI/ML techniques and statistical methods to detect data anomalies, predict quality issues, and improve data observability.
- Partner with Data Engineering teams to embed data quality controls within ETL/ELT pipelines and data transformation processes.
- Collaborate with Data Governance, Business, and Technology teams to define critical data elements, business rules, and quality standards.
- Ensure data integrity, consistency, completeness, accuracy, and timeliness across enterprise data platforms and reporting environments.
- Support metadata management, data lineage, and data catalog initiatives to improve transparency and traceability of data assets.
- Design and maintain dashboards, scorecards, and AI-enabled monitoring solutions that provide visibility into data quality performance, trends, and risks.
- Lead investigations of data incidents, coordinate remediation efforts, and implement preventive controls to reduce recurring issues.
- Mentor and guide analysts on data quality methodologies, Python programming, automation techniques, AI-driven analytics, and technical best practices.
- Drive continuous improvement by identifying opportunities to leverage Generative AI, machine learning, and intelligent automation to enhance data quality processes and operational efficiency.
Educational & Required Qualifications:
- Bachelor's degree in Computer Science, Information Systems, Data Analytics, Statistics, Mathematics, Engineering, or a related quantitative field.
- Minimum 7+ years of experience in Data Analytics, Data Quality, Data Governance, Business Intelligence, or related disciplines.
- Proven experience leading data quality initiatives, projects, or teams within complex enterprise environments.
- Advanced proficiency in SQL with hands-on experience querying, validating, reconciling, and analyzing large-scale datasets.
- Strong programming skills in Python with experience developing automation solutions, data validation frameworks, APIs, and analytical workflows.
- Experience applying AI/ML techniques, statistical analysis, or anomaly detection models to improve data quality, monitoring, and decision-making processes.
- Experience working with modern cloud data platforms such as Databricks, Snowflake etc.
- Solid understanding of data warehousing concepts, data modeling, ETL/ELT processes, data lifecycle management, and data governance principles.
- Familiarity with Generative AI tools, AI-assisted analytics, automation frameworks, and modern data quality/observability platforms.
- Excellent analytical, problem-solving, communication, stakeholder management, and cross-functional collaboration skills, with the ability to influence both business and technical teams.
- Established data stewardship best practices and governance frameworks to improve data reliability.
- Defined data ownership, stewardship responsibilities, and data quality standards across business units.
- Automated data quality monitoring processes, reducing manual effort and improving data accuracy.
- Partnered with data architects, data engineers, and business analysts to implement enterprise-wide governance solutions.
Preferred Technical Skills
- SQL (Advanced)
- Retail industry experience is preferred.
- Python (Pandas, NumPy, PySpark, APIs, Automation Frameworks)
- Data Quality & Observability Tools (Monte Carlo, Informatica DQ, etc.)
- Power BI, Tableau, or similar BI platforms
- Snowflake, Databricks, Azure, AWS, or GCP Data Services
- Machine Learning & Anomaly Detection
- Generative AI tools (Copilot, Windsurf, Codex, ChatGPT Enterprise, Azure OpenAI)
- Git, CI/CD, and DevOps practices for analytics and automation solutions