Concevoir et déployer des pipelines de données robustes et scalables à l’aide de Databricks, PySpark et DBT, pour alimenter des environnements d’analyse et de machine learning.
Optimiser les performances des traitements ETL/ELT en exploitant les bonnes pratiques de data modeling (schémas en étoile, en flocon, etc.) et les capacités distribuées de Spark.
Collaborer avec les Data Scientists et les équipes métiers pour comprendre les besoins et livrer des jeux de données fiables, documentés et prêts à l’emploi.
Automatiser le déploiement et la maintenance des pipelines via des outils CI/CD (GitLab, Jenkins, etc.) et garantir leur monitoring (Airflow, Prometheus, etc.).
Contribuer à l’évolution de l’architecture data du groupe, en intégrant des solutions cloud (AWS, Azure ou GCP) et en veillant à la conformité RGPD et aux normes de sécurité.
Intervenir en tant qu’expert technique pour résoudre les problèmes complexes liés à la qualité, la latence ou la volumétrie des données.
Documenter les processus, les schémas de données et les bonnes pratiques pour faciliter la maintenance et l’onboarding des nouveaux membres de l’équipe.