Alternant·e Data Engineer — Data Quality

Il y a 2 mois

Lyon, Rhône, France L'Express Connect Temps plein

Notre CRM (HubSpot) est le socle de nos données commerciales et marketing. Au fil du temps, le modèle de données s’est complexifié : champs en double, typages incohérents, propriétés mal documentées. En parallèle, nous mettons en place une véritable démarche de gouvernance de la donnée et nous maintenons des pipelines Python qui alimentent et exploitent ces données.

Ta mission : remettre de l’ordre dans ce modèle, le documenter, et contribuer à ce qu’il reste propre dans la durée. Un travail à fort impact, encadré de près, qui touche à la fois à la qualité de la donnée, à la modélisation et à l’industrialisation.

Ton encadrement

Tu seras encadré·e directement par le Data Engineer de l’entreprise, qui pilote l’infrastructure data et les pipelines. Concrètement :

  • Un tutorat rapproché : points réguliers, travail en binôme sur les sujets complexes.

  • Un process de revue systématique : tu proposes, on valide ensemble, on applique de manière contrôlée. Notre CRM est en production et alimente des automatisations critiques — tu n’auras jamais à porter seul·e le risque d’une modification.

  • Une autonomie qui grandit avec ta maîtrise : l’objectif est qu’en fin d’alternance, tu sois capable de mener un chantier de bout en bout.

Missions principales

1. Nettoyage et structuration du modèle de données HubSpot (cœur du poste)

  • Auditer les propriétés existantes : doublons, champs obsolètes, incohérences.

  • Proposer et appliquer le dédoublonnage et le retypage des champs.

  • Identifier les dépendances (workflows, pipelines, rapports) impactées par chaque modification.

2. Documentation et data dictionary

  • Construire et maintenir le dictionnaire de données du CRM (définition, type, usage, propriétaire de chaque champ).

  • Documenter la logique métier associée aux propriétés clés.

3. Contribution à la gouvernance de la donnée

  • Participer à la définition des conventions de nommage, des règles de qualité et des responsabilités.

  • Aider à mettre en place des contrôles simples de qualité de la donnée.

4. Support aux pipelines de données (mission secondaire)

  • Mettre à jour les pipelines Python existants en fonction des modifications du modèle.

  • Contribuer à leur maintenance et à leur fiabilisation.

Environnement technique

  • Langages : Python, SQL

  • Données & CRM : HubSpot API, PostgreSQL

  • Cloud & infra : GCP (BigQuery), DigitalOcean

  • Outils & pratiques : Git / GitHub, Poetry