Alternant·e Data Engineer — Data Quality
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Notre CRM (HubSpot) est le socle de nos données commerciales et marketing. Au fil du temps, le modèle de données s’est complexifié : champs en double, typages incohérents, propriétés mal documentées. En parallèle, nous mettons en place une véritable démarche de gouvernance de la donnée et nous maintenons des pipelines Python qui alimentent et exploitent ces données.
Ta mission : remettre de l’ordre dans ce modèle, le documenter, et contribuer à ce qu’il reste propre dans la durée. Un travail à fort impact, encadré de près, qui touche à la fois à la qualité de la donnée, à la modélisation et à l’industrialisation.
Ton encadrement
Tu seras encadré·e directement par le Data Engineer de l’entreprise, qui pilote l’infrastructure data et les pipelines. Concrètement :
Un tutorat rapproché : points réguliers, travail en binôme sur les sujets complexes.
Un process de revue systématique : tu proposes, on valide ensemble, on applique de manière contrôlée. Notre CRM est en production et alimente des automatisations critiques — tu n’auras jamais à porter seul·e le risque d’une modification.
Une autonomie qui grandit avec ta maîtrise : l’objectif est qu’en fin d’alternance, tu sois capable de mener un chantier de bout en bout.
Missions principales
1. Nettoyage et structuration du modèle de données HubSpot (cœur du poste)
Auditer les propriétés existantes : doublons, champs obsolètes, incohérences.
Proposer et appliquer le dédoublonnage et le retypage des champs.
Identifier les dépendances (workflows, pipelines, rapports) impactées par chaque modification.
2. Documentation et data dictionary
Construire et maintenir le dictionnaire de données du CRM (définition, type, usage, propriétaire de chaque champ).
Documenter la logique métier associée aux propriétés clés.
3. Contribution à la gouvernance de la donnée
Participer à la définition des conventions de nommage, des règles de qualité et des responsabilités.
Aider à mettre en place des contrôles simples de qualité de la donnée.
4. Support aux pipelines de données (mission secondaire)
Mettre à jour les pipelines Python existants en fonction des modifications du modèle.
Contribuer à leur maintenance et à leur fiabilisation.
Environnement technique
Langages : Python, SQL
Données & CRM : HubSpot API, PostgreSQL
Cloud & infra : GCP (BigQuery), DigitalOcean
Outils & pratiques : Git / GitHub, Poetry
Preferred experience
Indispensable
Bases solides en Python.
Notions d’API REST (savoir consommer une API).
Git / GitHub (branches, commits, pull requests).
Comprendre ce qu’est un modèle de données (tables, relations, types).
Fortement souhaité
- SQL : requêtes de sélection, jointures, agrégations.
Tu apprendras chez nous
Les principes de gouvernance et de qualité de la donnée.
La modélisation d’un modèle de données CRM.
L’industrialisation de pipelines et les bonnes pratiques de développement.
Savoir-être
Rigueur et souci du détail
Autonomie progressive
Bonne communication
Réflexe documentation
Niveau d’études : ouvert — du Bac+2/+3 (BTS, BUT, Licence pro) au Bac+5 (Master, école d’ingénieur).
Modalités pratiques
Type de contrat : contrat d’apprentissage
Durée : 12 à 36 mois
Lieu : Lyon, présentiel
Rémunération : selon la grille légale de l’apprentissage
Date de démarrage : Dès que possible
Recruitment process
Entretien avec ton futur maître d’apprentissage (Data Engineer) — on parle de ton parcours, de ce que tu sais déjà faire, et on rentre dans le concret de la mission. C’est aussi le moment de poser toutes tes questions techniques.
Entretien avec la Directrice Digitale — on échange sur ta motivation, ta vision du poste et ton intégration dans l’équipe.