Alternant·e Data Engineer — Data Quality

Il y a 10 heures

Lyon, Rhône, France L'Express Connect Temps plein

Notre CRM (HubSpot) est le socle de nos données commerciales et marketing. Au fil du temps, le modèle de données s’est complexifié : champs en double, typages incohérents, propriétés mal documentées. En parallèle, nous mettons en place une véritable démarche de gouvernance de la donnée et nous maintenons des pipelines Python qui alimentent et exploitent ces données.

Ta mission : remettre de l’ordre dans ce modèle, le documenter, et contribuer à ce qu’il reste propre dans la durée. Un travail à fort impact, encadré de près, qui touche à la fois à la qualité de la donnée, à la modélisation et à l’industrialisation.

Ton encadrement

Tu seras encadré·e directement par le Data Engineer de l’entreprise, qui pilote l’infrastructure data et les pipelines. Concrètement :

  • Un tutorat rapproché : points réguliers, travail en binôme sur les sujets complexes.

  • Un process de revue systématique : tu proposes, on valide ensemble, on applique de manière contrôlée. Notre CRM est en production et alimente des automatisations critiques — tu n’auras jamais à porter seul·e le risque d’une modification.

  • Une autonomie qui grandit avec ta maîtrise : l’objectif est qu’en fin d’alternance, tu sois capable de mener un chantier de bout en bout.

Missions principales

1. Nettoyage et structuration du modèle de données HubSpot (cœur du poste)

  • Auditer les propriétés existantes : doublons, champs obsolètes, incohérences.

  • Proposer et appliquer le dédoublonnage et le retypage des champs.

  • Identifier les dépendances (workflows, pipelines, rapports) impactées par chaque modification.

2. Documentation et data dictionary

  • Construire et maintenir le dictionnaire de données du CRM (définition, type, usage, propriétaire de chaque champ).

  • Documenter la logique métier associée aux propriétés clés.

3. Contribution à la gouvernance de la donnée

  • Participer à la définition des conventions de nommage, des règles de qualité et des responsabilités.

  • Aider à mettre en place des contrôles simples de qualité de la donnée.

4. Support aux pipelines de données (mission secondaire)

  • Mettre à jour les pipelines Python existants en fonction des modifications du modèle.

  • Contribuer à leur maintenance et à leur fiabilisation.

Environnement technique

  • Langages : Python, SQL

  • Données & CRM : HubSpot API, PostgreSQL

  • Cloud & infra : GCP (BigQuery), DigitalOcean

  • Outils & pratiques : Git / GitHub, Poetry

Preferred experience

Indispensable

  • Bases solides en Python.

  • Notions d’API REST (savoir consommer une API).

  • Git / GitHub (branches, commits, pull requests).

  • Comprendre ce qu’est un modèle de données (tables, relations, types).

Fortement souhaité

  • SQL : requêtes de sélection, jointures, agrégations.

Tu apprendras chez nous

  • Les principes de gouvernance et de qualité de la donnée.

  • La modélisation d’un modèle de données CRM.

  • L’industrialisation de pipelines et les bonnes pratiques de développement.

Savoir-être

  • Rigueur et souci du détail

  • Autonomie progressive

  • Bonne communication

  • Réflexe documentation

Niveau d’études : ouvert — du Bac+2/+3 (BTS, BUT, Licence pro) au Bac+5 (Master, école d’ingénieur).

Modalités pratiques

  • Type de contrat : contrat d’apprentissage

  • Durée : 12 à 36 mois

  • Lieu : Lyon, présentiel

  • Rémunération : selon la grille légale de l’apprentissage

  • Date de démarrage : Dès que possible

Recruitment process

  • Entretien avec ton futur maître d’apprentissage (Data Engineer) — on parle de ton parcours, de ce que tu sais déjà faire, et on rentre dans le concret de la mission. C’est aussi le moment de poser toutes tes questions techniques.

  • Entretien avec la Directrice Digitale — on échange sur ta motivation, ta vision du poste et ton intégration dans l’équipe.