Data Platform Manager Experimente

Il y a 5 jours

Les ClayessousBois, Île-de-France Bull Temps plein 65 000 € - 90 000 € Contrat

A propos de Bull

Bull c’est une histoire. Un siècle d’innovation Européenne et un environnement de travail où des experts conçoivent des solutions numériques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maîtrise de leurs données et de leur IA.

Bull c’est aussi des milliers d’ingénieurs, de chercheurs, de passionnés de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques.

Chaque jour, nos équipes repoussent les limites du possible - des architectures HPC de nouvelle génération aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacités de bout en bout uniques, couvrant la conception matérielle, l’ingénierie logicielle, la data science et la recherche quantique.

Centrés sur l’humain et portés par l’innovation, où la collaboration s’étend à l’Europe, aux Amériques et à l’Inde, nous partageons cette même vision d’une innovation responsable et durable, avec un impact concret pour nos clients.

Contexte

Nous construisons le Bull Enterprise Data Hub, une plateforme de données centralisée qui consolide les données produit de plus de huit systèmes sources (SAP, Salesforce, CQFD, PLM, flux fournisseurs) au sein d'une plateforme unifiée, versionnée et centrée sur les API.

La Plateforme Alimente

  • HPCCAT - le catalogue produit des matériels HPC, IA et quantique (~2 100 composants actifs, ~590 k commandes, 5,2 M lignes de devis)
  • Tableaux de bord de direction - indicateurs du programme GATE, prévisions S&OP et vues de feuille de route
  • Intégrations machine à machine - API REST utilisées par CQFD (chiffrage), HPC Designer (jumeau numérique) et des outils externes

Vous rejoindrez une petite équipe de trois personnes à fort impact et serez responsable de la couche data engineering : pipelines d'ingestion, modèles de transformation, qualité des données et infrastructure d'entrepôt.

Stack Technique

  • Base de données : PostgreSQL 16
  • Moteur analytique : DuckDB (OLAP, orienté colonnes)
  • Transformations : dbt-core + dbt-duckdb + dbt-postgres
  • API backend : FastAPI (Python 3.11+)
  • ORM : SQLAlchemy 2.x
  • Authentification : Keycloak (SSO, RBAC)
  • Conteneurs : Docker Compose v2
  • Migrations : Alembic
  • Interface utilisateur : Streamlit 1.50 (pages d'administration)
  • Gestion de versions : Git / GitHub Enterprise
  • Systèmes d'exploitation : Linux (SLES en production, Ubuntu en développement)

Responsabilités principales

  • Concevoir et maintenir des pipelines ETL/ELT pour ingérer les données de SAP, Salesforce, flux fournisseurs et bases internes
  • Concevoir et implémenter des modèles de transformation dbt (staging, intermédiaire, marts) sur PostgreSQL et DuckDB
  • Garantir la qualité des données : tests, supervision, détection d'anomalies et rapprochement avec les systèmes sources
  • Développer et faire évoluer l'API REST (FastAPI/Python) pour les applications consommatrices
  • Administrer l'infrastructure : Docker Compose, PostgreSQL 16, migrations Alembic et CI/CD
  • Collaborer avec les Product Managers pour comprendre les besoins en données et les traduire en modèles fiables
  • Documenter les modèles de données, la traçabilité et les procédures d'exploitation

Compétences Et Qualifications

Indispensable :
  • Au moins 3 ans d'expérience comme Data Engineer, Analytics Engineer ou Backend Engineer avec une forte orientation données
  • Maîtrise de SQL : requêtes complexes, fonctions de fenêtrage, CTE et optimisation de requêtes
  • Maîtrise de Python : code de qualité production, au-delà de simples scripts
  • Expérience des bases de données relationnelles (PostgreSQL de préférence)
  • Conception de pipelines ETL/ELT : traitement par lots et/ou en flux, gestion des erreurs et idempotence
  • Docker : maîtrise de la construction et de l'administration d'applications conteneurisées
  • Linux : aisance en ligne de commande et capacité à diagnostiquer les problèmes serveur
  • Autonomie : capacité à investiguer et résoudre des problèmes de manière indépendante

Atouts Supplémentaires

  • Expérience avec dbt (quel que soit l'adaptateur)
  • Expérience avec DuckDB ou d'autres moteurs analytiques (ClickHouse, Snowflake, BigQuery)
  • FastAPI et conception d'API REST
  • Alembic ou outils de migration de bases de données
  • Extraction de données SAP (IDocs, BAPIs, RFC ou exports de fichiers)
  • Mise en oeuvre de Keycloak, SSO ou RBAC
  • Expérience dans des environnements industriels, de production ou de données produit
  • Français courant, langue de travail de l'équipe et des interlocuteurs

Pourquoi