Ingénieur/e Data – Services Publics – Toulouse

Il y a 1 jour

Colomiers, Occitanie, France Sopra Steria Temps plein

Description de l'entreprise

Sopra Steria, acteur majeur de la Tech en Europe, avec 51 000 collaborateurs dans près de 30 pays, est reconnu pour ses activités de conseil, de services et de solutions numériques. Il aide ses clients à mener leur transformation digitale et à obtenir des bénéfices concrets et durables. Le Groupe apporte une réponse globale aux enjeux de compétitivité des grandes entreprises et organisations, en combinant une connaissance approfondie des secteurs d’activité et des technologies à une approche collaborative. Sopra Steria place l’humain au cœur de son action et s’engage auprès de ses clients à tirer le meilleur parti du numérique pour construire un avenir positif. En 2025, le Groupe a réalisé un chiffre d’affaires de 5,6 milliards d’euros.

Description du poste

The world is how we shape it

Mission

La communauté Data de la division « Services Publics » de Sopra Steria accompagne les organismes, les administrations et autres entités de la sphère publique sur des grands programmes de transformation et de maintenance dans le domaine de l’informatique décisionnelle, de la datavisualisation, de la data science, de l’IA ainsi que des technologies et architectures Big Data (Datalake, Lakehouse).

Notre présence globale dans l’écosystème depuis de nombreuses années et la connaissance approfondie des métiers de nos clients sont un atout majeur pour répondre aux grands enjeux de transformation impliqués par les réformes de l’État :

  • Souveraineté
  • Move to Cloud
  • Mise en place de plateforme de données
  • Gestion des données à caractère personnel ou sensibles
  • Modernisation de socle technologique
  • Maitrise des coûts SI
  • Gestion de la dette technique

En tant qu’Ingénieur Data, vous intégrerez une communauté d’experts au service de la valorisation de données de nos clients. En fonction de votre spécialisation et/ou appétence dans les métiers de la Data parmi la BI (informatique décisionnelle), la datavisualisation, le Big Data, la data science, vous serez amené à travailler sur les activités suivantes :

  • Collecte de Données : Vous aurez la charge de collecter des données à partir de diverses sources internes et externes, incluant bases de données, fichiers, API, flux de données en continu, etc.
  • Extraction, Transformation et Chargement : Vous effectuerez des opérations ETL pour extraire, transformer (nettoyage, normalisation, agrégation, enrichissement…) et charger les données dans les entrepôts ou magasins décisionnels ou dans des formats optimisés pour le Big Data.
  • Intégration des Données Structurées et Non Structurées : Vous gèrerez bases relationnelles, fichiers CSV, ainsi que données non structurées (textes, images, vidéos) et les intégrerez sur une plateforme de données.
  • Gestion des Flux de Données en Continu : Vous traiterez les flux en temps réel provenant de capteurs IoT ou de journaux d’événements, garantissant leur disponibilité et intégrité.
  • Sécurité des Données : Vous veillerez à sécuriser les données collectées et intégrées via chiffrement, contrôle d’accès et gestion des identités.
  • Restitution des données : Vous construirez pour les analystes des solutions d’exposition (API), de reporting et de visualisation des données consolidées dans les datamarts métiers à l’aide d’outils ou de librairies de datavisualisation.
  • Gestion des Métadonnées : Vous documenterez et gèrerez les métadonnées associées aux sources, transformations et schémas afin de faciliter la compréhension pour les Data Scientists et analystes.
  • Performance et Évolutivité : Vous optimiserez les processus d’intégration pour garantir des performances élevées et assurer la scalabilité face à des volumes croissants.
  • Collaboration avec les autres équipes : Vous collaborerez étroitement avec les Data Scientists, experts fonctionnels, Architectes Data et autres membres de l’équipe.
  • Gestion des accès aux données : Vous veillerez à ce que chaque profil utilisateur ait accès aux données adéquates, conformément au système d’habilitations en place.
  • Planification et Automatisation : Vous planifierez les tâches d’intégration et mettrez en place des mécanismes d’automatisation pour réduire délais et erreurs.
  • Maintenance et Surveillance : Vous assurerez la maintenance continue des pipelines et surveillerez les flux pour détecter et résoudre rapidement les problèmes.

Environnement technique

  • Big Data : Sqoop, Spark, Nifi, Hadoop, Cloudera, Hive, HDFS, S3, MinIO, Parquet, Ranger, Atlas, Kerberos, Yarn, Iceberg, Dremio, Trino, Keycloak, Kubernetes, Airflow
  • Data science : Python (et librairies), PySpark, R (et packages), SAS