Data Engineer IA – H/F

Il y a 2 jours

Paris, Ile-de-France STORM GROUP Temps plein
#StormYourCareer Rejoins STORM GROUP et construis ta carrière avec nous Bâtis les pipelines de données massives et alimente les moteurs de l’IA générative Dans le cadre du développement et du passage à l’échelle des cas d’usage IA d’un grand compte, nous recherchons un(e) Data Engineer IA. Ton rôle sera hautement structurant et central : tu concevras, développeras et industrialiseras les pipelines de données volumineux et temps réel qui alimentent les modèles de Machine Learning et les applications d’IA générative, en garantissant la qualité, la traçabilité et la performance des flux de données. Ton futur environnement Tu évolueras au sein d’une équipe pluridisciplinaire réunissant data engineers, data scientists, architectes data et ingénieurs MLOps. En prise directe avec les équipes plateformes et les squads de développement GenAI, tu travailleras sur des architectures Lakehouse modernes en environnement Cloud. C’est le cadre idéal pour manipuler des volumes de données massifs, mettre en œuvre des flux événementiels temps réel et concevoir des pipelines avancés de préparation documentaire (chunking, vectorisation) pour les architectures RAG. Tes missions clés Conception & Développement des Pipelines de Données (Mode BUILD) : Concevoir, développer et automatiser des pipelines ETL/ELT robustes depuis des sources hétérogènes (APIs, bases relationnelles, flux événementiels) en modes batch (Spark, PySpark, Databricks, dbt) et temps réel (Kafka). Structurer, nettoyer et enrichir les jeux de données destinés à l’entraînement des modèles de Machine Learning et au feature engineering. Construire les chaînes de préparation de données textuelles et multimodales pour les architectures RAG : ingestion documentaire automatisée, stratégies de découpage (chunking) et pipelines d’embedding/vectorisation. Alimenter, optimiser et administrer les bases de données vectorielles du groupe. Mettre en œuvre les architectures de stockage modernes (Delta Lake / Lakehouse, Snowflake, BigQuery). Industrialisation, Qualité & Optimisation (Mode RUN & MLOps) : Industrialiser l’orchestration des flux de données via des outils dédiés (Airflow) en garantissant la sécurité, la haute disponibilité et la reproductibilité du code (Git, CI/CD). Optimiser les performances de traitement et piloter les coûts de calcul et de stockage dans le Cloud. Garantir la qualité, la gouvernance, la sécurité et la traçabilité (data lineage) des données manipulées. Rédiger la documentation technique des pipelines et contribuer activement à l’amélioration des standards d’ingénierie de l’équipe. Ton profil

Formation:
Diplôme d’Ingénieur ou Bac+5 universitaire en informatique, Data Engineering, génie logiciel ou systèmes d’information.

Expérience:
Tu justifies d’une expérience confirmée de 3 à 5 ans en Data Engineering en environnement Cloud, avec idéalement une première mise en pratique sur des cas d’usage IA/ML ou GenAI (pipelines RAG, feature engineering). Expertise Data Engineering Impérative : Excellente maîtrise de la programmation en Python et des requêtes complexes en SQL. Solide expérience de traitement distribué avec Spark / PySpark et de l’environnement Databricks. Maîtrise des outils d’orchestration de flux (Airflow) et de transformation de données (dbt). Pratique confirmée d’un entrepôt de données moderne (Snowflake, BigQuery, Delta Lake). Culture Cloud & IA : Expérience sur au moins une plateforme Cloud majeure (Azure, AWS ou GCP). Compréhension des flux streaming (Kafka) et des pratiques DevOps (Git, CI/CD). Notions ou expérience pratique des architectures RAG et de la manipulation de bases vectorielles. Langues : Anglais professionnel opérationnel. Tes atouts Rigueur d’Ingénierie Logicielle : Attachement fort aux bonnes pratiques de développement (code propre, testé, versionné et reproductible). Sens de la Qualité et de la Sécurité : Souci permanent de l’intégrité, de la gouvernance et de la confidentialité des données traitées. Collaboration Transverse : Capacité naturelle à dialoguer avec les data scientists pour traduire leurs besoins algorithmiques en pipelines scalables. Nos avantages Remboursement des titres de transport à hauteur de 75%. Tickets restaurant pris en charge par STORM GROUP à hauteur de 50% (10,5€ / jour). Accès Gymlib / Wellpass (sport et bien-être). Contrat Santé / Prévoyance mis en place auprès de la compagnie Alan. Formation continue : Accès à Udemy Business. Prime de cooptation, prime d’intéressement et de participation. Deux à trois jours de télétravail par semaine. 5 raisons de nous rejoindre Parcours sur mesure : Co-construis une trajectoire professionnelle unique, adaptée à tes ambitions. Missions Stratégiques : Interviens sur des projets d’envergure, en parfaite cohérence avec ton expertise. Suivi Dédié : Bénéficie d’un pilotage annuel structuré pour garantir ta progression continue. Excellence Continue : Développe tes compétences au quotidien au sein d’un écosystème exigeant. Performance Durable : Évolue dans un cadre où l’exigence métier respecte ton équilibre de vie. Notre processus de sélection Échange introductif avec un chargé de recrutement. Entretien métier avec évaluation technique approfondie. Rencontre finale pour validation du fit et projection sur la mission. Storm Group encourage une culture inclusive et multiculturelle où la diversité des profils nourrit notre intelligence collective. En rejoignant la Storm Team, tu intègres un écosystème engagé qui place le développement de tes talents au cœur de sa stratégie, tout en agissant concrètement pour la solidarité et la réduction de l'empreinte environnementale, aussi bien au sein de nos bureaux que dans les projets d'envergure que nous menons chez nos clients.