AI Platform Engineer – H/F

Il y a 6 jours

Paris, Île-de-France STORM GROUP Temps plein

Bâtis le socle d’inférence et industrialise la plateforme d’IA générative du groupe

Dans le cadre du déploiement à grande échelle des solutions d’IA générative et agentique d’un grand compte, nous recherchons un(e) AI Platform Engineer. Ton rôle sera hautement structurant : tu construiras, administreras et opéreras la plateforme mutualisée destinée à héberger l’ensemble des cas d’usage IA et des modèles de fondation pour les équipes de développement et de data science du groupe.

Ton futur environnement

Tu évolueras au sein d’une équipe dédiée au Platform Engineering et à l’ingénierie d’infrastructure cloud de pointe. En interface directe avec les data scientists, les développeurs d’applications GenAI, les architectes cloud et les équipes de sécurité, tu concevras un environnement self-service robuste et scalable. C’est le cadre idéal pour manipuler des grappes de calcul GPU à grande échelle, piloter des gateways LLM d’entreprise et déployer des pratiques FinOps sur des charges d’inférence massives.

Tes missions clés

Conception & Déploiement de l’Infrastructure IA (Mode BUILD) :

  • Concevoir, déployer et faire évoluer la plateforme IA interne selon une approche Infrastructure as Code (Terraform).

  • Provisionner et orchestrer les clusters de conteneurs (Kubernetes, OpenShift) et configurer les environnements d’inférence optimisés sur infrastructures GPU et stockage objet (S3).

  • Intégrer, configurer et administrer les Gateways LLM régissant les accès aux modèles internes (open source) et aux APIs des fournisseurs externes.

  • Mettre en œuvre les mécanismes de gouvernance d’accès (IAM), de gestion dynamique des quotas et de refacturation interne des consommations (FinOps).

  • Développer des templates standardisés et des fonctionnalités en self-service pour fluidifier l’onboarding des équipes projets.

Exploitation, Observabilité & Maintien en Condition Opérationnelle (Mode RUN) :

  • Assurer la haute disponibilité, la résilience et la sécurité des services hébergés sur la plateforme.

  • Mettre en place et superviser les chaînes d’observabilité et de métriques dédiées aux workloads IA (ELK, Grafana, Prometheus).

  • Piloter le capacity planning des ressources de calcul (GPU/CPU) et optimiser les coûts d’inférence en production.

  • Assurer la gestion des incidents, le support de niveau avancé et la documentation technique de la plateforme.

Ton profil

  • Formation : Diplôme d’Ingénieur ou Bac+5 universitaire en informatique, systèmes et réseaux ou génie logiciel.

  • Expérience : Tu justifies d’une expérience confirmée de 4 à 6 ans en Platform Engineering ou en ingénierie d’infrastructure Cloud / DevOps, incluant la gestion de workloads IA/ML en production.

  • Expertise Infrastructure & Cloud Impérative :

    • Excellente maîtrise d’au moins un fournisseur Cloud majeur (Azure, AWS ou GCP) et des outils d’IaC (