Ingénieur DevOps Confirmé H/F

Il y a 4 jours

SaintCloud, Ile-de-France 3DS Outscale Temps plein
Nous recrutons un(e) ingénieur(e) DevOps confirmé(e) afin de renforcer notre équipe AI Factory. OUTSCALE, marque de Dassault Systèmes, est un opérateur souverain et durable de l'Expérience en tant que Service qui offre à ses clients des environnements technologiques de confiance.

Nous offrons
des expériences uniques grâce au savoir-faire de nos équipes passionnées, qui se reflète notamment par la création de solutions de Business Expériences, le développement de notre propre orchestrateur Cloud, TINA OS, ou encore l'obtention de la qualification SecNumCloud. L'AI Factory de Dassault Systèmes conçoit et opère la plateforme d'intelligence artificielle du groupe, de l'infrastructure matérielle jusqu'aux services PaaS exposés aux équipes produits. Notre salle héberge des racks NVIDIA GB200/300NVL72, sur lesquels tournent des workloads d'entraînement, d'inférence LLM et des environnements de développement pour les équipes data science. À cette échelle, la valeur de la plateforme dépend directement de sa capacité àêtre déployée, mise à jour et exploitée de façon reproductible : clusters Kubernetes, GPU, chaîne de livraison des services, supervision de bout en bout, diagnostic rapide lorsqu'un workload ne démarre pas ou ne tient pas ses performances. Nous recherchons un(e) ingénieur(e) DevOps confirmé(e) pour prendre en charge l'industrialisation et l'exploitation de cette plateforme,puis pour accompagner son intégration avec l'infrastructure IaaS du groupe. Missions Rattaché(e) au responsable de l'AI Factory, vous serez en charge de :
- L'exploitation des clusters Kubernetes GPU : le maintien en condition opérationnelle des clusters (montées de version Kubernetes, GPU Operator,drivers et CUDA, ordonnanceur GPU), la gestion de la capacité et des node pools, les quotas et priorités entre équipes, la définition et le suivi des SLO de laplateforme.
- La chaîne de livraison et GitOps : la mise en place et le maintien des pipelines CI/CD et du déploiement continu (Argo CD ou Flux) pour les composants de la plateforme, la gestion des versions et de leur compatibilité, l'environnements de tests et de pré-production, stratégies de rollout et de rollback.
- L'Infrastructure as Code : provisionnement et configuration de l'infrastructure (Terraform, Ansible, Helm), la gestion des registres d'images et des artefacts, la construction d'images multi-architecture (arm64, amd64), pinning et le scan desdépendances.
- Le diagnostic et la résolution d'incidents : la prise en charge des problèmes de bout en bout, de l'end point exposé jusqu'au pod GPU (ordonnancement, stockage, réseau, images, communication inter-noeuds) ; reproduction des incidents, rootcause analysis, rédaction de post-mortems et de runbooks.
- La supervision et l'observabilité : la mise en place et l'enrichissement de la supervision de la plateforme (Prometheus/Grafana, métriques GPU via DCGM, la centralisation des logs, alerting), tableaux de bord par équipe, sonde ssynthétiques et outillage de debug.
- Le support des workloads IA : accompagnement des équipes data science et MLOps dans le déploiement de leurs entraînements et de leurs serveurs d'inférence (gestion des poids de modèles, stockage partagé, exposition des API), maintien des templates et exemples de référence, support de niveau 3.
- L'intégration AI Factory / IaaS : la participation à l'étude et à la conception de l'intégration de la plateforme avec l'infrastructure IaaS du groupe (provisionnement, identités, exposition des services), en vue d'une offre intégrée avec le reste des produits.
- La performance des modèles déployés : la participation à l'élaboration des processus d'amélioration des performances des modèles spécifiques et des LLM en production (campagnes de benchmark de débit et de latence, mesure de l'utilisation GPU, tuning des paramètres de serving tels que batching, quantification, parallélisme, cache KV, choix des tailles d'instances), définition des indicateurs de performance, suivis dans la supervision et boucle de retour vers les équipes data science. Stack technique
- Matériel : racks NVIDIA GB200/300 NVL72, fabric haute performance, stockage partagé
- Plateforme : Kubernetes, NVIDIA GPU Operator, ordonnanceur GPU, opérateurs et CRD, Gateway API / ingress, serveurs d'inférence LLM (vLLM ou équivalent), PyTorch
- Livraison et outillage : Git, GitLab CI ou GitHub Actions, Argo CD ou Flux,Helm, Kustomize, Terraform, Ansible, containerd/Docker, registre d'images, Python, bash
- Observabilité : Prometheus/Grafana, DCGM exporter, Loki ou ELK, alerting
- Pratiques : GitOps, Infrastructure as Code, gestion d'incidents et de changements, post-mortems Votre profil