Admin Système HPC
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
Contexte de la mission (N2)
Dans le cadre d'un projet stratégique de modernisation et d'exploitation d'une infrastructure de calcul intensif au sein d'un grand organisme public réglementaire, nous recherchons un(e) Administrateur(trice) Systèmes HPC confirmé(e). L'environnement s'inscrit dans un contexte de haute disponibilité et d'exigences de sécurité strictes, en lien avec des missions critiques de simulation et d'analyse scientifique.
Responsabilités principales
- Administration et maintien en condition opérationnelle des clusters de calcul (Linux RHEL/Rocky, 500–2000+ nœuds)
- Gestion des ordonnanceurs de jobs (Slurm): configuration des partitions, QoS, accounting et optimisation du scheduling
- Administration des systèmes de fichiers parallèles (Lustre, GPFS/Spectrum Scale): tuning I/O, gestion des quotas, surveillance des performances
- Déploiement et gestion des environnements logiciels scientifiques via Environment Modules et Spack
- Supervision des réseaux haute performance (InfiniBand HDR/HDR100, Ethernet RoCE)
- Support utilisateur de niveau 2: diagnostic de problèmes de performance, aide à l'optimisation d'applications scientifiques
- Contribuer à l'automatisation des opérations (Ansible, scripts Bash/Python)
- Participer aux astreintes et gérer les incidents critiques en lien avec l'équipe senior
- Rédiger la documentation technique et les procédures d'exploitation
Compétences techniques requises
Systèmes & infrastructure
- Linux avancé (RHEL/Rocky Linux/CentOS) – administration à grande échelle
- Virtualisation et conteneurisation: KVM, Singularity/Apptainer
- Outils d'automatisation: Ansible (maîtrise opérationnelle), Puppet (connaissance appréciée)
- Scripting: Bash (avancé), Python (maîtrise fonctionnelle)
HPC
- Ordonnanceur Slurm: configuration, partitions, accounting, QoS
- Systèmes de fichiers parallèles: Lustre et/ou GPFS (exploitation et tuning)
- Réseaux HPC: InfiniBand, Ethernet haut débit
- Gestion des stacks logicielles scientifiques: Spack, Environment Modules
Monitoring & sécurité
- Outils de supervision: Prometheus/Grafana, Nagios/Zabbix
- Sécurité Linux: hardening, gestion des accès, audit (conformité SI sensible)
- Gestion des identités: LDAP/Active Directory
Profil et expérience attendus
- Formation supérieure en informatique, systèmes ou domaine connexe (Bac+3 à Bac+5)
- 3 à 6 ans d'expérience en administration systèmes, dont au moins 2 ans en environnement HPC ou datacenter critique
- Expérience en environnement réglementé ou sécurisé appréciée
- Capacité à travailler en équipe et à communiquer avec des utilisateurs scientifiques exigeants
- Rigueur, autonomie dans le cadre défini, sens du service
- Maîtrise du français (langue de travail); anglais technique lu/écrit
Modalités pratiques
Rythme de présence
- 2 jours sur site / 3 jours en télétravail par semaine
Durée de la mission
- 12 mois renouvelables
Astreintes
- Participation aux astreintes de niveau 2 (planning partagé)
Déplacements
- Ponctuels sur site client (Île-de-France)
Contexte de la mission (N3)
Dans le cadre d'un projet de modernisation d'infrastructure HPC critique, nous recherchons un(e) Ingénieur(e) Systèmes HPC de niveau expert pour piloter des activités techniques à forte valeur ajoutée : architecture, optimisation avancée, intégration de nouveaux composants matériels et logiciels, et transfert de compétences. Le profil exercera en pleine autonomie, en lien étroit avec l'équipe d'exploitation et les équipes scientifiques du client.
Responsabilités principales
- Référent technique de niveau 3 sur l'ensemble de la stack HPC (ordonnancement, stockage parallèle, réseaux, sécurité)
- Conception et implémentation d'architectures HPC et de stockage haute performance pour répondre aux besoins scientifiques
- Optimisation avancée des systèmes de fichiers parallèles (Lustre, GPFS): tuning fin, diagnostics de performance I/O, gestion de la résilience
- Expertise sur les interconnexions InfiniBand (HDR/NDR): configuration UCX, diagnostics fabric, intégration MPI
- Pilotage des enjeux GPU : intégration d'accélérateurs (AMD/NVIDIA), configuration des drivers et des stacks ROCm/CUDA
- Conseil et support N3 aux équipes internes et aux utilisateurs scientifiques sur l'optimisation d'applications (profiling, portage, scaling MPI)
- Définition et mise en œuvre de la politique de sécurité des systèmes HPC (hardening, gestion des accès