CS27 Bac +5 Stagiaire IA Analyse et Triage d’Incidents DevOps H/F

Il y a 7 jours

Toulouse, Occitania, France Ampere Software Technology Temps plein
Contexte Et Environnement De Travail Ampere Software Technology est une filiale tech software de Renault Group, dédiée au développement logiciel embarqué et aux systèmes d'information du véhicule de demain. Basée à Toulouse, notre équipe DevOps opère une plateforme “Software Factory”critique en environnement “on-premise” : Kubernetes, GitLab CI/CD, Prometheus, Grafana, et une stack d'analyse de logs ELK (Elasticsearch, Logstash, Kibana). Dans un contexte de transformation numérique accélérée, nous intégrons l'intelligence artificielle au cœur de nos pratiques DevOps pour améliorer la résilience de nos systèmes et réduire les temps de résolution d'incidents. La croissance de notre plateforme génère un volume croissant d'alertes, de métriques et de logs. Les équipes ops font face à un défi majeur : trier rapidement les incidents, identifier leurs causes racines et prioriser les actions correctives dans un environnement distribué complexe. L'objectif de ce stage est de concevoir et prototyper un agent IA capable d'assister les équipes dans la détection, l'analyse et le triage des incidents, en s'appuyant sur les données issues de notre stack de monitoring et d'analyse de logs. Vos Missions Le stagiaire sera pleinement acteur de la solution, de la conception à la mise en œuvre. Il sera force de proposition sur les choix techniques et architecturaux, qu'il devra argumenter et défendre auprès de l'équipe, tout en bénéficiant d'un encadrement expérimenté. Phase 1 — Agent IA sur la stack monitoring (mois 1 à 3) Analyser et comprendre les flux de données issus de Prometheus et Grafana (alertes, métriques, séries temporelles) Concevoir l'architecture de l'agent IA : pipeline de collecte, modèle de traitement, interface de restitution Prototyper un agent capable de corréler des alertes multi-sources, d'identifier des patterns d'incidents récurrents et de proposer un diagnostic en langage naturel Évaluer et proposer la stratégie LLM : GitHub Copilot (disponible en interne), modèles locaux open-source (Ollama, vLLM) ou approche hybride, avec analyse coût/ROI argumentée Phase 2 — Extension à la stack ELK / analyse de logs (mois 4 à 6) Intégrer les données de logs Kibana/Elasticsearch dans le pipeline de l'agent Enrichir les capacités de diagnostic : analyse de logs applicatifs, détection d'anomalies, identification de root cause à partir de traces Valider la solution sur des scénarios d'incidents réels ou simulés Documenter l'architecture, les choix techniques retenus et les perspectives d'industrialisation Qui êtes vous ? Étudiant(e) en dernière année d'école d'ingénieur ou de master (Bac+5), spécialisation informatique, DevOps, cloud ou data/IA Solides bases en développement backend — Python requis Curiosité et appétence pour les LLMs, les agents IA et le domaine DevOps/Ops Connaissance ou intérêt pour Kubernetes, Prometheus, Grafana et la stack ELK Capacité

à propos
er, argumenter et défendre des choix techniques devant une équipe expérimentée Autonomie, rigueur et esprit d'initiative Vous souhaitez participer à l’aventure de l’automobile de demain ? Rejoignez-nous 🚗💡