KERING Cloud Engineer SRE

Il y a 6 jours

Paris, Ile-de-France Temps plein
Groupe de luxe mondial né d’une histoire familiale et entrepreneuriale, Kering réunit un ensemble de Maisons reconnues pour leur créativité en matière de couture et de prêt-à porter, de maroquinerie, de joaillerie, de lunetterie et de beauté : Gucci, Saint Laurent, Bottega Veneta, Balenciaga, McQueen, Brioni, Boucheron, Pomellato, Dodo, Qeelin, Ginori 1735, ainsi que Kering Eyewear. Inspirées par leur histoire et par leur patrimoine, les Maisons du Groupe conçoivent et façonnent des produits et des expériences d'exception qui reflètent l’engagement de Kering pour l’excellence, le développement durable et la culture. Cette vision s’incarne dans la signature du Groupe : Creativity is our Legacy. Comptant 44 000 collaborateurs, Kering a réalisé un chiffre d’affaires de 14,7 milliards d’euros en 2025. Au sein de la Direction Tech & Digital de Kering, le DevSecOps Studio conçoit, opère et fiabilise les plateformes et produits digitaux du Groupe. Le Studio recrute un Cloud Engineer (SRE) afin de renforcer la fiabilité de ses environnements de production et d’accompagner le passage à l’échelle de ses pratiques d’ingénierie augmentée par l’IA. Nous sommes actuellement à la recherche d’un(e) Cloud Engineer (SRE – Site Reliability Engineering) (H/F) pour intégrer l'équipe. Votre opportunité Au sein du DevSecOps Studio, vous contribuez au développement et à la résilience de produits digitaux à grande échelle selon un modèle AI-SDLC, où l’ingénierie augmentée par l’IA constitue la méthode de travail de référence et non un outil optionnel : de la discovery technique à la mise en production, en passant par la génération de code, les tests et la documentation. Comment vous allez contribuer Infrastructure Cloud et Kubernetes. Vous exploitez et optimisez l’infrastructure Cloud, administrez et maintenez les clusters Kubernetes de production. Vous définissez et suivez les SLOs et error budgets des services critiques, et contribuez à l’amélioration de la conception et de l’architecture de l’infrastructure. IaC, FinOps et automatisation. Vous concevez, construisez et maintenez l’infrastructure avec Terraform et Packer, et automatisez les workflows via des pipelines CI/CD (GitHub Actions). Vous pilotez l’optimisation des coûts cloud en collaboration avec l’équipe FinOps : suivi des dépenses, identification des gaspillages et mise en œuvre de recommandations mesurables. Vous utilisez les outils d’IA assistée (GitHub Copilot, Claude Code) comme pratique standard dans la production de code Terraform, de runbooks et de pipelines CI/CD, conformément à la politique d’usage des outils IA du Studio. Observabilité, résilience et chaos engineering. Vous maintenez et améliorez la stack d’observabilité (ELK, Grafana, APM, distributed tracing) et garantissez la qualité de la surveillance, des alertes et de la visibilité système. Vous implémentez des pratiques de chaos engineering pour tester et renforcer la résilience de la plateforme de manière proactive. Vous transformez les incidents en améliorations durables via des post-mortems structurés et pilotez la réduction du toil par l’automatisation. Fiabilité des workloads IA. Vous définissez et suivez des SLOs spécifiques aux services IA : latence LLM, taux d’erreur des agents, disponibilité du LLM Gateway (Galassia). Vous implémentez l’observabilité des pipelines agentiques, du tracing des appels MCP au monitoring de la consommation de tokens et à la détection des dérives de comportement. Vous contribuez à la résilience des Discovery et Run Squads en fournissant les outils de monitoring nécessaires à chaque incrément AI-SDLC. IA et excellence ingénierie. Vous intégrez des outils d’IA et d’automatisation intelligente dans les workflows SRE : détection d’anomalies, réponse aux incidents assistée par IA, génération de runbooks. Vous concevez et opérez des agents SRE dédiés au triage d’incidents, à la génération automatisée de runbooks et à l’analyse de root cause. Vous promouvez l’IaC, l’automatisation et les bonnes pratiques DevSecOps, et accompagnez les équipes dans l’adoption des outils et pratiques de la plateforme. Qui êtes-vous Vous justifiez de 5 à 8 ans d’expérience en ingénierie infrastructure ou plateforme, dont au moins 2 à 3 ans sur des environnements de production à fort trafic, en tant que SRE, Platform Engineer ou DevOps Engineer. Vous maîtrisez AWS (API Gateway, CloudFront, ECS, EKS, ALB), Terraform à un niveau avancé et Kubernetes en production, ainsi qu’Ansible et GitHub Actions. Vous êtes à l’aise avec la stack d’observabilité ELK et Grafana, avec Linux et les fondamentaux réseau (TCP/IP), et avec les concepts de SLO, SLI, error budget et FinOps. Une connaissance multi-cloud est appréciée. Vous pratiquez effectivement les outils AI-SDLC (Copilot, Claude Code ou équivalent) dans votre quotidien d’ingénierie et savez concevoir des automatisations SRE assistées par LLM, du triage à la génération de runbooks et de post-mortems, sur une plateforme LLM Gate