Senior LLM Inference Engineer – Distributed AI Serving
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
Bull recherche un Staff/Principal LLM Inference Engineer pour piloter la pile d'inférence BullSequana AI et son intégration hardware. Vous dirigerez des architectures d'inférence natives Kubernetes, avec du déploiement multi-nœuds et des pipelines multimodaux sur des infrastructures souveraines sur site, cloud ou hybride.
Le rôle combine leadership technique et travail hands-on, en collaboration avec Data, IA, Foundation et le hardware, visant à réduire le coût par token et la latence tout en