PhD: 3D-Aware Multi-Object Tracking
Il y a 1 semaine
La BoissièredesLandes, Pays de la Loire, France
IDEMIA Public Security
Temps plein
Gratuit avec email ou Google
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
Gratuit avec email ou Google
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Description du poste
• Étudier et développer des algorithmes de suivi multi-objets (MOT) robustes, efficaces et fonctionnant en temps réel, avec un intérêt particulier pour les architectures MOT end-to-end, telles que MOTIP2, ainsi que pour le suivi de piétons dans des scénarios soumis à des occlusions importantes.
• Explorer des représentations amodales et sensibles à la 3D afin d’améliorer les performances du suivi, tout en prenant en compte les contraintes de calcul et de ressources propres aux dispositifs edge / périphériques.
• Concevoir des méthodologies expérimentales et des benchmarks permettant d’évaluer les approches proposées par rapport aux méthodes MOT de l’état de l’art et sur des jeux de données représentatifs de situations réelles.
• Contribuer à la conception, à l’implémentation et à la validation de prototypes, avec un premier focus sur le suivi monoculaire et des extensions futures vers le suivi multi-caméras.
• Assurer une veille scientifique sur les avancées en vision par ordinateur, suivi multi-objets, perception amodale et compréhension 3D des scènes, afin d’identifier les innovations pertinentes et de les transférer vers des applications industrielles.
• Communiquer les résultats de recherche auprès des communautés de recherche et d’ingénierie d’IDEMIA et de Télécom Paris, et contribuer à la rédaction de publications scientifiques et d’articles soumis à des conférences et journaux de premier plan en vision par ordinateur et apprentissage automatique. Description du profil :
• Solides connaissances en deep learning, notamment des architectures de type Transformer (mécanismes d’attention, modèles basés sur des requêtes de type DETR).
• Expérience en vision par ordinateur, notamment dans une ou plusieurs des tâches suivantes : détection d’objets, suivi d’objets et/ou vision 3D et géométrique (estimation de profondeur, représentations neuronales de scènes).
• Maîtrise de Python et PyTorch.
• Une connaissance des modèles vision-langage / modèles fondamentaux (foundation models), tels que les modèles contrastifs de type CLIP ou les détecteurs à vocabulaire ouvert (open-vocabulary detectors), constitue un plus.