Recherche F/H

Il y a 15 heures

Lannion, Brittany, France Orange SA Temps plein
Publication date : Oct 01, 2026, 3:00PM La pseudonymisation consiste à remplacer les données directement identifiantes (nom, prénoms, etc.) d’un jeu de données par des données indirectement identifiantes (pseudonymes, numéro séquentiel, etc.) garantissant la protection des données personnelles (Pfitzmann & Hansen, 2005). En ce qui concerne les conversations, le remplacement doit s'effectuer soigneusement, car cela peut dégrader leur réalisme et leur cohérence. Ce sujet de stage s’inscrit dans le cadre de travaux portant sur la génération de conversations synthétiques et la simulation des utilisateurs. Afin de protéger les données personnelles, un traitement de pseudonymisation doit être mis en œuvre. L’objectif de ce stage est d’étudier les approches de pseudonymisation conversationnelles, de mettre en œuvre la plus performante d’entre elles et de l’évaluer. Il s’agira également d’évaluer l’impact de ce traitement sur d’autres tâches, telles que la génération de conversations synthétiques. Aujourd'hui les modèles génératifs peuvent réaliser cette tâche, mais les architectures encoder/decoder sont aussi performantes. Nous nous intéressons particulièrement aux modèles open source frugaux (SLM ≤8 Millard de paramètres). Il sera possible d’étudier et d’évaluer plusieurs familles de modèles : Qwen, Llama, Gemma, etc. (Pfitzmann & Hansen, 2005) Anonymity, unlinkability, unobservability, pseudonymity, and identity management-a consolidated proposal for terminology. Votre rôle Sous la responsabilité de votre maître de stage, Mme Lina Rojas-Barahona, vous collaborez aux activités de Recherche de l'équipe NADIA axées sur la génération des conversations synthétiques, dans le département DATA-AI de Orange Innovation. Vous interagissez avec différents membres de l'équipe (chercheurs, doctorant, data-scientists, développeurs). Les étapes à réaliser pendant ce stageseront les suivantes :
• Se familiariser avec les techniques, métriques et benchmarks de pseudonymisation
• Mener une réflexion sur des nouvelles métriques pour mieux évaluer la pseudonymisation en termes du réalisme et la cohérence des conversations
• Adapter (finetunning) ou prompter (prompting) des modèles existants pour cette tâche et évaluer leur performance.
• Utiliser le modèle qui performe le mieux pour pseudonymiser les vraies données conversationnelles en Français.
• Evaluer leur impact sur le réalisme et cohérence des conversations, particulièrement, leur impact pour la génération des conversations synthétiques. Dans le cadre de votre formation bac+5 (école ingénieur ou master 2 informatique ou statistiques), vous êtes à la recherche d'un stage de 6 mois.
• Vous avez des connaissances en statistiques et informatique
• Des connaissances en Python sont impératives
• Des connaissances en apprentissage statistique sont requises.
• Vous êtes familiarisé avec PyTorch
• Vous connaissez les Transformers et vous êtes familiarisé avec le code OpenSource de Huggingface
• Connaissances sur les modèles de langue génératifs
• Vous pouvez lire les articles académiques en anglais
• Participation à un projet de recherche innovant, au coeur des enjeux de l’IA moderne et de l’optimisation des ressources pour l’entraînement de LLMs.
• Encadrement par des experts reconnus en traitement automatique des langues et dialogue.
• Accès à un environnement technique de pointe et à des ressources de calcul adaptées.
• Possibilité de valorisation des travaux (publication). L’ambition de la Division Innovation est de porter plus loin l’innovation d’Orange et de renforcer son leadership technologique, en mobilisant nos capacités de recherche pour nourrir une innovation responsable au service de l’humain, éclairer les choix stratégiques du Groupe à long terme et influencer l’écosystème digital mondial. Nous formons les expertes et les experts des technologies d’aujourd’hui et de demain, et veillons à une amélioration continue de la performance de nos services et de notre efficacité. La division Innovation rassemble, dans le monde, 6000 salariés dédiés à la recherche et l’innovation dont 740 chercheurs. Porteurs d’une vision globale avec une grande diversité de profils (chercheurs, ingénieurs, designers, développeurs, data scientists, sociologues, graphistes, marketeurs, experts en cybersécurité…), les femmes et les hommes de Innovation sont à l’écoute et au service des pays, des régions et des business units pour faire d’Orange un opérateur multiservices de confiance. Au sein de Innovation, vous serez intégré(e) au sein d'une équipe de recherche à la pointe de l’innovation et de l’expertise sur le traitement automatique des langues,l’apprentissage statistique et le dialogue. Vous y bénéficierez d’un environnement stimulant : présence de nombreux chercheurs, doctorants et data scientists ; interconnexions avec les problématiques applicatives du groupe ; disponibilité de grandes infrastructures de calcul. Desired start date : Mar 01, 2027, 12:00AM At Orange, only your skills matter. Regardless of your age, gender, background, origin, religion, sexual orientation, disability, neurodiversity, or appearance, we actively encourage diversity within our teams, as it is a collective strength and a driver of innovation.
Orange is a disability-inclusive employer: please feel free to let us know about any specific needs you may have.