Stage - Conception et évaluation d'une approche Speech-to-Speech sous contrainte de ressources F/H
Il y a 3 jours
CessonSévigné, Brittany, France
Orange SA
Temps plein
Gratuit avec email ou Google
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
Gratuit avec email ou Google
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Publication date : Oct 02, 2026, 2:21PM
Les systèmes Speech-to-Speech récents [1,2] permettent des interactions vocales naturelles, parfois en full-duplex, avec gestion des interruptions et déclenchement d’actions. De plus, il est désormais possible grâce à certains benchmarks [3] d’évaluer ces capacités dans des scénarios réalistes.
Ces modèles restent toutefois souvent coûteux, difficiles à adapter et peu simples à déployer on-premise. L’objectif du stage sera d’étudier la conception d’un système Speech-to-Speech compact et adapté à un cas d’usage applicatif.
Le stage s’articulera autour de deux axes :
• réductiondu coût d’un modèle Speech-to-Speech (compression, optimisation de latence, distillation par bloc)
• adaptation à un cas d’usage agentique spécifique et limité, dans lequel le système pourra maintenir un état structuré du dialogue, recueillir les informations nécessaires au remplissage d’un formulaire et déclencher des actions (par exemple interroger une base de données ou appeler une API) tout en restant transparent pour l’utilisateur. Références : [1] Défossez, A., Mazaré, L., Orsini, M., Royer, A., Pérez, P., Jégou, H., Grave, E. and Zeghidour, N. (2024) ‘Moshi: A speech-text foundation model for real-time dialogue’. [2] Lin, G.-T., Chen, C., Chen, Z. and Lee, H.-Y. (2026) ‘Full-Duplex-Bench-v3: Benchmarking tool use for full-duplex voice agents under real-world disfluency’. [3] NVIDIA NemotronLabs VoiceChat 11B: https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B Fin d’études (M2 école d’ingénieur ou université), spécialisation IA/ML/traitement de la parole. Vos hard
skills:
• Connaissances poussées en apprentissage profond (architectures, algorithmes et méthodes)
• Excellente maîtrise de Python (NumPy, pandas) et de PyTorch
• Connaissance des librairies Hugging Face Transformers
• Environnement de dev: Git, Linux, Docker, Slurm
• Une première expérience en parole ou en lien avec le sujet du stage est un plus. Vos soft
skills:
• Vous êtes rigoureux et attentif aux détails.
• Vous êtes curieux, aimez comprendre les mécanismes et tester vos hypothèses.
• Vous êtes autonome et respectez les délais. Vous savez collaborer avec d’autres et demandez de l’aide quand nécessaire.
• Vous communiquez simplement vos résultats : rédaction et diffusion scientifique de base, structuration de résultats, figures/tables claires (LaTeX apprécié)
• Vous documentez vos travaux de manière claire. Un sujet de recherche appliquée à fort apprentissage, au cœur de la R&D IA d’Orange, avec accès à des ressources de calcul (CPU/GPU).
• Un encadrement scientifique: mentorat dédié, relectures méthodologiques et séminaires internes.
• Un cadre de travail bienveillant avec un accès à un écosystème d’experts Data/IA. Vos travaux pourront être valorisés par des séminaires internes, un rapport technique structuré, un package de reproductibilité (code, scripts, documentation) et, selon la maturité des résultats, une contribution open source. Une soumission d’article scientifique (par exemple atelier/conférence spécialisée: Interspeech, ICASSP, ASRU/SLT) pourra être envisagée en co‑rédaction avec l’équipe. Au sein de l'entité Data AI d’Orange Innovation, l’équipe MAS rassemble environ 25 chercheurs, ingénieurs, développeurs, data scientists, doctorants et apprentis spécialisés. L'équipe mène des travaux de R&D sur les technologies de la parole au sens large : reconnaissance automatique de la parole (ASR) multilingue, diarisation, synthèse vocale (TTS), évaluation et optimisation des modèles. Nous ancrons nos recherches dans la méthode scientifique : revue de littérature, formulation d’hypothèses, protocoles expérimentaux robustes, analyse statistique et reproductibilité. Nos résultats sont partagés via rapports techniques, séminaires internes, contributions open source et, lorsque pertinent, soumissions à des ateliers/conférences internationales spécialisées. Desired start date : Feb 01, 2027, 12:00AM At Orange, only your skills matter. Regardless of your age, gender, background, origin, religion, sexual orientation, disability, neurodiversity, or appearance, we actively encourage diversity within our teams, as it is a collective strength and a driver of innovation.
Orange is a disability-inclusive employer: please feel free to let us know about any specific needs you may have.
• réductiondu coût d’un modèle Speech-to-Speech (compression, optimisation de latence, distillation par bloc)
• adaptation à un cas d’usage agentique spécifique et limité, dans lequel le système pourra maintenir un état structuré du dialogue, recueillir les informations nécessaires au remplissage d’un formulaire et déclencher des actions (par exemple interroger une base de données ou appeler une API) tout en restant transparent pour l’utilisateur. Références : [1] Défossez, A., Mazaré, L., Orsini, M., Royer, A., Pérez, P., Jégou, H., Grave, E. and Zeghidour, N. (2024) ‘Moshi: A speech-text foundation model for real-time dialogue’. [2] Lin, G.-T., Chen, C., Chen, Z. and Lee, H.-Y. (2026) ‘Full-Duplex-Bench-v3: Benchmarking tool use for full-duplex voice agents under real-world disfluency’. [3] NVIDIA NemotronLabs VoiceChat 11B: https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B Fin d’études (M2 école d’ingénieur ou université), spécialisation IA/ML/traitement de la parole. Vos hard
skills:
• Connaissances poussées en apprentissage profond (architectures, algorithmes et méthodes)
• Excellente maîtrise de Python (NumPy, pandas) et de PyTorch
• Connaissance des librairies Hugging Face Transformers
• Environnement de dev: Git, Linux, Docker, Slurm
• Une première expérience en parole ou en lien avec le sujet du stage est un plus. Vos soft
skills:
• Vous êtes rigoureux et attentif aux détails.
• Vous êtes curieux, aimez comprendre les mécanismes et tester vos hypothèses.
• Vous êtes autonome et respectez les délais. Vous savez collaborer avec d’autres et demandez de l’aide quand nécessaire.
• Vous communiquez simplement vos résultats : rédaction et diffusion scientifique de base, structuration de résultats, figures/tables claires (LaTeX apprécié)
• Vous documentez vos travaux de manière claire. Un sujet de recherche appliquée à fort apprentissage, au cœur de la R&D IA d’Orange, avec accès à des ressources de calcul (CPU/GPU).
• Un encadrement scientifique: mentorat dédié, relectures méthodologiques et séminaires internes.
• Un cadre de travail bienveillant avec un accès à un écosystème d’experts Data/IA. Vos travaux pourront être valorisés par des séminaires internes, un rapport technique structuré, un package de reproductibilité (code, scripts, documentation) et, selon la maturité des résultats, une contribution open source. Une soumission d’article scientifique (par exemple atelier/conférence spécialisée: Interspeech, ICASSP, ASRU/SLT) pourra être envisagée en co‑rédaction avec l’équipe. Au sein de l'entité Data AI d’Orange Innovation, l’équipe MAS rassemble environ 25 chercheurs, ingénieurs, développeurs, data scientists, doctorants et apprentis spécialisés. L'équipe mène des travaux de R&D sur les technologies de la parole au sens large : reconnaissance automatique de la parole (ASR) multilingue, diarisation, synthèse vocale (TTS), évaluation et optimisation des modèles. Nous ancrons nos recherches dans la méthode scientifique : revue de littérature, formulation d’hypothèses, protocoles expérimentaux robustes, analyse statistique et reproductibilité. Nos résultats sont partagés via rapports techniques, séminaires internes, contributions open source et, lorsque pertinent, soumissions à des ateliers/conférences internationales spécialisées. Desired start date : Feb 01, 2027, 12:00AM At Orange, only your skills matter. Regardless of your age, gender, background, origin, religion, sexual orientation, disability, neurodiversity, or appearance, we actively encourage diversity within our teams, as it is a collective strength and a driver of innovation.
Orange is a disability-inclusive employer: please feel free to let us know about any specific needs you may have.