Data Scientist H/F
Il y a 6 jours
Le KremlinBicêtre, Ile-de-France
Université Paris Saclay
Temps plein
Gratuit avec email ou Google
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
Gratuit avec email ou Google
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Dans le cadre du Projet PrePsyRisk-AI, visant à évaluer l’effet du sycophantisme des LLMs (Large Language Models) sur les patients présentant une pathologie psychiatrique ou à risque d’en développer une, le Data Scientist aura pour mission de mettre en œuvre les outils techniques permettant d’une part aux participants de l’étude d’interagir avec des LLMs open source déployés localement, et d’autre part de traiter des données d’utilisation de ces LLMs pour ensuite les corréler aux données cliniques disponibles pour ces participants. CONTEXTE Date de prise de poste souhaitée 01/09/2026
- CDD de 2 ans L’essor récent des intelligences artificielles génératives, notamment les chatbots conversationnels tels que ChatGPT, Copilot ou Claude, transforme profondément les modes d’interaction entre humains et machines. Ces systèmes, conçus pour adopter des réponses empathiques, polies et validantes, favorisent une relation de confiance et d’intimité cognitive entre l’utilisateur et l’IA. Cependant, plusieurs cas récents de psychoses induites après des échanges prolongés avec ces chatbots ont été signalés dans la littérature scientifique. Des chercheurs avancent que la bienveillance systémique de l’IA ou « sycophantisme algorithmique » pourrait agir comme un facteur déclencheur et amplificateur de la confusion psychique : en cherchant à plaire et à éviter la confrontation, l’IA tend à renforcer les croyances erronées de l’utilisateur, créant une boucle de rétroaction cognitive où les délires se trouvent progressivement validés. Ce phénomène pourrait concerner une population importante : en effet, si les patients psychotiques sont à risque de décompensation induite par sycophantisme algorithmique, alors environ 1% du milliard d’usagers des chatBots conversationnels sont à risque, soit 10 Millions d’individus (ce qui correspond approximativement, à titre de comparaison, au nombre de personnes frappées par un AVC chaque année dans le monde). 1. MISSIONS
· Déploiement d’un environnement d’étude permettant l’emploi de LLMs locaux par les participants à l’étude.
· Traitement des données d’utilisation des LLMs et analyse inférentielle de ces interactions avec le devenir clinique des participants.
· Coordination technique. 2. ACTIVITÉS Déploiement d’un environnement d’étude permettant l’emploi de LLMs locaux par les participants à l’étude
· Revue de littérature scientifique et technique pour recommander un ou des modèles adaptés à l’étude.
· Analyses préalables d’interactions standardisées avec les quelques LLMs retenus pour définir une grille d’évaluation de l’intensité du sycophantisme.
· Étudier l’impact des différents paramètres du LLM sur le sycophantisme (taille du modèle, température, taille du contexte, top_k, top_p, etc.) selon les critères préalablement identifiés.
· Déploiement d’un environnement standard pour permettre aux participants à l’étude d’interagir avec le ou les LLMs retenus. Traitement des données d’utilisation des LLMs et analyse inférentielle de ces interactions avec le devenir clinique des participants
· Participation à la définition des méthodes d’analyse des différentes études.
· Mise en œuvre de l’analyse des échanges entre les participants et les LLMs permettant d’évaluer l’intensité du sycophantisme.
· Analyse descriptive des interactions entre participants et LLMs et des attributs cliniques des participants à l’étude.
· Analyse inférentielle de l’impact du contexte clinique sur les attributs de l’interaction entre les participants et les LLMs, et inversement. Coordination technique
· Supervision technique du technicien de recherche.
· Production d’une roadmap et de rapports d’avancement réguliers. Participation aux réunions de suivi avec les cliniciens chercheur, notamment pour analyser les résultats préalables et réévaluer les choix méthodologiques de traitement des données si nécessaire. Niveau de formation et/ou expérience requis :
· Niveau minimum : Ingénieur informatique /IA ou Master en Algorithmique et Modélisation ou Master Traitement Automatique du Langage o Ph.
D IA Traitement Automatique du Langage apprécié o Formation en santé publique ou en épidémiologie appréciée
· Expérience en tant qu’ingénieur IA/Traitement Automatique du langage, ou en tant qu’ingénieur full-stack o Expérience en tant que tech lead appréciée o Expérience dans la recherche en santé appréciée o Rôle de mainteneur de projets open source apprécié o Ouvert à des Post-Doc Connaissances, compétences et expériences indispensables
· Maîtrise des environnements de développement collaboratif (git, jupyter notamment), et des bonnes pratiques de développement collaboratif (revue de code, documentation, intégration continue…)
· Maîtrise des langages de programmation interprétés python3 et R, et des requêtes SQL
· Maîtrise des outils open source de déploiement de LLMs (ollama, hugging face notamment)
· Solides connaissances sur les différentes techniques et outils de NLP (Natural Language Processing) (TF/IDF, Bert, etc.), et sur
- CDD de 2 ans L’essor récent des intelligences artificielles génératives, notamment les chatbots conversationnels tels que ChatGPT, Copilot ou Claude, transforme profondément les modes d’interaction entre humains et machines. Ces systèmes, conçus pour adopter des réponses empathiques, polies et validantes, favorisent une relation de confiance et d’intimité cognitive entre l’utilisateur et l’IA. Cependant, plusieurs cas récents de psychoses induites après des échanges prolongés avec ces chatbots ont été signalés dans la littérature scientifique. Des chercheurs avancent que la bienveillance systémique de l’IA ou « sycophantisme algorithmique » pourrait agir comme un facteur déclencheur et amplificateur de la confusion psychique : en cherchant à plaire et à éviter la confrontation, l’IA tend à renforcer les croyances erronées de l’utilisateur, créant une boucle de rétroaction cognitive où les délires se trouvent progressivement validés. Ce phénomène pourrait concerner une population importante : en effet, si les patients psychotiques sont à risque de décompensation induite par sycophantisme algorithmique, alors environ 1% du milliard d’usagers des chatBots conversationnels sont à risque, soit 10 Millions d’individus (ce qui correspond approximativement, à titre de comparaison, au nombre de personnes frappées par un AVC chaque année dans le monde). 1. MISSIONS
· Déploiement d’un environnement d’étude permettant l’emploi de LLMs locaux par les participants à l’étude.
· Traitement des données d’utilisation des LLMs et analyse inférentielle de ces interactions avec le devenir clinique des participants.
· Coordination technique. 2. ACTIVITÉS Déploiement d’un environnement d’étude permettant l’emploi de LLMs locaux par les participants à l’étude
· Revue de littérature scientifique et technique pour recommander un ou des modèles adaptés à l’étude.
· Analyses préalables d’interactions standardisées avec les quelques LLMs retenus pour définir une grille d’évaluation de l’intensité du sycophantisme.
· Étudier l’impact des différents paramètres du LLM sur le sycophantisme (taille du modèle, température, taille du contexte, top_k, top_p, etc.) selon les critères préalablement identifiés.
· Déploiement d’un environnement standard pour permettre aux participants à l’étude d’interagir avec le ou les LLMs retenus. Traitement des données d’utilisation des LLMs et analyse inférentielle de ces interactions avec le devenir clinique des participants
· Participation à la définition des méthodes d’analyse des différentes études.
· Mise en œuvre de l’analyse des échanges entre les participants et les LLMs permettant d’évaluer l’intensité du sycophantisme.
· Analyse descriptive des interactions entre participants et LLMs et des attributs cliniques des participants à l’étude.
· Analyse inférentielle de l’impact du contexte clinique sur les attributs de l’interaction entre les participants et les LLMs, et inversement. Coordination technique
· Supervision technique du technicien de recherche.
· Production d’une roadmap et de rapports d’avancement réguliers. Participation aux réunions de suivi avec les cliniciens chercheur, notamment pour analyser les résultats préalables et réévaluer les choix méthodologiques de traitement des données si nécessaire. Niveau de formation et/ou expérience requis :
· Niveau minimum : Ingénieur informatique /IA ou Master en Algorithmique et Modélisation ou Master Traitement Automatique du Langage o Ph.
D IA Traitement Automatique du Langage apprécié o Formation en santé publique ou en épidémiologie appréciée
· Expérience en tant qu’ingénieur IA/Traitement Automatique du langage, ou en tant qu’ingénieur full-stack o Expérience en tant que tech lead appréciée o Expérience dans la recherche en santé appréciée o Rôle de mainteneur de projets open source apprécié o Ouvert à des Post-Doc Connaissances, compétences et expériences indispensables
· Maîtrise des environnements de développement collaboratif (git, jupyter notamment), et des bonnes pratiques de développement collaboratif (revue de code, documentation, intégration continue…)
· Maîtrise des langages de programmation interprétés python3 et R, et des requêtes SQL
· Maîtrise des outils open source de déploiement de LLMs (ollama, hugging face notamment)
· Solides connaissances sur les différentes techniques et outils de NLP (Natural Language Processing) (TF/IDF, Bert, etc.), et sur