Post-doctorant·e en sociologie computationnelle appliquée à la mésinformation en santé
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Vos missions en quelques mots
Missions :
Le projet PADMEN (ANRS-MIE, 2026-2027) porte sur la production, la circulation et la réception des discours relatifs au métapneumovirus humain (HMPV) sur les plateformes numériques (Facebook, Instagram, TikTok, Bluesky, etc.). Il mobilise un corpus multilingue (anglais, français) et multi-plateformes, collecté au moyen d’APIs. La personne recrutée aura pour mission d’identifier et typologiser les discours récurrents, proposer une modélisation, puis concevoir et évaluer un modèle de détection automatique des discours vecteurs de mésinformation. Ce travail associe labélisation de corpus, spécialisation de modèles de langue, interprétation sociologique au regard des théories de la diffusion des croyances, valorisation scientifique et respect strict du cadre juridique applicable aux données numériques (RGPD).
L’objectif est d’identifier les éléments déclencheurs d’une infodémie : quels discours, quels acteurs et quels événements précèdent et alimentent l’emballement informationnel observé autour d’un pathogène comme le HMPV. La démarche est itérative : l’identification inductive des discours récurrents alimente la construction du schéma d’annotation, qui sert de base à la labélisation du corpus, puis à la spécialisation et à l’évaluation des modèles de détection. Elle articule ainsi une dimension méthodologique (état de l’art, benchmark, annotation, fine-tuning et évaluation) et une dimension théorique (sociologie de la diffusion des croyances et de la désinformation).
Activités :
L’activité
• Réaliser une revue de la littérature et un benchmark des méthodes existantes de détection et de caractérisation de la mésinformation en santé, afin d’identifier l’état de l’art, les jeux de données de référence et les verrous scientifiques du domaine.
• Préparer, nettoyer, structurer et documenter le corpus multilingue (anglais, français) consacré au HMPV, issu des différentes plateformes numériques ainsi que des bases scientométriques mobilisées par le projet.
• Identifier les discours récurrents qui traversent ce corpus, au moyen de méthodes d’analyse sémantique (analyse de discours, graphes, clustering, topic modeling, reconnaissance d’entités nommées) articulées à une lecture qualitative.
• Typologiser ces discours et les replacer dans leur contexte social et sociétal.
• Concevoir le guide d’annotation des messages, organiser et réaliser la labélisation des jeux de données en français et en anglais, et mesurer la fiabilité inter-annotateurs.
• Entraîner, spécialiser (fine-tuning) et évaluer un modèle de détection des discours vecteurs de mésinformation, fondé sur les architectures transformers (BERT/RoBERTa, SBERT, modèles de langue génératifs) ou mobilisant d’autres approches, et en documenter les performances et les limites.
• Analyser les dynamiques temporelles et relationnelles de circulation de ces discours (détection de pics d’activité, analyse de réseaux) afin d’identifier les éléments d
Voir plus sur le site emploi.cnrs.fr...
Profil recherché
Competences :
Docteur·e en sociologie ou en sciences sociales computationnelles, avec une expérience en traitement automatique des langues (NLP) appliquée aux sciences humaines et sociales et plus spécifiquement aux contenus extraits des réseaux sociaux, vous souhaitez mettre votre expérience au service d’une approche sociologique relative aux questions de santé.
Compétences
• Connaissance des concepts de la sociologie de la diffusion des croyances, des rumeurs et de la désinformation.
• Compétences en scientométrie : exploitation des bases bibliographiques (PubMed, OpenAlex, Web of Science), construction d’indicateurs et analyse des dynamiques de publication.
• Capacité à conduire une revue de la littérature et un benchmark méthodologique permettant d’identifier les méthodes existantes et les verrous scientifiques.
• Capacité à élaborer une typologie des discours articulant l’analyse du matériau textuel et la prise en compte du contexte social et sociétal : acteurs en présence, controverses, temporalités épidémiques et réception des messages de santé publique.
• Une expérience réussie dans l’analyse de grands volumes de données issues des réseaux sociaux numériques durant la pandémie de Covid-19.
• Maîtrise de la programmation en Python et de l’écosystème d’analyse de données associé (conda, pandas, scikit-learn, PyTorch, Hugging Face Transformers).
• Expérience de la labélisation de données textuelles : conception de schémas d’annotation, mesure de l’accord inter-codeurs, gestion de la qualité des jeux de données.
• Familiarité avec les architectures transformers, le fine-tuning et l’évaluation de modèles de langue pour des tâches de classification, en français comme en anglais.
• Maîtrise de l’anglais scientifique écrit et expérience de la rédaction et de la soumission d’articles dans des revues internationales à comité de lecture.
• Connaissance du cadre réglementaire applicable aux données personnelles : la maîtrise du RGPD et une exigence rigoureuse quant à son respect sont indispensables.
• Aptitude au travail en milieu pluridisciplinaire ; autonomie, rigueur, curiosité et sens du travail collectif.
• Une expérience de recherche dans le domaine de la santé (santé publique, épidémiologie, infodémiologie, communication en santé) constituerait un atout pour le projet.
• Une connaissance des discours complotistes en santé serait également appréciée.
Contraintes et risques :
Néant
Niveau d'études minimum requis
- Niveau Niveau 8 Doctorat/diplômes équivalents
- Spécialisation Formations générales
Langues
- Français Seuil