Data Scientist

Il y a 19 heures

Lyon, Rhône-Alpes, France Collective.work Temps plein
Taux journalier (TJM): 430 à 470 €/j A LIRE ATTENTIVEMENT AVANT DE POSTULER 2 jours de télétravail / semaine
- Lyon (03)
- Expérience de 5 ans minimum Vous êtes Data Scientist expérimenté.e et souhaitez travailler sur des problématiques qui combinent analyse statistique, traitement de données massives et industrialisation ? Nous recherchons un.e Data Scientist capable d'intervenir de bout en bout : de la compréhension du besoin métier jusqu'à la mise en production de traitements de données, avec un enjeu particulier autour de Python, PySpark et des données spatiales avec GeoPandas. Votre rôle Vous travaillerez directement avec les experts métiers pour comprendre leurs problématiques, identifier les données pertinentes et construire les traitements permettant d'y répondre. Concrètement, vous serez amené.e à :
- participer aux ateliers avec les experts métiers pour recueillir et préciser leurs besoins
- rechercher les données pertinentes et réaliser les analyses exploratoires
- concevoir et développer les traitements de données
- mener des études statistiques
- développer, lorsque le besoin le nécessite, des modèles de Machine Learning
- restituer vos analyses sous forme de rapports d'étude ou de tableaux de bord
- porter des codes d'expérimentation ou d'étude vers PySpark afin de permettre leur industrialisation. Vous contribuerez également à la veille sur les méthodes et outils de Data Science, ainsi qu'au partage des bonnes pratiques. Un rôle qui ne s'arrête pas à la modélisation Le poste comporte une dimension importante de cadrage et d'industrialisation. Vous pourrez intervenir directement auprès des métiers, sans participation systématique d'un Product Owner ou d'un Product Manager. Vous devrez donc être à l'aise pour recueillir un besoin, animer des ateliers et traduire les problématiques rencontrées en solutions data. Vous participerez également à la rédaction des documents de cadrage et pourrez proposer des architectures de traitements et des modèles de données destinés à la production. Environnement technique Vous travaillerez principalement avec : Python
- PySpark
- Hadoop
- PostgreSQL
- Power BI
- GitLab
- GitLab CI/CD
- Jira
- Confluence Côté Python, l'environnement comprend notamment : Pandas
- Polars
- Scikit-learn -Matplotlib
- XGBoost
- Pandera
- GeoPandas Les compétences indispensables pour cette mission Trois critères sont particulièrement importants : 1. Une expérience confirmée en Data Science Vous justifiez de plus de 5 ans d'expérience en Data Science et avez déjà travaillé sur plusieurs dimensions du métier : recueil des besoins, analyse statistique, Machine Learning et traitement de données massives pouvant représenter plusieurs dizaines de millions de lignes. 2. Une expertise Python avec une forte composante géospatiale Vous maîtrisez Python et ses principales librairies de Data Science. Une expérience concrète de GeoPandas et de traitements spatiaux lourds, portant sur plusieurs dizaines de millions de géométries, est indispensable. Vous avez également déjà développé des traitements avec PySpark. 3. Une expérience de l'industrialisation Vous avez déjà industrialisé des traitements Data Science lourds et êtes capable de contribuer aux choix d'architecture concernant les traitements et les modèles de données. Cette expérience doit notamment concerner au moins l'un des types de données suivants : données spatiales, textuelles, séries temporelles ou graphes. Ce qui sera également apprécié Une expérience sur l'un ou plusieurs de ces sujets constituera un plus :
- modélisation Machine Learning appliquée aux séries temporelles
- données modélisées sous forme de graphes
- MLOps
- connaissance du secteur de l'énergie. Vous êtes également à l'aise pour présenter vos analyses de manière pédagogique, notamment à travers des tableaux de bord Power BI, et pour animer des groupes de travail autour des organisations et processus métiers. Si vous vous

Experience:
Débutant accepté