Tech lead Expert Data Retrieval RAG
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
- Kubernetes
Lefebvre Dalloz est la marque française du groupe européen Lefebvre, leader européen des services juridiques et fiscaux qui accompagne au quotidien plus de 275 000 clients grâce à une offre globale de contenus, de formation et de logiciels et services.
Depuis plus de 100 ans, nos rédacteurs experts de l’édition juridique et fiscale produisent des contenus fiables, actualisés en temps réel et opérationnels au quotidien. Pionnier de l’innovation dans le secteur juridique en Europe, le Groupe Lefebvre a lancé début 2024 son offre GenIA-L (IA juridique) sur l’ensemble de ses marchés accompagnant ainsi ses clients dans la transformation de leurs métiers.
Lefebvre Dalloz compte 1200 collaborateurs en France et a réalisé un chiffre d’affaires de 301millions d’euros en 2024. Sa raison d’être : activer la connaissance pour une société plus juste, efficace et durable.
Aux côtés d’une équipe d’experts passionnés au sein de l’équipe AI Service, vous relèverez les défis techniques les plus ambitieux du Groupe et du marché de l’édition juridique.
En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs. Votre travail constitue le socle qui alimente nos modèles de langage, nos moteurs de recherche et nos produits d’IA générative.
Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien.
Votre mission n’est pas d’écrire un simple script, mais de concevoir des pipelines de données robustes capables d’ingérer, nettoyer et indexer d’immenses corpus juridiques, puis d’exposer une recherche rapide et pertinente, à la fois sémantique et hybride, au service de plusieurs équipes à travers l’Europe.
Vous garantirez la fraîcheur des index, la qualité du retrieval et la pertinence des résultats tout en relevant des défis techniques complexes liés à la volumétrie, à l’hétérogénéité des sources, à la scalabilité et à l’évaluation continue des performances.
- Collecte, ingestion & indexation
Pipelines d’ingestion
- Concevoir et industrialiser la collecte de données issues de sources variées : contenus éditoriaux, open data, bases juridiques et référentiels internes.
- Concevoir les chaînes de parsing, nettoyage, normalisation et structuration des documents.
- Définir les meilleures stratégies de chunking adaptées aux usages IA et RAG.
Indexation & Embeddings
- Sélectionner et industrialiser les modèles d’embeddings adaptés aux contenus juridiques.
- Alimenter, optimiser et maintenir les bases vectorielles.
- Gérer les reconstructions d’index et garantir leur fraîcheur.
- Participer à l’amélioration continue des mécanismes de recherche documentaire.
Qualité & Volumétrie
- Garantir la scalabilité des pipelines sur des corpus documentaires massifs.
- Mettre en œuvre les mécanismes de traçabilité et de lignage des données.
- Assurer le versioning des datasets et des index.
- Recherche & Pertinence (Retrieval)
Stratégie de Retrieval
- Concevoir les mécanismes de recherche hybride combinant recherche lexicale et recherche sémantique.
- Combiner efficacement BM25, embeddings, filtrage par métadonnées et reranking.
- Optimiser la pertinence des résultats pour les utilisateurs finaux et les systèmes d’IA.
Évaluation Continue
- Construire des jeux de tests représentatifs des cas d’usage métier.
- Définir et suivre les métriques de pertinence :
- Recall
- Precision
- nDCG
- MRR
- Piloter une démarche continue d’amélioration de la qualité du retrieval.
RAG & IA Générative
- Concevoir la couche de récupération de contexte alimentant les LLM.
- Gérer les problématiques de déduplication, citations, gestion du contexte et pertinence documentaire.
- Participer à l’évolution des architectures RAG du Groupe.
Observability & Security
- Instrumenter les pipelines avec des logs, métriques et traces de qual