Les missions du poste


Description du Poste Les Missions Le Centre National de la Recherche Scientifique (CNRS) recrute un·e ingénieur·e en traitement et analyse de bases de données du système Terre avec une expertise en IA générative, architectures agentiques et une connaissance des données environnementales afin de contribuer à la mise en place d'une chaîne de traitement permettant de transformer des données scientifiques FAIR en données « IA-native », adaptées à l'entraînement, l'évaluation et la validation de modèles d'intelligence artificielle.Le poste s'inscrit dans les activités de l'infrastructure de recherche nationale Data Terra et du projet européen Horizon Europe GenAI4Earth, coordonné par le CNRS. Le projet rassemble 17 partenaires académiques et industriels issus de dix pays européens autour du développement de nouvelles générations de services d'IA pour les données environnementales, géospatiales et scientifiques. Data Terra pilote par ailleurs un noeud thématique de l'European Open Science Cloud (EOSC) et contribue à plusieurs projets européens stratégiques (EOSC-ARENA, CDIF4EOSC, FLUID-AI) liés aux infrastructures numériques scientifiques, à l'IA de confiance et aux services FAIR de données environnementales.La personne recrutée aura pour missions :- de développer des outils d'analyse (accessibles par Environnement Virtuel de Recherche -VRE/Jupyter-) pour préparer, qualifier, annoter et contrôler la qualité des données et métadonnées, ainsi que pour constituer des benchmarks de référence destinés à l'évaluation des modèles d'IA.- de constituer, contextualiser et de documenter des jeux de données de référence (« golden benchmarks ») pour l'entraînement, la validation et le test de modèles fondation IA.Le poste se situe à l'interface entre science des données, gestion et qualification des données scientifiques, intelligence artificielle et sciences du système Terre-Environnement. Le poste sera intégré à l'équipe de coordination de Data Terra, en interaction étroite avec plusieurs laboratoires du CNRS et partenaires européens, notamment GFZ, CSIC, TUM, WUR, University of Edinburgh et INRIA. L'agent·e sera affecté·e à l'Unité d'Appui et de Recherche (UAR) Data Terra, infrastructure de recherche nationale dédiée aux données et services numériques pour l'observation du système Terre-Environnement (atmosphère, océans, surfaces continentales, Terre solide et biodiversité).L'ingénieur·e développera des outils opérationnels, mobilisant l'intelligence artificielle, pour la préparation et l'analyse de données scientifiques environnementales dans le cadre des activités du projet européen GenAI4Earth et du noeud EOSC de Data Terra.L'ingénieur-e aura pour mission de concevoir et développer des chaînes de traitement permettant de rendre des données scientifiques IA-natives, depuis leur préparation, harmonisation et contrôle qualité jusqu'à leur annotation, qualification et documentation. Il/elle développera des outils d'annotation et de labellisation, en interaction étroite avec les experts scientifiques, et contribuera à la constitution de jeux de données de référence pour l'entraînement et l'évaluation des modèles d'IA. Il/elle assurera la traçabilité, le versionnement, la reproductibilité et la documentation FAIR des données et traitements. Ces développements seront intégrés dans des workflows et notebooks reproductibles au sein d'environnements VRE/Jupyter. L'Activité Les activités porteront sur :le développement de workflows de préparation, transformation, harmonisation et contrôle qualité des données mobilisés dans le projet,la définition et mise en oeuvre des méthodes de qualification de données « IA-natives»,le développement d'outils d'annotation et de labellisation de données par des experts scientifiques, à travers la mise en place de fonctionnalités assistées par IA,la constitution et la documentation de jeux de données de référence (« golden standard ») pour l'entraînement, la validation et le test de modèles d'IA générative.la mise en oeuvre de procédures de contrôle, validation, versionnement et traçabilité des annotations.le développement de notebooks et workflows reproductibles dans un environnement VRE/Jupyter.la documentation FAIR des données, méthodes, traitements et jeux de référence produits.la participation aux échanges avec les chercheurs et experts scientifiques impliqués dans les cas d'étude.Les développements seront réalisés sur trois cas d'usage complémentaires, avec constitution d'outils d'annotation et de benchmarks pour l'IA :Données sismologiques par fibre optique : préparation, exploration, annotation et labellisation de séries temporelles issues de systèmes d'acquisition Distributed Acoustic Sensing (DAS), et de résultats de modèles IA en lien avec les catalogues de données DAS du pôle FormaTerre de Data Terra ;Données géospatiales d'observation de la Terre-Environnement : données et mesures multi-sources (satellitaires et in situ issues notamment de capteurs environnementaux) en milieux urbains et forestiers en lien, en particulier dans le cadre des données Portail Urbain (impliquant les pôles AERIS et THEIA) et de l'Initiative One Forest Vision (impliquant les pôles THEIA et PNDB) ;Métadonnées scientifiques : annotation, qualification et structuration de métadonnées afin de constituer des corpus de référence pour l'évaluation de modèles LLMs.Le poste s'inscrit dans un environnement international dynamique consacré à la science ouverte, au suivi environnemental et aux infrastructures numériques mobilisant l'IA pour les données du système Terre-environnement. La personne recrutée interagira avec plusieurs laboratoires, organisations et infrastructures européennes majeures. Votre Profil Compétences Profil recherchéDe préférence une formation de niveau Bac +5 en gestion de base de données, science des données, intelligence artificielle, sciences de la Terre et/ou géomatique.Expérience en manipulation de données scientifiques multidimensionnelles, séries temporelles, données géophysiques et/ou données géospatiales.Très bonne maîtrise de Python/Julia et des environnements Jupyter/JupyterLab.Connaissance des méthodes d'apprentissage machine et de préparation de données pour l'apprentissage.Maîtrise de Git et des pratiques de développement collaboratif.Capacité à concevoir des workflows reproductibles et documentés.Expérience en infrastructures cloud/HPC et environnements GPU.Connaissance de l'observation de la Terre et/ou de la géophysique/sismologie.Compétences techniques complémentaires : Connaissances des frameworks NumPy, pandas, xarray, GeoPandas, rasterio, GDAL.Connaissances des frameworks PyTorch ou autre framework de deep learning.Connaissance des formats de données NetCDF, Zarr, Parquet, GeoTIFF.Connaissance Docker/Apptainer, HPC ou cloud.Expérience en annotation de données ou constitution de datasets pour l'IA.Savoir-faireAnalyser un besoin scientifique et le traduire en spécification technique opérationnelle,Piloter et structurer un projet de bout en bout (planification, reporting, respect des délais),Expérience dans des projets internationaux multi-partenaires et capacité à s'intégrer dans des environnements collaboratifs complexes,Très bonnes compétences rédactionnelles pour la production de rapports, livrables et documentations Maîtriser le français et l'anglais écrit et oral.Anticiper les évolutions technologiques et proposer des orientations techniques pertinentes.Savoir-êtreSens de l'initiative, autonomie, rigueur,Vision stratégique et esprit d'innovationCapacités d'organisation, d'encadrement et d'animationGoût pour le travail en équipe et en mode projet.Capacité à dialoguer avec des chercheurs et experts de domaines scientifiques différents. Votre Environnement de Travail Le poste s'inscrit dans un environnement international de premier plan consacré aux infrastructures numériques scientifiques, à la science ouverte, aux données FAIR du système Terre, et à l'évaluation de modèles IA pour les sciences du système Terre. La personne recrutée travaillera en interaction avec les équipes scientifiques et techniques de Data Terra ainsi qu'avec des partenaires académiques et technologiques français et européens.Les développements seront réalisés principalement en Python, dans des environnements virtuels de recherche Jupyter/VRE, avec une attention particulière portée à la reproductibilité, l'interopérabilité, la traçabilité et la réutilisation des données et workflows. Contraintes et risques Aucun risque identifié. Des missions sont à prévoir auprès des partenaires du projet. Rémunération et avantages Rémunération A partir de 2521,95€ brut mensuel ajustable en fonction de l'expérience professionnelle sur des postes de niveau équivalent Congés et RTT annuels 44 jours Pratique et Indemnisation du TT Pratique et indemnisation du TT Transport Prise en charge à 75% du coût et forfait mobilité durable jusqu'à 300€ À propos de l'offre Référence de l'offre UAR2013-JEAMAL-009 Secteur d'activité Sciences Humaines et Sociales Emploi type Ingenieur d'etudes en production, traitement, analyse de donnees et enquetes (H/F) Expérience souhaitée 1 à 4 années À propos du CNRS Le CNRS est un acteur majeur de la recherche fondamentale à une échelle mondiale. Le CNRS est le seul organisme français actif dans tous les domaines scientifiques. Sa position unique de multi-spécialiste lui permet d'associer les différentes disciplines pour affronter les défis les plus importants du monde contemporain, en lien avec les acteurs du changement. Le CNRS Les métiers de la recherche

Compétences requises

  • Docker
  • Gestion des données
  • Python
  • Anglais
  • Travail en équipe
  • Gestion de base de données
  • Intelligence artificielle
  • Autonomie
  • Pro-activité
  • Analyse de données
  • Git
  • Contrôle qualité
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Recherches similaires

L’emploi par métier dans le domaine Logistique à Strasbourg