Taux journalier (TJM): 595€
CONTEXTE
Au sein de l'équipe « Qualité des données » du Pôle Data/IA de notre client, ce remplacement vise à renforcer la capacité de l'équipe à explorer, comprendre et analyser les données en profondeur. L'objectif est d'identifier les anomalies, d'en rechercher les causes racines et de proposer des solutions de contrôle et de fiabilisation adaptées.
MISSIONS
*
Explorer et comprendre des jeux de données complexes.
*
Réaliser des analyses statistiques et des diagnostics de qualité.
*
Identifier, catégoriser et mesurer les anomalies.
*
Rechercher les causes racines des problèmes observés.
*
Définir des indicateurs de qualité et des niveaux de confiance.
*
Concevoir et tester des règles de contrôle, de normalisation et de correction.
*
Mettre en œuvre des méthodes de rapprochement et de matching de données.
*
Analyser des données textuelles à l'aide de techniques NLP, Regex ou de similarité.
*
Expérimenter et comparer différentes méthodes de fiabilisation.
*
Restituer les résultats et contribuer à la définition des plans d'actions.
*
Documenter les analyses, les hypothèses et les méthodes retenues.
OUTILS & ENVIRONNEMENT
*
Python, JupyterHub, SQL
*
Git/GitLab
*
MinIO, Datalake
*
Pandera ou Great Expectations
*
Regex, Fuzzy Matching, NLP
*
Selon les cas d'usage: LLM/VLM
Débutant accepté