Invite pour Assainisseur CSV & Cartographe de Schéma
Nettoyez rapidement des CSV désordonnés, déduisez les types, corrigez les en-têtes et générez un schéma cohérent pour une analyse sans tracas.
Aperçu du prompt
Conseils pour vous
Collectez des extraits de 30 à 50 lignes provenant de différentes périodes pour révéler les formats cachés ; verrouillez tôt les conventions de nommage (renommer plus tard casse les jointures et graphiques) ; documentez les hypothèses directement dans le tableau de schéma pour l’auditabilité ; conservez les valeurs brutes dans une feuille cachée pour faciliter les retours en arrière et contrôles.
De l’équipe opérationsNexusAi TechnologyProblème résolu
Les exports CSV bruts contiennent souvent des en-têtes incohérents, des types mélangés, des lignes vides et des encodages confus qui perturbent l’analyse et les graphiques en aval.
Normalisation des en-têtes
Standardise les en-têtes désordonnés en noms adaptés à l’analyse.
Inférence de type
Détecte de manière fiable les dates, devises, booléens et champs numériques.
Double exécution
Fournit à la fois des formules tableur et des étapes Python/pandas.
Assertions QA
Inclut des contrôles pratiques pour éviter les erreurs silencieuses de données.
Instructions du prompt IA
Agissez en tant que : Ingénieur analytique senior spécialisé dans la qualité des données, la normalisation CSV et les schémas prêts pour l’analyse dans les tableurs et outils BI.
Pourquoi cette tâche est importante : Des colonnes propres, typées et nommées de manière cohérente permettent des indicateurs fiables, des jointures correctes et des tableaux de bord exécutifs dignes de confiance.
Limites importantes :
- Ne pas inventer de données.
- Conserver les valeurs brutes de manière traçable.
- Privilégier des transformations simples et réversibles.
- Garder en note les formats régionaux (dates, décimales, devises).
Entrées utilisateur :
- Contexte métier (équipe, objectif, KPIs cibles).
- Coller un échantillon de 30 à 50 lignes du CSV (en incluant l’en-tête).
- Indiquer la locale (ex. fr-FR) et les conventions date/devise.
Objectifs :
1) Diagnostiquer les problèmes (en-têtes, types, données manquantes, doublons, délimiteurs, encodages).
2) Proposer un schéma propre : noms de colonnes, types de données et définitions.
3) Fournir les étapes de transformation exécutables dans Google Sheets/Excel ou Python/pandas.
4) Produire des contrôles qualité et des indicateurs d’exception.
Processus d’analyse :
1) Profiler l’échantillon : unicité, plages, valeurs nulles, niveaux catégoriels, identifiants/clefs probables.
2) Mapper les en-têtes vers des noms standardisés et adaptés à l’analyse (lowercase_snake_case).
3) Résoudre les types de données (date, datetime, booléen, int, float, devise, catégorie, texte).
4) Spécifier les transformations : trim/normalisation du texte ; parsing des dates ; séparation des champs combinés ; correction des symboles monétaires ; unification des unités.
5) Identifier les candidats clés primaires et clés étrangères si visibles.
6) Lister les lignes à filtrer (totaux, notes, lignes vides) et la règle associée.
Format de sortie requis :
- Tableau de schéma propre : original_header → clean_name, type, valeur_exemple, règle.
- Étapes de transformation : fonctions tableur et code pandas équivalent.
- Contrôles qualité : 5 à 10 assertions (ex. % non-null pour champs clés, plage de dates, colonnes numériques uniquement).
- Gestion des exceptions : comment journaliser et où consulter.
Contrôles qualité :
- Éviter les transformations destructrices ; conserver le brut dans une feuille séparée ou suffixe _raw si nécessaire.
- Signaler les champs ambigus et demander une décision.
Checklist de vérification :
- En-têtes standardisés et documentés.
- Types validés avec des lignes d’échantillon.
- Identifiants critiques uniques ; pas de suppression silencieuse.
- Parsing des dates confirmé pour la locale.
Instruction finale : Produisez le tableau de schéma, les étapes de transformation (formules Sheets + pandas), les assertions QA, et une note courte sur les risques et questions ouvertes. Restez concis et prêt à l’implémentation.
Résultat attendu
Tableau de schéma propre : - original : Customer ID → customer_id (texte) exemple : C-1023 règle : UPPER(TRIM()) - original : Order Date → order_date (date) exemple : 2026-06-14 règle : DATEVALUE avec note de locale - original : Revenue ($) → revenue_usd (float) exemple : 1299.50 règle : suppression des $ et des virgules Étapes de transformation : - Sheets : =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas : df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) Contrôles QA : - Vérifier unicité de customer_id - order_date dans les 36 derniers mois - revenue_usd ≥ 0
Parcours de mise en œuvre
Diagnostiquer et cartographier le CSV dans ChatGPT
Ouvrez ChatGPT et collez 30 à 50 lignes représentatives avec en-têtes ainsi que votre locale et contexte KPI. Demandez le schéma propre, les inférences de type et les règles de correction. Attendez un tableau de schéma, des fonctions tableur, du code pandas et des contrôles QA.
10-15 minAppliquer les corrections dans Google Sheets ou Excel
Créez une feuille nettoyée en utilisant la carte d’en-têtes et les formules fournies. Validez les types, parsez les dates et calculez des valeurs sûres pour la devise. Utilisez les contrôles QA pour signaler les anomalies dans un onglet QA séparé.
15-25 minExporter et verrouiller le schéma
Figez la ligne d’en-tête, protégez les cellules clés et exportez en CSV propre pour les jointures et graphiques en aval. Stockez le schéma et les notes QA dans le wiki de votre équipe pour standardiser les futures importations.
5-10 min
