CSV-Bereiniger & Schema-Mapper Prompt
Säubern Sie unordentliche CSV-Dateien schnell, erkennen Sie Datentypen, korrigieren Sie Überschriften und erstellen Sie ein konsistentes Schema für eine problemlose Analyse.
Prompt-Übersicht
Tipps für dich
Sammeln Sie 30–50 Zeilen aus verschiedenen Zeiträumen, um versteckte Formate zu erkennen; legen Sie Benennungsregeln früh fest (spätere Umbenennungen zerstören Verknüpfungen und Diagramme); dokumentieren Sie Annahmen direkt in der Schema-Tabelle für Nachvollziehbarkeit; bewahren Sie Rohwerte in einem versteckten Blatt für einfache Rücksetzungen und Prüfungen auf.
Vom Operations-TeamNexusAi TechnologyProblem, das es löst
Roh-CSV-Exporte enthalten oft inkonsistente Überschriften, gemischte Datentypen, leere Zeilen und verwirrende Kodierungen, die nachgelagerte Analysen und Diagramme stören.
Kopfzeilen-Normalisierung
Standardisiert unordentliche Überschriften zu analysefähigen Namen.
Typ-Erkennung
Erkennt zuverlässig Daten, Währungen, Booleans und numerische Felder.
Duale Ausführung
Bietet sowohl Tabellenkalkulationsformeln als auch Python/pandas-Schritte.
QA-Assertions
Enthält praktische Prüfungen, um stille Datenfehler zu verhindern.
KI-Prompt-Anweisungen
Agieren Sie als: Ein erfahrener Analytics-Ingenieur, spezialisiert auf Datenqualität, CSV-Normalisierung und analysebereite Schemata für Tabellenkalkulationen und BI-Tools.
Warum diese Aufgabe wichtig ist: Saubere, typisierte und einheitlich benannte Spalten ermöglichen verlässliche KPIs, korrekte Verknüpfungen und vertrauenswürdige Management-Dashboards.
Wichtige Grenzen:
- Keine Daten erfinden.
- Rohwerte nachvollziehbar erhalten.
- Bevorzugen Sie einfache, reversible Transformationen.
- Regionale Formate beachten (Datum, Dezimalstellen, Währung).
Benutzereingaben:
- Geschäftskontext (Team, Zweck, Ziel-KPIs).
- Fügen Sie eine 30–50 Zeilen umfassende Stichprobe aus der CSV ein (inklusive Kopfzeile).
- Geben Sie die Locale an (z. B. de-DE) sowie Datums- und Währungsformate.
Ziele:
1) Probleme diagnostizieren (Überschriften, Typen, fehlende Werte, Duplikate, Trennzeichen, Kodierungen).
2) Ein sauberes Schema vorschlagen: Spaltennamen, Datentypen und Definitionen.
3) Transformationsschritte bereitstellen, die in Google Sheets/Excel oder Python/pandas ausgeführt werden können.
4) Kleine QA-Prüfungen und Ausnahmewarnungen ausgeben.
Analyseablauf:
1) Profilieren Sie die Stichprobe: Einzigartigkeit, Wertebereiche, Nullwerte, Kategorien, wahrscheinliche IDs/Schlüssel.
2) Ordnen Sie Überschriften standardisierten, analysefreundlichen Namen zu (lowercase_snake_case).
3) Bestimmen Sie Datentypen (Datum, Datum-Uhrzeit, Boolean, Integer, Float, Währung, Kategorie, Text).
4) Legen Sie Transformationen fest: Text trimmen/normalisieren; Daten parsen; kombinierte Felder aufteilen; Währungssymbole korrigieren; Einheiten vereinheitlichen.
5) Identifizieren Sie Primärschlüssel-Kandidaten und Fremdschlüssel, falls sichtbar.
6) Listen Sie Zeilen auf, die gefiltert werden sollten (Summen, Notizen, Leerzeilen) und die Regel dazu.
Erforderliches Ausgabeformat:
- Sauberes Schema-Tabelle: original_header → clean_name, Typ, Beispielwert, Regel.
- Transformationsschritte: Tabellenkalkulationsfunktionen und entsprechender pandas-Code.
- QA-Prüfungen: 5–10 Assertions (z. B. Nicht-Null-Prozentsatz für Schlüsselfelder, Datumsbereich, nur numerische Spalten).
- Ausnahmebehandlung: Wie protokollieren und wo überprüfen.
Qualitätskontrollen:
- Vermeiden Sie destruktive Transformationen; bewahren Sie Rohdaten bei Bedarf in einem separaten Blatt oder mit dem Spalten-Suffix _raw auf.
- Weisen Sie auf mehrdeutige Felder hin und fordern Sie eine Entscheidung an.
Verifikations-Checkliste:
- Überschriften standardisiert und dokumentiert.
- Typen mit Beispielzeilen validiert.
- Kritische IDs eindeutig; keine stillen Datenverluste.
- Datumsparsing für Locale bestätigt.
Abschließende Anweisung: Erstellen Sie die Schema-Tabelle, Transformationsschritte (Sheets-Formeln + pandas), QA-Assertions und eine kurze Notiz zu Risiken und offenen Fragen. Halten Sie es prägnant und umsetzungsbereit.
Erwartetes Ergebnis
Saubere Schema-Tabelle: - original: Customer ID → customer_id (Text) Beispiel: C-1023 Regel: UPPER(TRIM()) - original: Order Date → order_date (Datum) Beispiel: 2026-06-14 Regel: DATEVALUE mit Locale-Hinweis - original: Revenue ($) → revenue_usd (Float) Beispiel: 1299.50 Regel: $ und Kommas entfernen Transformationsschritte: - Sheets: =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas: df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) QA-Prüfungen: - Einzigartigkeit von customer_id sicherstellen - order_date innerhalb der letzten 36 Monate - revenue_usd ≥ 0
Umsetzungsprozess
CSV in ChatGPT diagnostizieren und zuordnen
Öffnen Sie ChatGPT und fügen Sie 30–50 repräsentative Zeilen mit Überschriften sowie Ihren Locale- und KPI-Kontext ein. Fordern Sie das saubere Schema, Typzuweisungen und Korrekturregeln an. Erwarten Sie eine Schema-Tabelle, Tabellenkalkulationsfunktionen, pandas-Code und QA-Prüfungen.
10-15 minKorrekturen in Google Sheets oder Excel anwenden
Erstellen Sie ein bereinigtes Blatt mit der bereitgestellten Kopfzeilenzuordnung und Formeln. Validieren Sie Typen, parsen Sie Daten und berechnen Sie währungssichere Werte. Nutzen Sie die QA-Prüfungen, um Anomalien in einem separaten QA-Tab zu markieren.
15-25 minSchema exportieren und sichern
Fixieren Sie die Kopfzeile, schützen Sie wichtige Zellen und exportieren Sie eine saubere CSV für nachgelagerte Verknüpfungen und Diagramme. Speichern Sie Schema und QA-Notizen im Team-Wiki, um zukünftige Importe zu standardisieren.
5-10 min
