CSV 清理與結構映射提示
快速清理混亂的 CSV,推斷類型,修正標題,並輸出一致的結構,讓分析更輕鬆無憂。
提示詞概覽
給你的提示
收集來自不同時間段的 30–50 行切片以揭露隱藏格式;及早鎖定命名規則(後期更名會破壞連接與圖表);直接在結構表中記錄假設以利稽核;將原始值保存在隱藏工作表方便回滾與檢查。
來自營運團隊NexusAi Technology解決的問題
原始 CSV 匯出常包含不一致的標題、混合類型、空白列及混亂的編碼,導致後續分析與圖表出錯。
標題正規化
將混亂標題標準化為適合分析的名稱。
類型推斷
可靠偵測日期、貨幣、布林與數值欄位。
雙重執行
同時提供試算表公式與 Python/pandas 步驟。
品質斷言
包含實用檢查以防止隱性資料錯誤。
AI 提示詞指令
角色設定:一位專精於資料品質、CSV 正規化及適用於試算表與商業智慧工具的分析結構的資深分析工程師。
任務重要性:清晰、類型明確且命名一致的欄位,能確保關鍵績效指標(KPI)可靠、連接正確,並打造值得信賴的管理儀表板。
重要限制:
- 不得捏造資料。
- 以可追蹤方式保留原始值。
- 優先採用簡單且可逆的轉換。
- 保留區域格式標示(日期、小數、貨幣)。
使用者輸入:
- 業務背景(團隊、目的、目標 KPI)。
- 貼上 30–50 行的 CSV 範例(含標題)。
- 指定地區語系(如 en-US)及日期/貨幣慣例。
目標:
1) 診斷問題(標題、類型、缺失、重複、分隔符、編碼)。
2) 建議清理後的結構:欄位名稱、資料類型與定義。
3) 提供可在 Google Sheets/Excel 或 Python/pandas 執行的轉換步驟。
4) 輸出簡易的品質檢查與例外標記。
分析流程:
1) 分析範例:唯一性、範圍、空值、分類層級、可能的 ID/鍵值。
2) 將標題映射為標準化且適合分析的名稱(小寫蛇形命名)。
3) 確定資料類型(日期、日期時間、布林、整數、浮點數、貨幣、分類、文字)。
4) 指定轉換:修剪/正規化文字;解析日期;拆分合併欄位;修正貨幣符號;統一單位。
5) 識別主鍵候選與可見的外鍵。
6) 列出應過濾的列(總計、備註、空白行)及其規則。
輸出格式要求:
- 清理結構表:原始標題 → 清理名稱、類型、範例值、規則。
- 轉換步驟:試算表函數與對應的 pandas 程式碼。
- 品質檢查:5–10 項斷言(如關鍵欄位非空比例、日期範圍、僅數字欄位)。
- 例外處理:如何記錄及檢視位置。
品質控管:
- 避免破壞性轉換;必要時於獨立工作表或欄位後綴 _raw 保留原始資料。
- 標示模糊欄位並請求決策。
驗證清單:
- 標題標準化且有文件記錄。
- 類型以範例列驗證。
- 重要 ID 唯一,無默默遺失。
- 日期解析符合地區語系。
最終指示:產出結構表、轉換步驟(試算表公式 + pandas)、品質斷言及風險與待解決問題簡短說明。保持簡潔且可立即實作。
預期成果
清理結構表: - 原始:Customer ID → customer_id(文字)範例:C-1023 規則:UPPER(TRIM()) - 原始:Order Date → order_date(日期)範例:2026-06-14 規則:使用帶地區說明的 DATEVALUE - 原始:Revenue ($) → revenue_usd(浮點數)範例:1299.50 規則:去除 $ 與逗號 轉換步驟: - 試算表:=VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas:df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) 品質檢查: - 斷言 customer_id 唯一 - order_date 在過去 36 個月內 - revenue_usd ≥ 0
實施流程
在 ChatGPT 中診斷並映射 CSV
打開 ChatGPT,貼上含標題的 30–50 行代表性資料及您的地區語系與 KPI 背景。請求清理結構、類型推斷與修正規則。預期獲得結構表、試算表函數、pandas 程式碼與品質檢查。
10-15 min在 Google Sheets 或 Excel 中套用修正
使用提供的標題映射與公式建立清理後的工作表。驗證類型、解析日期並計算貨幣安全值。利用品質檢查在獨立的 QA 分頁標示異常。
15-25 min匯出並鎖定結構
凍結標題列,保護關鍵儲存格,並匯出為乾淨的 CSV 以供後續連接與圖表使用。將結構與 QA 註記存入團隊維基,標準化未來匯入流程。
5-10 min
