CSV 정리 및 스키마 매핑 프롬프트
복잡한 CSV를 빠르게 정리하고, 타입을 추론하며, 헤더를 수정하고, 일관된 스키마를 출력하여 번거로움 없는 분석을 지원합니다.
프롬프트 개요
추천 팁
서로 다른 기간의 30~50행 샘플을 수집해 숨겨진 형식을 파악하세요; 이름 규칙은 초기에 고정하세요(나중에 변경하면 조인과 차트가 깨집니다); 가정 사항은 스키마 테이블에 직접 문서화해 감사를 용이하게 하세요; 원시 값은 숨긴 시트에 보관해 쉽게 롤백하고 점검할 수 있게 하세요.
운영팀 제공NexusAi Technology해결하는 문제
원시 CSV 내보내기에는 종종 일관성 없는 헤더, 혼합된 타입, 빈 행, 혼란스러운 인코딩이 포함되어 있어 후속 분석과 차트 작성에 문제를 일으킵니다.
헤더 정규화
복잡한 헤더를 분석 친화적인 이름으로 표준화합니다.
타입 추론
날짜, 통화, 불리언, 숫자 필드를 신뢰성 있게 감지합니다.
이중 실행
스프레드시트 수식과 Python/pandas 단계를 모두 제공합니다.
QA 검증
무단 데이터 오류를 방지하는 실용적인 검사를 포함합니다.
AI 프롬프트 지침
역할: 데이터 품질, CSV 정규화, 스프레드시트 및 BI 도구용 분석 준비 스키마에 전문성을 가진 시니어 분석 엔지니어로 활동하세요.
이 작업이 중요한 이유: 깨끗하고 타입이 지정되며 일관된 이름의 컬럼은 신뢰할 수 있는 KPI, 올바른 조인, 신뢰받는 경영 대시보드를 가능하게 합니다.
중요한 제한 사항:
- 데이터를 임의로 생성하지 마세요.
- 원시 값은 추적 가능하게 보존하세요.
- 간단하고 되돌릴 수 있는 변환을 선호하세요.
- 지역별 형식(날짜, 소수점, 통화)은 명확히 표기하세요.
사용자 입력:
- 비즈니스 컨텍스트(팀, 목적, 목표 KPI).
- CSV에서 30~50행 샘플(헤더 포함)을 붙여넣기.
- 로케일(예: en-US) 및 날짜/통화 규칙 명시.
목표:
1) 문제 진단(헤더, 타입, 누락, 중복, 구분자, 인코딩).
2) 깨끗한 스키마 제안: 컬럼명, 데이터 타입, 정의.
3) Google Sheets/Excel 또는 Python/pandas에서 실행 가능한 변환 단계 제공.
4) 소규모 QA 검사 및 예외 플래그 출력.
분석 워크플로우:
1) 샘플 프로파일링: 고유성, 범위, 널 값, 범주 수준, 가능성 있는 ID/키.
2) 헤더를 표준화된 분석 친화적 이름(소문자_스네이크_케이스)으로 매핑.
3) 데이터 타입 결정(날짜, 날짜시간, 불리언, 정수, 부동소수점, 통화, 범주, 텍스트).
4) 변환 명세: 텍스트 트림/정규화, 날짜 파싱, 결합 필드 분할, 통화 기호 수정, 단위 통일.
5) 기본 키 후보 및 외래 키 식별(가능한 경우).
6) 필터링할 행(합계, 메모, 빈 줄) 및 규칙 목록 작성.
필수 출력 형식:
- 깨끗한 스키마 테이블: 원본_헤더 → 깨끗한_이름, 타입, 샘플_값, 규칙.
- 변환 단계: 스프레드시트 함수 및 동등한 pandas 코드.
- QA 검사: 5~10개 검증(예: 주요 필드 널 아님 %, 날짜 범위, 숫자 전용 컬럼).
- 예외 처리: 로그 기록 방법 및 검토 위치.
품질 관리:
- 파괴적 변환 피하기; 필요 시 별도 시트 또는 _raw 접미사 컬럼에 원시 데이터 보존.
- 모호한 필드는 명확히 표시하고 결정 요청.
검증 체크리스트:
- 헤더 표준화 및 문서화 완료.
- 샘플 행으로 타입 검증.
- 주요 ID 고유성 확보; 무단 삭제 없음.
- 로케일에 맞는 날짜 파싱 확인.
최종 지침: 스키마 테이블, 변환 단계(시트 수식 + pandas), QA 검증, 위험 및 미해결 질문에 대한 간단한 메모를 생성하세요. 간결하고 구현 준비된 형태로 유지하세요.
예상 결과
깨끗한 스키마 테이블: - 원본: Customer ID → customer_id (텍스트) 샘플: C-1023 규칙: UPPER(TRIM()) - 원본: Order Date → order_date (날짜) 샘플: 2026-06-14 규칙: 로케일 참고 DATEVALUE - 원본: Revenue ($) → revenue_usd (부동소수점) 샘플: 1299.50 규칙: $ 및 쉼표 제거 변환 단계: - 시트: =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas: df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) QA 검사: - customer_id 고유성 확인 - order_date 최근 36개월 내 - revenue_usd ≥ 0
실행 과정
ChatGPT에서 CSV 진단 및 매핑
ChatGPT를 열고 헤더와 함께 30~50개의 대표 행과 로케일 및 KPI 컨텍스트를 붙여넣으세요. 깨끗한 스키마, 타입 추론, 수정 규칙을 요청하세요. 스키마 테이블, 스프레드시트 함수, pandas 코드, QA 검사가 제공됩니다.
10-15 minGoogle Sheets 또는 Excel에서 수정 적용
제공된 헤더 맵과 수식을 사용해 정리된 시트를 만드세요. 타입을 검증하고, 날짜를 파싱하며, 통화 안전 값을 계산하세요. QA 검사를 활용해 별도의 QA 탭에서 이상을 표시하세요.
15-25 min스키마 내보내기 및 고정
헤더 행을 고정하고 주요 셀을 보호한 후, 후속 조인과 차트를 위해 깨끗한 CSV로 내보내세요. 스키마와 QA 노트를 팀 위키에 저장해 향후 가져오기를 표준화하세요.
5-10 min
