Prompt para Sanitizador de CSV e Mapeador de Esquema
Limpe rapidamente CSVs desorganizados, identifique tipos, corrija cabeçalhos e gere um esquema consistente para análises sem complicações.
Visão geral do prompt
Dicas para você
Colete amostras de 30 a 50 linhas de diferentes períodos para revelar formatos ocultos; defina convenções de nomes cedo (renomear depois quebra junções e gráficos); documente suposições diretamente na tabela de esquema para auditoria; mantenha valores brutos em uma aba oculta para fácil reversão e verificações.
Da equipe de operaçõesNexusAi TechnologyProblema que resolve
Exportações brutas de CSV frequentemente apresentam cabeçalhos inconsistentes, tipos mistos, linhas vazias e codificações confusas que comprometem análises e gráficos posteriores.
Normalização de cabeçalhos
Padroniza cabeçalhos desorganizados em nomes prontos para análise.
Inferência de tipos
Detecta datas, moedas, booleanos e campos numéricos com precisão.
Execução dupla
Fornece fórmulas para planilhas e passos em Python/pandas.
Assertivas de QA
Inclui verificações práticas para evitar erros silenciosos nos dados.
Instruções do prompt de IA
Atue como: Um engenheiro sênior de analytics especializado em qualidade de dados, normalização de CSV e esquemas prontos para análise em planilhas e ferramentas de BI.
Por que essa tarefa é importante: Colunas limpas, tipadas e com nomes consistentes permitem KPIs confiáveis, junções corretas e dashboards executivos confiáveis.
Limites importantes:
- Não fabrique dados.
- Preserve valores brutos de forma rastreável.
- Prefira transformações simples e reversíveis.
- Mantenha formatos regionais anotados (datas, decimais, moeda).
Entradas do usuário:
- Contexto de negócio (equipe, propósito, KPIs alvo).
- Cole uma amostra de 30 a 50 linhas do CSV (incluindo cabeçalho).
- Indique o local (ex: pt-BR) e convenções de data/moeda.
Objetivos:
1) Diagnosticar problemas (cabeçalhos, tipos, ausências, duplicatas, delimitadores, codificações).
2) Propor um esquema limpo: nomes de colunas, tipos de dados e definições.
3) Fornecer passos de transformação executáveis no Google Sheets/Excel ou Python/pandas.
4) Gerar pequenas verificações de QA e sinalizações de exceções.
Fluxo de análise:
1) Perfil da amostra: unicidade, intervalos, nulos, níveis categóricos, possíveis IDs/chaves.
2) Mapear cabeçalhos para nomes padronizados e amigáveis à análise (lowercase_snake_case).
3) Resolver tipos de dados (data, datetime, booleano, int, float, moeda, categoria, texto).
4) Especificar transformações: aparar/normalizar texto; analisar datas; dividir campos combinados; corrigir símbolos de moeda; unificar unidades.
5) Identificar candidatos a chave primária e chaves estrangeiras, se visíveis.
6) Listar linhas a filtrar (totais, notas, linhas em branco) e a regra aplicada.
Formato de saída requerido:
- Tabela de Esquema Limpo: original_header → clean_name, tipo, valor_exemplo, regra.
- Passos de Transformação: funções de planilha e código equivalente em pandas.
- Verificações de QA: 5 a 10 assertivas (ex: % não nulo para campos-chave, intervalo de datas, colunas numéricas).
- Tratamento de Exceções: como registrar e onde revisar.
Controles de qualidade:
- Evitar transformações destrutivas; manter o bruto em uma aba separada ou com sufixo _raw quando necessário.
- Destacar campos ambíguos e solicitar decisão.
Checklist de verificação:
- Cabeçalhos padronizados e documentados.
- Tipos validados com linhas de amostra.
- IDs críticos únicos; sem exclusões silenciosas.
- Parsing de datas confirmado para o local.
Instrução final: Produza a tabela de esquema, passos de transformação (fórmulas Sheets + pandas), assertivas de QA e uma breve nota sobre riscos e questões em aberto. Seja conciso e pronto para implementação.
Resultado esperado
Tabela de Esquema Limpo: - original: Customer ID → customer_id (texto) exemplo: C-1023 regra: UPPER(TRIM()) - original: Order Date → order_date (data) exemplo: 2026-06-14 regra: DATEVALUE com nota de localidade - original: Revenue ($) → revenue_usd (float) exemplo: 1299.50 regra: remover $ e vírgulas Passos de Transformação: - Sheets: =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas: df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) Verificações de QA: - Assegurar unicidade de customer_id - order_date dentro dos últimos 36 meses - revenue_usd ≥ 0
Jornada de implementação
Diagnosticar e mapear o CSV no ChatGPT
Abra o ChatGPT e cole 30 a 50 linhas representativas com cabeçalhos, além do seu local e contexto de KPIs. Peça o esquema limpo, inferência de tipos e regras de correção. Espere uma tabela de esquema, funções de planilha, código pandas e verificações de QA.
10-15 minAplicar correções no Google Sheets ou Excel
Crie uma planilha limpa usando o mapa de cabeçalhos e fórmulas fornecidas. Valide tipos, analise datas e calcule valores seguros para moeda. Use as verificações de QA para sinalizar anomalias em uma aba separada de QA.
15-25 minExportar e travar o esquema
Congele a linha de cabeçalho, proteja células-chave e exporte para um CSV limpo para junções e gráficos posteriores. Armazene o esquema e as notas de QA na wiki da equipe para padronizar futuras importações.
5-10 min
