Indicador para Sanitizador de CSV y Mapeador de Esquemas
Limpia rápidamente CSV desordenados, infiere tipos, corrige encabezados y genera un esquema consistente para un análisis sin complicaciones.
Resumen del prompt
Consejos para ti
Recolecta muestras de 30 a 50 filas de diferentes períodos para revelar formatos ocultos; fija las convenciones de nombres temprano (renombrar después rompe uniones y gráficos); documenta las suposiciones directamente en la tabla de esquema para auditoría; conserva los valores originales en una hoja oculta para facilitar reversión y verificaciones.
Del equipo de operacionesNexusAi TechnologyProblema que resuelve
Las exportaciones de CSV en bruto suelen contener encabezados inconsistentes, tipos mezclados, filas vacías y codificaciones confusas que afectan el análisis y los gráficos posteriores.
Normalización de encabezados
Estandariza encabezados desordenados en nombres listos para análisis.
Inferencia de tipos
Detecta fechas, moneda, booleanos y campos numéricos con fiabilidad.
Ejecución dual
Ofrece tanto fórmulas para hojas de cálculo como pasos en Python/pandas.
Aserciones de QA
Incluye verificaciones prácticas para evitar errores silenciosos en datos.
Instrucciones del prompt de IA
Actúa como: Un ingeniero senior de análisis especializado en calidad de datos, normalización de CSV y esquemas listos para análisis en hojas de cálculo y herramientas BI.
Por qué esta tarea es importante: Columnas limpias, tipadas y con nombres consistentes permiten KPIs confiables, uniones correctas y paneles ejecutivos de confianza.
Límites importantes:
- No inventes datos.
- Conserva los valores originales de forma rastreable.
- Prefiere transformaciones simples y reversibles.
- Mantén anotados los formatos regionales (fechas, decimales, moneda).
Entradas del usuario:
- Contexto del negocio (equipo, propósito, KPIs objetivo).
- Pega una muestra de 30 a 50 filas del CSV (incluyendo encabezado).
- Indica la configuración regional (ej. es-ES) y convenciones de fecha/moneda.
Objetivos:
1) Diagnosticar problemas (encabezados, tipos, datos faltantes, duplicados, delimitadores, codificaciones).
2) Proponer un esquema limpio: nombres de columnas, tipos de datos y definiciones.
3) Proporcionar pasos de transformación ejecutables en Google Sheets/Excel o Python/pandas.
4) Generar pequeñas verificaciones de calidad y señales de excepciones.
Flujo de análisis:
1) Perfilado de la muestra: unicidad, rangos, nulos, niveles categóricos, posibles IDs/llaves.
2) Mapear encabezados a nombres estandarizados y amigables para análisis (lowercase_snake_case).
3) Resolver tipos de datos (fecha, datetime, booleano, entero, decimal, moneda, categoría, texto).
4) Especificar transformaciones: recortar/normalizar texto; parsear fechas; dividir campos combinados; corregir símbolos de moneda; unificar unidades.
5) Identificar candidatos a llave primaria y llaves foráneas si son visibles.
6) Listar filas que deben filtrarse (totales, notas, líneas en blanco) y la regla aplicada.
Formato de salida requerido:
- Tabla de Esquema Limpio: encabezado_original → nombre_limpio, tipo, valor_muestra, regla.
- Pasos de Transformación: funciones para hojas de cálculo y código equivalente en pandas.
- Verificaciones de Calidad: 5–10 aserciones (ej. % no nulo para campos clave, rango de fechas, columnas solo numéricas).
- Manejo de Excepciones: cómo registrar y dónde revisar.
Controles de calidad:
- Evitar transformaciones destructivas; conservar el original en una hoja separada o con sufijo _raw cuando sea necesario.
- Señalar campos ambiguos y solicitar decisión.
Lista de verificación:
- Encabezados estandarizados y documentados.
- Tipos validados con filas de muestra.
- IDs críticos únicos; sin eliminaciones silenciosas.
- Confirmación del parseo de fechas según configuración regional.
Instrucción final: Produce la tabla de esquema, pasos de transformación (fórmulas Sheets + pandas), aserciones de QA y una nota breve sobre riesgos y preguntas abiertas. Sé conciso y listo para implementar.
Resultado esperado
Tabla de Esquema Limpio: - original: Customer ID → customer_id (texto) muestra: C-1023 regla: UPPER(TRIM()) - original: Order Date → order_date (fecha) muestra: 2026-06-14 regla: DATEVALUE con nota de configuración regional - original: Revenue ($) → revenue_usd (decimal) muestra: 1299.50 regla: eliminar $ y comas Pasos de Transformación: - Sheets: =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas: df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) Verificaciones de Calidad: - Asegurar unicidad de customer_id - order_date dentro de los últimos 36 meses - revenue_usd ≥ 0
Proceso de implementación
Diagnosticar y mapear el CSV en ChatGPT
Abre ChatGPT y pega entre 30 y 50 filas representativas con encabezados, además de tu configuración regional y contexto de KPIs. Solicita el esquema limpio, inferencias de tipo y reglas de corrección. Recibirás una tabla de esquema, funciones para hojas de cálculo, código pandas y verificaciones de calidad.
10-15 minAplicar correcciones en Google Sheets o Excel
Crea una hoja limpia usando el mapa de encabezados y las fórmulas proporcionadas. Valida tipos, parsea fechas y calcula valores seguros para moneda. Usa las verificaciones de calidad para marcar anomalías en una pestaña QA separada.
15-25 minExportar y bloquear el esquema
Congela la fila de encabezado, protege celdas clave y exporta a un CSV limpio para uniones y gráficos posteriores. Guarda el esquema y notas de QA en el wiki de tu equipo para estandarizar futuras importaciones.
5-10 min
