提示词概览
给你的提示
收集来自不同时间段的 30–50 行样本以揭示隐藏格式;尽早锁定命名规范(后期重命名会破坏连接和图表);直接在模式表中记录假设以便审计;将原始值保存在隐藏工作表,方便回滚和检查。
来自运营团队NexusAi Technology解决的问题
原始 CSV 导出文件常包含不一致的表头、混合类型、空行和混乱的编码,导致后续分析和图表出错。
表头规范化
将混乱的表头标准化为适合分析的名称。
类型推断
可靠检测日期、货币、布尔值和数字字段。
双重执行
同时提供电子表格公式和 Python/pandas 步骤。
质量断言
包含实用检查,防止数据隐性错误。
AI 提示词说明
角色定位:一位资深分析工程师,专注于数据质量、CSV 规范化以及为电子表格和 BI 工具准备分析就绪的模式。
任务重要性:清晰、类型明确且命名一致的列能确保关键绩效指标(KPI)可靠,连接正确,管理仪表盘可信。
重要边界:
- 不得伪造数据。
- 以可追溯方式保留原始值。
- 优先采用简单且可逆的转换。
- 保留区域格式说明(日期、小数、货币)。
用户输入:
- 业务背景(团队、目的、目标 KPI)。
- 粘贴包含表头的 30–50 行 CSV 样本。
- 指明区域设置(如 en-US)及日期/货币惯例。
目标:
1) 诊断问题(表头、类型、缺失、重复、分隔符、编码)。
2) 提出清晰模式:列名、数据类型及定义。
3) 提供可在 Google Sheets/Excel 或 Python/pandas 中执行的转换步骤。
4) 输出小型质量检查和异常标记。
分析流程:
1) 统计样本:唯一性、范围、空值、类别级别、可能的 ID/键。
2) 将表头映射为标准化、适合分析的名称(小写蛇形命名)。
3) 确定数据类型(日期、日期时间、布尔、整数、浮点、货币、类别、文本)。
4) 指定转换:修剪/规范文本;解析日期;拆分合并字段;修正货币符号;统一单位。
5) 识别主键候选及可见的外键。
6) 列出应过滤的行(合计、备注、空行)及规则。
所需输出格式:
- 清理模式表:原始表头 → 清理名称,类型,样本值,规则。
- 转换步骤:电子表格函数及对应 pandas 代码。
- 质量检查:5–10 条断言(如关键字段非空百分比、日期范围、仅数字列)。
- 异常处理:如何记录及审查位置。
质量控制:
- 避免破坏性转换;必要时在单独工作表或添加 _raw 后缀列保留原始数据。
- 标注模糊字段并请求决策。
验证清单:
- 表头标准化并有文档。
- 类型通过样本验证。
- 关键 ID 唯一,无隐性丢失。
- 日期解析符合区域设置。
最终指令:生成模式表、转换步骤(Sheets 公式 + pandas)、质量断言及风险和未决问题简短说明。保持简洁且可实施。
预期结果
清理模式表: - 原始:Customer ID → customer_id(文本)样本:C-1023 规则:UPPER(TRIM()) - 原始:Order Date → order_date(日期)样本:2026-06-14 规则:带区域设置说明的 DATEVALUE - 原始:Revenue ($) → revenue_usd(浮点)样本:1299.50 规则:去除 $ 和逗号 转换步骤: - Sheets: =VALUE(SUBSTITUTE(SUBSTITUTE(C2,"$",""),",","")) - pandas: df['revenue_usd']=pd.to_numeric(df['Revenue ($)'].str.replace('[\$,]','',regex=True)) 质量检查: - 断言 customer_id 唯一 - order_date 在最近 36 个月内 - revenue_usd ≥ 0
实施流程
在 ChatGPT 中诊断并映射 CSV
打开 ChatGPT,粘贴包含表头的 30–50 行代表性样本及您的区域设置和 KPI 背景。请求清理模式、类型推断和修正规则。预期获得模式表、电子表格函数、pandas 代码和质量检查。
10-15 min在 Google Sheets 或 Excel 中应用修正
使用提供的表头映射和公式创建清理后的工作表。验证类型,解析日期,计算货币安全值。使用质量检查在单独的 QA 标签页标记异常。
15-25 min导出并锁定模式
冻结表头行,保护关键单元格,导出为清理后的 CSV 以供后续连接和图表使用。将模式和质量检查笔记存储在团队 Wiki 中,标准化未来导入。
5-10 min
