数据清洗
优先试点这一场景的目标是把Excel/CSV、字段定义、质量规则整理成清洗数据、问题清单和处理日志。
- 输入
- Excel/CSV、字段定义、质量规则
- 输出
- 清洗数据、问题清单和处理日志
- 验收
- 检查清洗耗时、口径错误率、分析返工率
- 边界
- 原始数据保留,处理规则可复现

数据分析岗位需要把取数、口径、清洗、分析与解释连成可追踪过程。
左起第一列是这个岗位可交给 WorkBuddy 的场景; 中间两列是它需要什么、能交付什么;最后一列是必须由人或系统决定的部分 —— 这一列才是评审时真正要看的,因为它决定哪些环节不能自动化。
| 场景 | 需要输入 | WorkBuddy可辅助交付 | 人工或系统边界 |
|---|---|---|---|
| 数据清洗 | Excel/CSV、字段定义、质量规则 | 清洗数据、问题清单和处理日志 | 原始数据保留,处理规则可复现 |
| 多表合并 | 多文件、主键、时间和口径 | 合并表、未匹配项和重复项 | 主键与口径必须先确认 |
| 指标计算 | 业务定义、公式、源字段 | 指标表、公式和数据血缘 | 同名指标可能口径不同 |
| 异常检测 | 历史数据、阈值、季节和事件 | 异常点、影响和排查顺序 | 异常不等于错误或原因 |
| 可视化与仪表板 | 指标、受众、刷新频率 | 图表、交互看板和解释 | 避免误导性坐标和选择性展示 |
| 经营诊断 | 收入、成本、客户、产品和渠道数据 | 问题树、贡献分解和验证清单 | 相关性假设要用业务证据验证 |
| 预测与情景分析 | 历史数据、驱动因子、假设 | 基准/乐观/悲观情景 | 展示误差区间,不承诺准确结果 |
| 自动化报告 | 数据、模板、管理问题 | 日报、周报、月报和行动项 | 对外披露数据需财务/管理层确认 |
| 口径与数据治理 | 数据字典、系统字段、指标文档 | 口径冲突、责任人和治理清单 | 治理是业务与数据团队共同责任 |
三个优先场景在各岗位下按同一套方法拆解:明确任务口径 → 收集并检查输入 → 让 WorkBuddy 执行整理、检索或生成 → 输出可编辑结果 → 由岗位负责人复核后进入下一流程。
这一场景的目标是把Excel/CSV、字段定义、质量规则整理成清洗数据、问题清单和处理日志。

这一场景的目标是把多文件、主键、时间和口径整理成合并表、未匹配项和重复项。

这一场景的目标是把业务定义、公式、源字段整理成指标表、公式和数据血缘。
同一个岗位的场景会分散在四层里:文件层只用本地文档就能跑, 知识层要先建好有版本、有出处、有权限的资料,系统层要接业务系统, 决策层则必须保留人工批准。先看自己能从哪一层起步。
使用本地文档、表格和模板,结果可人工检查
建立有版本、有出处、有权限的知识资料
通过受控的Connector、MCP或API读写业务系统
展示依据、假设和影响,高风险决定由人批准
推荐先做“数据清洗”。它所需输入是Excel/CSV、字段定义、质量规则,目标交付是清洗数据、问题清单和处理日志。
试点可按四个动作推进:第一,抽取一批真实历史任务作为基线;第二,用同一批输入让人工流程和WorkBuddy流程并行;第三,记录失败、遗漏和人工修改原因;第四,只在结果稳定、权限清楚、可以回滚时扩大范围。
建议验收指标包括:清洗耗时、口径错误率、分析返工率。如果结果需要大量重做、来源无法追溯、系统写入不可回滚,试点应暂停并先修复数据或流程。
把你们这个岗位最耗人的一件事说清楚,我们按上面四层能力给出可切入点、需要对接的系统清单和人工边界 —— 不是通用方案,是照着你们现有流程改的版本。