阶段一 · 打地基:Excel + 统计学 + Python 基础
约 1.5–2 个月
不急着写代码,先用 Excel 建立「数据处理」的手感,同时补上统计学与 Python 语法两块地基。
Excel 透视表 / 常用函数(VLOOKUP、IF、SUMIFS)
描述统计:均值、中位数、标准差、分布
概率基础与抽样估计
Python 语法:变量、循环、函数、文件读写
Jupyter Notebook 基本操作
阶段产出:用 Excel 完成一份真实业务场景的报表(如销售数据按月汇总 + 透视分析),并附 1 页结论说明。
阶段二 · Python 数据分析核心:NumPy / Pandas / 可视化
约 2 个月
这是数据分析师的「吃饭本领」。重点不是语法,而是用 Pandas 完成真实数据的清洗、转换与探索。
NumPy:数组与向量化计算
Pandas:DataFrame、缺失值/重复值/异常值处理
分组聚合 groupby、合并连接 merge
Matplotlib / Seaborn:20+ 种图表
EDA 探索性数据分析流程
阶段产出:下载一份 Kaggle 公开数据集,用 Pandas 完成清洗 + 探索性分析(EDA),输出带图表的分析 Notebook。
阶段三 · SQL 与数据库:查询语言是面试第一关
约 1–1.5 个月
几乎每一场数据分析师面试都会考 SQL。练到「看到业务问题就能写出查询」为止。
SELECT / WHERE / ORDER BY / LIMIT
聚合与 GROUP BY / HAVING
多表 JOIN(内连接、左连接)
子查询与 CASE WHEN
窗口函数 ROW_NUMBER / RANK / SUM OVER
索引与查询性能基础
阶段产出:在牛客 / LeetCode 刷完 50+ 道 SQL 题;并用 SQL 完成一次「用户留存分析」(如按注册日分组计算次日/7日留存率)。
阶段四 · 数据可视化与 BI 报表
约 1 个月
让「数据会说话」:掌握可视化设计原则,并至少精通一个 BI 工具 + 一个前端图表库。
可视化原则:图表选型、配色、避免误导
Tableau Public(免费)仪表板
Power BI Desktop(免费)
ECharts 动态图表
数据故事:一图一结论
阶段产出:用 Tableau Public 发布 1 个公开交互仪表板;用 ECharts 做一个 3 图联动的网页看板。
阶段五 · 业务分析与统计学进阶
约 1–2 个月
从「会做分析」升级到「会做业务分析」。学会用指标体系与假设检验回答业务问题。
指标体系:北极星指标、漏斗、留存、DAU/MAU、GMV、ARPU
A/B 测试:设计与显著性解读
假设检验实战(t 检验、卡方检验)
回归分析入门:相关 vs 因果
用户分层:RFM、用户画像
分析框架:漏斗分析、归因分析、异动归因
阶段产出:完成 1 份完整业务分析报告:明确问题 → 提出假设 → 取数验证 → 输出结论与可落地建议。
阶段六 · 机器学习入门 + 项目实战与求职
约 2 个月+
会用 Scikit-learn 跑通常见模型,并用 2–3 个完整项目武装简历,边做项目边准备面试。
机器学习基础:监督/无监督学习
Scikit-learn:线性/逻辑回归、决策树、随机森林、KMeans
模型评估:准确率/召回率/交叉验证
特征工程入门
Kaggle 入门赛(Titanic、House Prices)
简历项目包装 + SQL/统计/业务面试题
阶段产出:2–3 个可展示的完整项目(GitHub 仓库 + 文档),1 份针对性简历,以及 1 个公开的作品集链接。