首先,要了解数据分析的一般流程是什么?
可以将一个完整的数据分析项目分为以下五个流程:
数据获取
外部数据主要有三种获取方式,一种是获取国内一些网站上公开的数据资料,例如国家统计局;一种是通过爬虫等工具获取网站上的数据。还有一种是通过企业内部的数据库,SPSS有丰富的数据库接口,可以便捷地从数据库中读取数据。
数据存储
对于数据量不大的项目,可以使用excel来处理数据,但对于数据量过万的项目,使用数据库来存储与管理会更高效便捷。SPSS也有自己的用作数据储存的数据格式,sav文件。用户可以将经过SPSS处理的数据保存为sav格式,同时也可以非常方便地将sav文件转换为其他数据格式文件。
数据预处理
数据预处理也称数据清洗。大多数情况下,我们拿到手的数据是格式不一致,存在异常值、缺失值等问题的,而不同项目数据预处理步骤的方法也不一样。数据分析有80%的工作都在处理数据,可见数据预处理在数据分析的重要性。
建模与分析
这一阶段首先要清楚数据的结构,结合项目需求来选取模型。
可视化分析
数据分析最后一步是撰写数据分析报告,一般包括数据可视化分析。
其次,掌握了数据分析的一般流程后,便要以SPSS为工具,根据以下流程对一个完整项目进行以下细分并掌握: