R语言:ggplot2精细化绘图—以实用商业化图表绘图为例
本文旨在介绍R语言中ggplot2包的一些精细化操作,主要适用于对R画图有一定了解,需要更精细化作图的人,尤其是那些刚从excel转ggplot2的各位,有比较频繁的作图需求的人。不讨论那些样式非常酷炫的图表,以实用的商业化图表为主。包括以下结构:
1、画图前的准备:自定义ggplot2格式刷
2、画图前的准备:数据塑形利器dplyr / tidyr介绍
3、常用的商业用图:
1)简单柱形图+文本(单一变量)
2)分面柱形图(facet_wrap/facet_grid)
3)簇型柱形图(position=”dodge”)
4)堆积柱形图(需要先添加百分比,再对百分比的变量做柱形图)
5)饼图、极坐标图
6)多重线性图
这篇文章其实是我之前那篇博文的一个延续。因为接了一个活要用R定制化数据报表,其中涉及大量的对图表精雕细琢的工作。在深入研究ggplot2时,深深感觉到用ggplot2画图与用excel画图的不一样。
如果要用ggplot2画图,还是需要了解很多技术细节的。这些细节要么散落在R可视化技术和ggplot2:数据分析与图表技术这两本书里,要么散落在网上。因此在这里以我学习和总结的过程,对ggplot2的精细化画图做一个阐述,介绍我整理后的作图理念。
如果有进一步学习需要的各位,请直接买书或者自己实践学习。很多技术细节需要自己摸索才知道的,祝大家好运。
在画图前,我们首先定义一下ggplot2格式刷。
首先,ggplot2本身自带了很漂亮的主题格式,如theme_gray和theme_bw。但是在工作用图上,很多公司对图表格式配色字体等均有明文的规定。像我们公司,对主色、辅色、字体等都有严格的规定。如刘万祥老师早期的一篇配色博文里,大家更是可以看到,很多商业杂志的图表,配色风格都是非常相近的。因此,修改主题,使其更加适合我们的商业需求,保持图表风格统一,是非常必要的。
虽然ggplot2可以通过代码的追加,细细修改表距、背景色以及字体等框架。但是如果每做一个图,都要如此细调,代码将会非常繁琐,而且万一老板突然兴起要换风格时,代码修改将会非常痛苦。
幸运的是,ggplot2允许我们事先定制好图表样式,我们可以生成如mytheme或者myline这样的有明确配色主题的对象,到时候就像excel的定制保存图表模板或者格式刷,直接在生成的图表里引用格式刷型的主题配色,就可以快捷方便的更改图表内容,保持风格的统一了。
在运行之前,首先加载相关包
library(ggplot2)
library(dplyr)
library(ColorBrewer)
library(tidyr)
library(grid)
#载入格式刷
######
#定义好字体
windowsFonts(CA=windowsFont("Calibri"))
接下来是一个示范。我首先共享了我常用的一个主题刷,配色参考以下:
主体色:蓝色 085A9C ,红色 EF0808,灰色 526373
辅助色:浅黄色 FFFFE7,橙色 FF9418, 绿色 219431, 明黄色 FF9418,紫色 9C52AD
定制了mytheme, myline_blue, mycolour等多个对象:
1
#定义好字体
2 windowsFonts(CA=windowsFont("Calibri"))
3 #事先定制好要加图形的形状、颜色、主题等
4 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
5 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
6 mytheme<-theme_bw()+theme(legend.position="top",
7 panel.border=element_blank(),
8 panel.grid.major=element_line(linetype="dashed"),
9 panel.grid.minor=element_blank(),
10 plot.title=element_text(size=15,
11 colour="#003087",
12 family="CA"),
13 legend.text=element_text(size=9,colour="#003087",
14 family="CA"),
15 legend.key=element_blank(),
16 axis.text=element_text(size=10,colour="#003087",
17 family="CA"),
18 strip.text=element_text(size=12,colour="#EF0808",
19 family="CA"),
20 strip.background=element_blank()
21
22 )
23 pie_theme=mytheme+theme(axis.text=element_blank(),
24 axis.ticks=element_blank(),
25 axis.title=element_blank(),
26 panel.grid.major=element_blank())
27 #定制线的大小
28 myline_blue<-geom_line(colour="#085A9C",size=2)
29 myline_red<-geom_line(colour="#EF0808",size=2)
30 myarea=geom_area(colour=NA,fill="#003087",alpha=.2)
31 mypoint=geom_point(size=3,shape=21,colour="#003087",fill="white")
32 mybar=geom_bar(fill="#0C8DC4",stat="identity")
33 #然后是配色,考虑到样本的多样性,可以事先设定颜色,如3种颜色或7种颜色的组合
34 mycolour_3<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373"))
35 mycolour_7<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373",
36 "#FFFFE7","#FF9418","#219431","#9C52AD"))
37 mycolour_line_7<-scale_color_manual(values=c("#085A9C","#EF0808","#526373",
38 "#0C8DC4","#FF9418","#219431","#9C52AD"))
把以上代码在R里面运行以后,就可以直接使用了。譬如以下:
1)先生成一个简单的图表:
简单地指定x轴为离散型变量species,y为求和,会得到下面的柱形图
这时候,套用一下之前设置好的主题(mytheme),背景、坐标轴还有字体颜色就相应改变了。
然后,因为之前格式刷部分我设定了一个蓝色的柱形图样式(mybar),这里直接引用的话,就可以直接生成蓝色的柱形图了。
有了事先设定的一些格式刷以后,我们就可以快速有效地作图了。
但是在作图之前,就像excel作图总要先把数据用处理成想要的形式 。在excel里面,我们常用的是数据透视表或者一些公式辅助,而在R里,则是用一些常用的包,如dplyr及tidyr,对数据进行重塑再造
在我之前看的那两本ggplot2的书里,基本用的都是reshape2+plyr的组合。但实际上hadley后续出的dplyr与tidyr更加有用。具体的使用方法,在JHU Getting and cleaning data有介绍,老师还编了一个swirl课程供人使用,安装方法如下。
其他的也可以参考我这篇博文
总之,用好dplyr的话,你可以快速的把一些数据,如下面的股票逐笔成交记录
数据分析咨询请扫描二维码
在准备数据分析师面试时,掌握高频考题及其解答是应对面试的关键。为了帮助大家轻松上岸,以下是10个高频考题及其详细解析,外加 ...
2024-12-20互联网数据分析师是一个热门且综合性的职业,他们通过数据挖掘和分析,为企业的业务决策和运营优化提供强有力的支持。尤其在如今 ...
2024-12-20在现代商业环境中,数据分析师是不可或缺的角色。他们的工作不仅仅是对数据进行深入分析,更是协助企业从复杂的数据信息中提炼出 ...
2024-12-20随着大数据时代的到来,数据驱动的决策方式开始受到越来越多企业的青睐。近年来,数据分析在人力资源管理中正在扮演着至关重要的 ...
2024-12-20在数据分析的世界里,表面上的技术操作只是“入门票”,而真正的高手则需要打破一些“看不见的墙”。这些“隐形天花板”限制了数 ...
2024-12-19在数据分析领域,尽管行业前景广阔、岗位需求旺盛,但实际的工作难度却远超很多人的想象。很多新手初入数据分析岗位时,常常被各 ...
2024-12-19入门数据分析,许多人都会感到“难”,但这“难”究竟难在哪儿?对于新手而言,往往不是技术不行,而是思维方式、业务理解和实践 ...
2024-12-19在如今的行业动荡背景下,数据分析师的职业前景虽然面临一些挑战,但也充满了许多新的机会。随着技术的不断发展和多领域需求的提 ...
2024-12-19在信息爆炸的时代,数据分析师如同探险家,在浩瀚的数据海洋中寻觅有价值的宝藏。这不仅需要技术上的过硬实力,还需要一种艺术家 ...
2024-12-19在当今信息化社会,大数据已成为各行各业不可或缺的宝贵资源。大数据专业应运而生,旨在培养具备扎实理论基础和实践能力,能够应 ...
2024-12-19阿里P8、P9失业都找不到工作?是我们孤陋寡闻还是世界真的已经“癫”成这样了? 案例一:本硕都是 985,所学的专业也是当红专业 ...
2024-12-19CDA持证人Louis CDA持证人基本情况 我大学是在一个二线城市的一所普通二本院校读的,专业是旅游管理,非计算机非统计学。毕业之 ...
2024-12-18最近,知乎上有个很火的话题:“一个人为何会陷入社会底层”? 有人说,这个世界上只有一个分水岭,就是“羊水”;还有人说,一 ...
2024-12-18在这个数据驱动的时代,数据分析师的技能需求快速增长。掌握适当的编程语言不仅能增强分析能力,还能帮助分析师从海量数据中提取 ...
2024-12-17在当今信息爆炸的时代,数据分析已经成为许多行业中不可或缺的一部分。想要在这个领域脱颖而出,除了热情和毅力外,你还需要掌握 ...
2024-12-17数据分析,是一项通过科学方法处理数据以获取洞察并支持决策的艺术。无论是在商业环境中提升业绩,还是在科研领域推动创新,数据 ...
2024-12-17在数据分析领域,图表是我们表达数据故事的重要工具。它们不仅让数据变得更加直观,也帮助我们更好地理解数据中的趋势和模式。相 ...
2024-12-16在当今社会,我们身处着一个飞速发展、变化迅猛的时代。不同行业在科技进步、市场需求和政策支持的推动下蓬勃发展,呈现出令人瞩 ...
2024-12-16在现代商业世界中,数据分析师扮演着至关重要的角色。他们通过解析海量数据,为企业战略决策提供有力支持。要有效完成这项任务, ...
2024-12-16在当今数据爆炸的时代,数据分析师是组织中不可或缺的导航者。他们通过从大量数据中提取可操作的洞察力,帮助企业在竞争激烈的市 ...
2024-12-16