京公网安备 11010802034615号
			经营许可证编号:京B2-20210330
		R语言:ggplot2精细化绘图—以实用商业化图表绘图为例
本文旨在介绍R语言中ggplot2包的一些精细化操作,主要适用于对R画图有一定了解,需要更精细化作图的人,尤其是那些刚从excel转ggplot2的各位,有比较频繁的作图需求的人。不讨论那些样式非常酷炫的图表,以实用的商业化图表为主。包括以下结构:
		1、画图前的准备:自定义ggplot2格式刷 
2、画图前的准备:数据塑形利器dplyr / tidyr介绍 
3、常用的商业用图:
	
		1)简单柱形图+文本(单一变量) 
2)分面柱形图(facet_wrap/facet_grid) 
3)簇型柱形图(position=”dodge”) 
4)堆积柱形图(需要先添加百分比,再对百分比的变量做柱形图) 
5)饼图、极坐标图 
6)多重线性图
	
这篇文章其实是我之前那篇博文的一个延续。因为接了一个活要用R定制化数据报表,其中涉及大量的对图表精雕细琢的工作。在深入研究ggplot2时,深深感觉到用ggplot2画图与用excel画图的不一样。
如果要用ggplot2画图,还是需要了解很多技术细节的。这些细节要么散落在R可视化技术和ggplot2:数据分析与图表技术这两本书里,要么散落在网上。因此在这里以我学习和总结的过程,对ggplot2的精细化画图做一个阐述,介绍我整理后的作图理念。
如果有进一步学习需要的各位,请直接买书或者自己实践学习。很多技术细节需要自己摸索才知道的,祝大家好运。
在画图前,我们首先定义一下ggplot2格式刷。
首先,ggplot2本身自带了很漂亮的主题格式,如theme_gray和theme_bw。但是在工作用图上,很多公司对图表格式配色字体等均有明文的规定。像我们公司,对主色、辅色、字体等都有严格的规定。如刘万祥老师早期的一篇配色博文里,大家更是可以看到,很多商业杂志的图表,配色风格都是非常相近的。因此,修改主题,使其更加适合我们的商业需求,保持图表风格统一,是非常必要的。
虽然ggplot2可以通过代码的追加,细细修改表距、背景色以及字体等框架。但是如果每做一个图,都要如此细调,代码将会非常繁琐,而且万一老板突然兴起要换风格时,代码修改将会非常痛苦。
幸运的是,ggplot2允许我们事先定制好图表样式,我们可以生成如mytheme或者myline这样的有明确配色主题的对象,到时候就像excel的定制保存图表模板或者格式刷,直接在生成的图表里引用格式刷型的主题配色,就可以快捷方便的更改图表内容,保持风格的统一了。
在运行之前,首先加载相关包
library(ggplot2)
library(dplyr)
library(ColorBrewer)
library(tidyr)
library(grid)
#载入格式刷
######
#定义好字体
windowsFonts(CA=windowsFont("Calibri"))
		接下来是一个示范。我首先共享了我常用的一个主题刷,配色参考以下:
			主体色:蓝色 085A9C ,红色 EF0808,灰色 526373 
辅助色:浅黄色 FFFFE7,橙色 FF9418, 绿色 219431, 明黄色 FF9418,紫色 9C52AD
		
定制了mytheme, myline_blue, mycolour等多个对象:
			 1 
#定义好字体
 2 windowsFonts(CA=windowsFont("Calibri"))
 3 #事先定制好要加图形的形状、颜色、主题等
 4 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
 5 #定制主题,要求背景全白,没有边框。然后所有的字体都是某某颜色
 6 mytheme<-theme_bw()+theme(legend.position="top",
 7                           panel.border=element_blank(),
 8                           panel.grid.major=element_line(linetype="dashed"),
 9                           panel.grid.minor=element_blank(),
10                           plot.title=element_text(size=15,
11                                                   colour="#003087",
12                                                   family="CA"),
13                           legend.text=element_text(size=9,colour="#003087",
14                                                    family="CA"),
15                           legend.key=element_blank(),
16                           axis.text=element_text(size=10,colour="#003087",
17                                                  family="CA"),
18                           strip.text=element_text(size=12,colour="#EF0808",
19                                                   family="CA"),
20                           strip.background=element_blank()
21 
22                         )
23 pie_theme=mytheme+theme(axis.text=element_blank(),
24                         axis.ticks=element_blank(),
25                         axis.title=element_blank(),
26                         panel.grid.major=element_blank())
27 #定制线的大小
28 myline_blue<-geom_line(colour="#085A9C",size=2)
29 myline_red<-geom_line(colour="#EF0808",size=2)
30 myarea=geom_area(colour=NA,fill="#003087",alpha=.2)
31 mypoint=geom_point(size=3,shape=21,colour="#003087",fill="white")
32 mybar=geom_bar(fill="#0C8DC4",stat="identity")
33 #然后是配色,考虑到样本的多样性,可以事先设定颜色,如3种颜色或7种颜色的组合
34 mycolour_3<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373"))
35 mycolour_7<-scale_fill_manual(values=c("#085A9C","#EF0808","#526373",
36 "#FFFFE7","#FF9418","#219431","#9C52AD"))
37 mycolour_line_7<-scale_color_manual(values=c("#085A9C","#EF0808","#526373",
38                                              "#0C8DC4","#FF9418","#219431","#9C52AD"))
		
把以上代码在R里面运行以后,就可以直接使用了。譬如以下:
1)先生成一个简单的图表:
简单地指定x轴为离散型变量species,y为求和,会得到下面的柱形图
			 
		
这时候,套用一下之前设置好的主题(mytheme),背景、坐标轴还有字体颜色就相应改变了。
			 
		
然后,因为之前格式刷部分我设定了一个蓝色的柱形图样式(mybar),这里直接引用的话,就可以直接生成蓝色的柱形图了。
			 
		
有了事先设定的一些格式刷以后,我们就可以快速有效地作图了。
但是在作图之前,就像excel作图总要先把数据用处理成想要的形式 。在excel里面,我们常用的是数据透视表或者一些公式辅助,而在R里,则是用一些常用的包,如dplyr及tidyr,对数据进行重塑再造
在我之前看的那两本ggplot2的书里,基本用的都是reshape2+plyr的组合。但实际上hadley后续出的dplyr与tidyr更加有用。具体的使用方法,在JHU Getting and cleaning data有介绍,老师还编了一个swirl课程供人使用,安装方法如下。
其他的也可以参考我这篇博文
			总之,用好dplyr的话,你可以快速的把一些数据,如下面的股票逐笔成交记录 
 
		
                  数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【2025最新版】CDA考试教材:CDA教材一级:商业数据分析(2025)__商业数据分析_cda教材_考试教材 (cdaglobal.com) ...
2025-11-04教材入口:https://edu.cda.cn/goods/show/3151 “纲举目张,执本末从。”若想在数据分析领域有所收获,一套合适的学习教材至关 ...
2025-11-04在数字化时代,数据挖掘不再是实验室里的技术探索,而是驱动商业决策的核心能力 —— 它能从海量数据中挖掘出 “降低成本、提升 ...
2025-11-04在 DDPM(Denoising Diffusion Probabilistic Models)训练过程中,开发者最常困惑的问题莫过于:“我的模型 loss 降到多少才算 ...
2025-11-04在 CDA(Certified Data Analyst)数据分析师的工作中,“无监督样本分组” 是高频需求 —— 例如 “将用户按行为特征分为高价值 ...
2025-11-04当沃尔玛数据分析师首次发现 “啤酒与尿布” 的高频共现规律时,他们揭开了数据挖掘最迷人的面纱 —— 那些隐藏在消费行为背后 ...
2025-11-03这个问题精准切中了配对样本统计检验的核心差异点,理解二者区别是避免统计方法误用的关键。核心结论是:stats.ttest_rel(配对 ...
2025-11-03在 CDA(Certified Data Analyst)数据分析师的工作中,“高维数据的潜在规律挖掘” 是进阶需求 —— 例如用户行为包含 “浏览次 ...
2025-11-03在 MySQL 数据查询中,“按顺序计数” 是高频需求 —— 例如 “统计近 7 天每日订单量”“按用户 ID 顺序展示消费记录”“按产品 ...
2025-10-31在数据分析中,“累计百分比” 是衡量 “部分与整体关系” 的核心指标 —— 它通过 “逐步累加的占比”,直观呈现数据的分布特征 ...
2025-10-31在 CDA(Certified Data Analyst)数据分析师的工作中,“二分类预测” 是高频需求 —— 例如 “预测用户是否会流失”“判断客户 ...
2025-10-31在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29在数据分析中,“正态分布” 是许多统计方法(如 t 检验、方差分析、线性回归)的核心假设 —— 数据符合正态分布时,统计检验的 ...
2025-10-28箱线图(Box Plot)作为展示数据分布的核心统计图表,能直观呈现数据的中位数、四分位数、离散程度与异常值,是质量控制、实验分 ...
2025-10-28在 CDA(Certified Data Analyst)数据分析师的工作中,“分类变量关联分析” 是高频需求 —— 例如 “用户性别是否影响支付方式 ...
2025-10-28