京公网安备 11010802034615号
经营许可证编号:京B2-20210330
交通大数据,在新老技术概念间架设桥梁
交通大数据所采集的信息与传统交通调查数据之间存在很大差异,尽管我们可以采用例如“居民活动空间”等新技术概念来适应其特点,但是在许多情况下,仍然希望能够在新旧概念之间架设桥梁。例如,移动通信数据与围绕居民出行OD的交通调查所采集的数据存在一定程度上的差异,但是两者存在能够在部分参数上反映出来的内在联系。
交通调查通过访问调查记录居民一天的全部出行,包括出行时间、目的地、交通方式等,可以说详细记录了居民口述的出行活动。但是其缺陷是无法实现大样本调查(目前城市综合交通调查一般抽样率为1-5%),不能连续观测(尽管交通调查中也有连续追踪调查的方法,但是只能对少数典型用户实施,其抽样数量一般为数千户这样的量级)。
移动通信数据本质上是在满足通信需求基础上产生的用户时空位置信息,如果将其转换到传统出行OD概念,则需要增加很强的假设。对于一般大规模信息采集所使用的信令数据来说,由于移动通信数据的时空精度(其时间上具有与活动起始时刻不能对应的误差;其空间上获得的是所属基站,具有数百米至数公里的误差)并非理想,勉强转换成为OD数据其可信度往往受到很大的质疑。
尽管如此,我们仍然可以发现两种数据所形成的某些参数具有很强的相关性,从而可以通过建立转换模型(尽管这种转换模型需要定期标定)实现两者的映射。
图1中显示了上海市顾村居民利用移动通信数据测定的活动点(连续停留30分钟以上的空间位置)空间分布,以及居民出行调查获得的出行D点空间分布的对比情况,由于数据所反映的活动日期(手机数据所选取的调查数据为2011年9月1日至2011年9月30日期间识别出来的顾村居住社区居民用户数据,问卷数据为2012年8月29日至2012年9月4日的顾村大型居住社区入户问卷调查数据。)存在差异,以及样本数量的差异,其空间分布亦存在少许不同,但是总体态势是一致的。
*图中色块深浅表示在该区域内活动占全部活动的百分比
图1 不同数据源提取的上海市顾村大型居住社区居民活动空间分布对比
当然这种直观的判断不能代替科学的检验,在表1中是采用Kolmogorov-Smirnov检验,对两种数据源在交通大区尺度的空间分布是否相同进行一致性分析结果,其双侧检验显著性概率均有p>0.05,证实了两样本数据具有相同分布的假设。
表1 部分社区移动通信数据与调查数据Kolmogorov-Smirnov检验统计量
在移动通信所检测的活动点与传统技术概念中出行率之间也存在很大的关联性。在上海市选取了10个不同区位的地区,采用移动通信数据测定居住在该区域居民的活动点数量,并进一步与第四次综合交通调查获得的相同区域居民出行率进行比较(参见图2),可以清楚地看到这种关联性。
图2 上海市居民日均出行率与移动通信活动点回归分析结果
这样的实验结果令我们感到高兴,因为可以采用移动通信数据获得某些居民活动特征后,将其转换为传统基于出行OD概念技术体系中的部分参数。从而使得有可能在具有说服力检验基础上,在两次大规模综合交通调查之间(一般为5-10年),采用移动通信数据修正其中的部分参数。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师 出品 作者:李诗怡 一、数据分析四大思维 1. 对比思维:没有对比就没有分析 核心观点:单独一个数字没有意义,有 ...
2026-10-05Kimball 是方法,星型模型是它产出的形状。 很多人把"Kimball vs 星型模型"当成一道选择题——这本身就是个误会:Kimball 是动词 ...
2026-10-05写在开头 老板在微信上甩来一句: "帮我看下为什么销量跌了。" ” 你回工位,打开 SQL,开始写。查订单表、拉近三个月、按 ...
2026-10-03CDA数据分析师 出品 作者:李诗怡 1. 事实表 vs 维度表 对比维度 事实表 维度表 核心问题 记录“业务发生了什么事” 描述 ...
2026-10-02做数据聚合时,PySpark的groupBy()确实能完成统计,这也是它的本职工作。但它有一个根本性局限:每一组数据,最终只能返回一行 ...
2026-10-01热力地图是数据可视化中极具辨识度与实用性的空间分析图表,结合地理空间维度与数据密度特征,通过颜色深浅、色阶渐变直观展示数 ...
2026-09-30 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-09-30同样是“银行数据岗”,在国有大行总行数据中心、在一家城商行的零售部、在银行系金融科技子公司、在保险公司,工作内容、成长节 ...
2026-09-29在数据分析与统计学研究中,数据往往不是独立存在的,不同变量之间普遍存在相互关联、相互影响的关系。相关性统计分析是挖掘变量 ...
2026-09-29 导读:大多数人只把 dataclasses 当成偷懒工具,用来少写 __init__、__repr__ 这类魔法方法。但它的能力远不止于此。本文带 ...
2026-09-29 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-09-29在MySQL数据库运维与业务开发中,行业普遍存在“数据达到千万级就必须分表”的说法。但在实际生产环境中,千万条数据并不是强制 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 5W1H 分析法 定义:经典系统性思维框架,通过六个核心维度对问题进行全方位拆解与剖析,确 ...
2026-09-28 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-09-28CDA数据分析师 出品 作者:李诗怡 1. 用户标签体系 定义: 通过一系列高度精炼的特征标识,对用户属性、行为与偏好进行量化刻画 ...
2026-09-24Pandas是Python生态中用于表格数据处理的核心库,广泛应用于数据清洗、统计运算、报表输出、数据分析建模等场景。在处理极大数值 ...
2026-09-24随着数字经济快速发展,数据已成为核心生产要素,各行各业的业务沉淀、用户行为、设备运行、市场交易均产生海量数据。数据处理作 ...
2026-09-24 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-09-24在时序数据分析中,大部分业务数据并非持续平稳变化,而是会在某些时间节点出现突然抬升、断崖下跌、趋势反转、波动异变等现象, ...
2026-09-23在统计学与数据分析中,研究多组数据差异最常用的方法为单因素方差分析与事后多重比较。很多数据分析初学者容易混淆两者功能,认 ...
2026-09-23