全面构建大数据开放格局
近日,“2015中国互联网+信息社会高端论坛”举行,会议以“信息资源挖掘与数据开放未来”为主题,围绕大数据产业当前发展到什么阶段,存在哪些问题和挑战,产业各方应如何破解展开了讨论。
大数据产业开放渐成共识
大数据是继云计算、移动互联网之后快速崛起的热点领域,在经历了2013年大数据元年的飞速发展后,我国大数据领域逐渐从技术积累和尝试阶段步入了产业化发展阶段,具备了加快发展构建大数据产业链的基础条件和能力储备,产业链形态初现端倪。
2014年12月,《中国大数据技术与产业发展白皮书(2014)》发布,对2015年的大数据发展进行了趋势预测,数据的商品化、数据共享的联盟化以及提升政府治理能力分列其中。与此同时,《白皮书》用“融合、跨界、基础、突破”等主要关键词概括了我国大数据产业的未来走向。由此可见,大数据开放格局在产业链中的重要地位已成为行业的普遍共识和一致诉求。2015年4月14日,全国首个大数据交易所“贵阳大数据交易所”挂牌运营,首批大数据产品成功交易,这标志着大数据资产化和经济效益的直接转换,同时对促进大数据资产的流通和共享具有重要意义。
开放格局面临新挑战
在大数据开放过程中,笔者认为还存在以下问题:
一是多源数据水平参差不齐,可用性有待提高。开放格局下的数据源要求在现有数据获取途径的基础上,提供更多样化的数据采集手段,并进一步提升数据采集的范围、频度和精度。目前各细分行业的采集手段较难统一,不同行业领域生成数据的过程往往依靠私有化和定制化的设备来实现,这也导致了各行业领域对同一数据内容的解读存在广泛的不一致现象,影响了公共数据的梳理和聚集。例如对同一数据来源,不同的行业领域可能采用不同的编码方式、存储类型、索引结构等,尽管数据的天然属性是唯一的,但表现在技术方式上多种多样,人为地造成了数据的“多样性”,致使数据整合难度加大,数据的直接可用性严重低下。
二是数据模型的衍生速度滞后于应用发展。开放格局下的数据分析和挖掘工作重点由传统的单一领域数据分析转为多领域数据的综合分析,相对应的数据模型也从平面式模型结构向数据模型立方体转变。数据模型的规范性和共识性会直接影响数据分析结果和战略决策的准确性,因此,缺乏高效可用的数据模型成为开放格局下数据分析挖掘服务能力的瓶颈所在。此外,目前数据模型的生成和创新主要依赖人工预设、人工智能和机器学习等传统方式,针对多源数据关联的模型仍然不成熟,高质量数据模型的衍生速度尚不足以匹配应用的迭代速度和业务场景对数据分析结果的高要求。
三是混搭架构的存在要求重视顶层架构设计。一方面,数据来源的多样化,以及数据应用兼顾在线分析(olAP)、实时交易(olTP)等多场景的现实诉求,决定了企业必须借助混搭技术要素来设计复杂的数据架构。另一方面,传统企业碍于现实生产系统效率和准确性的影响,IT系统“去IOE”的过程较为缓慢且不彻底,基于小型机构建的Oracle数据库较难被完全替代,基础设施类型和数据组织方式的异构性同样导致了混搭数据架构可能长期存在。如何面向企业数据需求构建包括传统关系型数据库、内存数据库和分布式文件系统等多元素的混搭架构,成为开放格局下数据保有者进行顶层架构设计所面临的新问题。
四是数据私有化和开放诉求的天然矛盾持续升级。数据私有化不仅体现在数据保有者对原始数据的不断积累,同时也作用于ETL等数据的私有化加工过程。出于对企业信息和用户隐私的保护,数据保有者通常将加工处理后的原始数据作为数据内容开放给上层应用使用,但不公开相应的数据加工转换规则。在缺乏行业标准的统一指导下,开放哪些数据字段、字段的编码映射规则及数据加工的精度等都导致应用提供者在数据开放格局中处于被动地位。随着数据范围的不断扩大和多领域数据关联结果的指数级增长,数据私有化的壁垒效应会越发明显。
当前我国大数据产业的组织方式是遵照数据生命周期的各生产加工步骤展开的,在新的数据开放格局中,实现数据价值和提供更广泛的数据服务仍将贯穿大部分数据生产加工流程。面对开放环境给大数据产业带来的全新挑战,把握数据流转过程的核心环节,推进多层次数据能力开放,有助于促成我国数据产业开放格局快速形成。
首先是“治数据之本”,加强对数据质量的控制。数据质量控制是数据开放共享格局的核心要素之一,理顺开放格局下多重数据来源是保障数据产业良性发展的抓手。建立各细分领域自行保有数据、集中维系数据血缘关系的统分模式是从源头上打通数据生产隔阂,提升数据质量的有效举措。在跨领域数据关联和加工过程中,通过规范的数据加工规则或提供加工流程的回溯检验能力,能够最大限度地实现数据溯源。
其次是打造集成化的数据服务开放平台,降低数据服务使用门槛。通过架构和技术路线的定制化,政府或企业有能力实现自数据存储之后的全部数据流转环节。其中,数据的加工与预处理是减小数据规模、提高数据可用性和单位存储成本价值的必要环节,开放格局势必促进去隐私化数据清洗、匿名转换等具有共性的加工处理手段以第三方服务或集成服务的方式对外供给;数据分析和可视化工具的可集成性与友好的人机交互设计也是降低数据服务使用门槛的主要保障。通过搭建开放平台的方式将上述服务能力统一整合,并作用于企业生产、行业分析和政府公共治理等各领域,有望成为我国大数据产业链在开放共享格局下的新型发展模式。
最后是推进多层次数据能力开放,鼓励全产业环节积极参与。数据服务能力贯穿数据流转过程,其开放性体现在多个层面,如数据的传输接口、数据的加工处理手段、数据的分析挖掘工具、数据的公共模型、数据的可视化操作界面等都是能力开放的重要形式。鉴于开源技术逐渐成为大数据的主流架构,沿袭开源开放的发展思路,通过数据生产加工过程各环节的深度参与,不断丰富和完善产业环境,是探索我国大数据产业互惠共赢格局的有效途径。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-02最近我发现一个绝招,用DeepSeek AI处理Excel数据简直太爽了!处理速度嘎嘎快! 平常一整天的表格处理工作,现在只要三步就能搞 ...
2025-04-01你是否被统计学复杂的理论和晦涩的公式劝退过?别担心,“山有木兮:统计学极简入门(Python)” 将为你一一化解这些难题。课程 ...
2025-03-31在电商、零售、甚至内容付费业务中,你真的了解你的客户吗? 有些客户下了一两次单就消失了,有些人每个月都回购,有些人曾经是 ...
2025-03-31在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的需求持续飙升。世界经济论坛发布的《未来就业报告》, ...
2025-03-28你有没有遇到过这样的情况?流量进来了,转化率却不高,辛辛苦苦拉来的用户,最后大部分都悄无声息地离开了,这时候漏斗分析就非 ...
2025-03-27TensorFlow Datasets(TFDS)是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API,允许用户从现有集合中 ...
2025-03-26"不谋全局者,不足谋一域。"在数据驱动的商业时代,战略级数据分析能力已成为职场核心竞争力。《CDA二级教材:商业策略数据分析 ...
2025-03-26当你在某宝刷到【猜你喜欢】时,当抖音精准推来你的梦中情猫时,当美团外卖弹窗刚好是你想吃的火锅店…… 恭喜你,你正在被用户 ...
2025-03-26当面试官问起随机森林时,他到底在考察什么? ""请解释随机森林的原理""——这是数据分析岗位面试中的经典问题。但你可能不知道 ...
2025-03-25在数字化浪潮席卷的当下,数据俨然成为企业的命脉,贯穿于业务运作的各个环节。从线上到线下,从平台的交易数据,到门店的运营 ...
2025-03-25在互联网和移动应用领域,DAU(日活跃用户数)是一个耳熟能详的指标。无论是产品经理、运营,还是数据分析师,DAU都是衡量产品 ...
2025-03-24ABtest做的好,产品优化效果差不了!可见ABtest在评估优化策略的效果方面地位还是很高的,那么如何在业务中应用ABtest? 结合企业 ...
2025-03-21在企业数据分析中,指标体系是至关重要的工具。不仅帮助企业统一数据标准、提升数据质量,还能为业务决策提供有力支持。本文将围 ...
2025-03-20解锁数据分析师高薪密码,CDA 脱产就业班助你逆袭! 在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的 ...
2025-03-19在 MySQL 数据库中,查询一张表但是不包含某个字段可以通过以下两种方法实现:使用 SELECT 子句以明确指定想要的字段,或者使 ...
2025-03-17在当今数字化时代,数据成为企业发展的关键驱动力,而用户画像作为数据分析的重要成果,改变了企业理解用户、开展业务的方式。无 ...
2025-03-172025年是智能体(AI Agent)的元年,大模型和智能体的发展比较迅猛。感觉年初的deepseek刚火没多久,这几天Manus又成为媒体头条 ...
2025-03-14以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-13