数据“沉睡”制约大数据产业发展
小到敲击键盘、迈开步子,大到征信系统、政务记录,数据已成这个时代最具活跃的要素和最有价值的“信息矿产”。无论“互联网+”、物联网还是智能制造,数据触角无所不在,影响着几乎所有产业生态未来走向。
中国信息通信研究院发布的《大数据白皮书(2016)》显示,未来5年,全球数据量将呈指数级增长,但庞大的总量并不意味着可完全有效的开发利用。据了解,除了技术瓶颈外,开放和合作的障碍正在让大量数据陷入“沉睡”。数据原材料的缺乏与信息“孤岛”的形成,严重制约着大数据产业的发展。
壁垒让数据“沉睡”
国际数据公司(IDC)的数据显示,按目前发展趋势,预计2020年全球大数据总存储量将达到44ZB(1ZB约等于10000亿GB)。我国数据总量为909EB(1EB约等于1000亿GB),占全球数据总量的13%。
目前数据层面的壁垒普遍存在于政企、企业间,业内人士表示,针对现状普遍是通过购买和“爬虫”(自动获取网页内容的手段)的方式获取,但数据存在不准确、不全和非结构化等问题。
“相比于行业间的数据流通,政企之间的壁垒更是一块沉睡数据的"集聚地"。”中关村(000931,股吧)大数据产业联盟秘书长赵国栋说,“目前一些上市数据如股权占比、科研数据都是价值密度比较高的"沉睡"数据。”
据中国信息通信研究院2015年对国内800多家企业的调研来看, 企业内部数据仍是大数据的主要来源。当前有32%的企业通过外部购买数据;只有18%的企业使用政府开放数据。
业内人士表示,大数据时代的数据资源广泛散布于政府、行业、企业三个子系统中,其中,信息数据资源80%以上掌握在各级政府部门手里。与此同时,区域部门间基本实现共享的省级地方仅占13%,区域部门间少量实现共享的地市和区县仅占32%和28%,信息共享和业务协同在地市和区县进展缓慢。
“如果更多数据可以开放,将会对产业转型、政务和公共服务效率提升等大有裨益。”上海至信普林科技有限公司总经理顾敏洁说,“比如中国人民银行上海总部自2006年起公开金融信息后,催生了一批金融信息咨询服务公司,其中包括5家上市公司。”
三大原因致数据孤岛“造成数据孤岛的成因是数据割据、技术壁垒和标准缺失。”赵国栋说。观念问题是主观意愿缺失的症结。“政府部门由于缺乏企业间基于共同利益开发这样的主观能动性,导致数据开放滞后。除了政府部门,一些大企业也应该认识到数据合理开放可以造就更好的行业生态价值。”
外部管理规范、法规的缺失也使部分主体对开放数据保持顾虑。“目前如果只遵循"谁的数据谁负责"这一简单的准则,要调动政府部门开放数据的积极性比较困难。”DT大数据产业创新研究院院长陈新河说。
除了主观意愿,技术和标准也是一道“硬门槛”。“比如目前信息共享的安全问题。公共云的运维工作面临着一些新的安全风险和挑战。计算环境从本地到云端的自身安全性是提高了,但由于公共云的运维管理工作必须通过互联网完成,和传统IT环境运维有很大不同,容易造成管理员权限被劫持攻击,造成运维管理账号和凭证泄露等问题。”顾敏洁说。
目前开放的数据同样因格式标准缺失成了“开放的孤岛”。公布类似停车位数量、开放非标准化的图表等形式的数据都是不可机读的。这类“伪开放”并没有真正整合数据的价值。“不同行业数据整合必然需要标准化的数据格式,比如从卫生、人口的角度用数据对"人"进行的描述就是不一样的。”全国信息安全标准化技术委员会大数据标准工作组成员张群说。
“因此目前要开放的应该是底层数据,而不仅提供根据数据分析出来的结果或产品。”业内专家表示,这类数据在技术上应该有其标准形式,可以被计算机抓取、调用,而且在法律上也是可以进行各种使用的。
开放整合数据需围绕应用场景
要打通数据孤岛,一方面是技术上的革新和标准化的推进,同时包括数据安全领域建设。“在物联网时代,需要从政府等层面推进包括身份识别、信息安全系统等庞大的安全体系建设。”赵国栋说。
“目前全国信息技术标准化技术委员会已推进获批了6项大数据领域的标准,包括了大数据技术参考模型、数据能力成熟度评价模型标准等。”张群说。
另一方面,在法律维度,立法推进的前提是明确数据权属。对此,赵国栋建议,可以参照土地管理的做法,将数据权属划分为所有权、处置权、使用权和收益权。“例如处置权应归国家,规定归档、删除的各种条件等。只有权属清楚才能推动法律保护。”
政府数据开放也并非一蹴而就,需要循序渐进。业内人士认为,不涉及隐私和安全的数据可以率先开放,比如气象这类数据。同时政府部门和行业协会可以推动统一数据平台的建设,改变目前碎片化的现状。
杭州市经济和信息化委云计算与大数据产业处处长黄左彦说:“杭州整合数据、搭建平台过程中的经验就是以项目为突破,目前类似"5G"车联网项目、城市数据大脑等都是以交通为突破点。由政府主导政务数据开放共享,企业自带资金深度合作开发,其中包括数据交流。”
“目前观念上有一个原则是被忽视的:即"开放是常规,封闭才是例外"。”陈新河说,“政企间或者政府牵头整合数据仍应围绕应用场景、项目工程来,否则目前"唤醒"的数据早晚也会重新"落满灰尘"。”
数据分析咨询请扫描二维码
《Python数据分析极简入门》 第2节 4 Pandas条件查询 在pandas中,可以使用条件筛选来选择满足特定条件的数据 importpanda ...
2024-11-22数据分析师的工作内容涉及多个方面,主要包括数据的收集、整理、分析和可视化,以支持商业决策和问题解决。以下是数据分析师的一 ...
2024-11-21数据分析师必须掌握的技能可以从多个方面进行归纳和总结。以下是数据分析师需要具备的主要技能: 统计学基础:数据分析师需要 ...
2024-11-21数据分析入门的难易程度因人而异,总体来看,入门并不算特别困难,但需要一定的学习和实践积累。 入门难度:数据分析入门相对 ...
2024-11-21数据分析是一项通过收集、整理和解释数据来发现有用信息的过程,它在现代社会中具有广泛的应用和重要性。数据分析能够帮助人们更 ...
2024-11-21数据分析行业正在迅速发展,随着技术的不断进步和数据量的爆炸式增长,企业对数据分析人才的需求也与日俱增。本文将探讨数据分析 ...
2024-11-21数据分析的常用方法包括多种技术,每种方法都有其特定的应用场景和优势。以下是几种常见的数据分析方法: 对比分析法:通过比 ...
2024-11-21企业数字化转型是指企业利用数字技术对其业务进行改造和升级,以实现提高效率、降低成本、创新业务模式等目标的过程。这一过程不 ...
2024-11-21数据分析作为一个备受追捧的职业领域,吸引着越来越多的女性加入其中。对于女生而言,在选择成为一名数据分析师时,行业选择至关 ...
2024-11-21大数据技术专业主要学习计算机科学、数学、统计学和信息技术等领域的基础理论和技能,旨在培养具备大数据处理、分析和应用能力的 ...
2024-11-21《Python数据分析极简入门》 第2节 3 Pandas数据查看 这里我们创建一个DataFrame命名为df: importnumpyasnpi ...
2024-11-21越老越吃香的行业主要集中在需要长时间经验积累和专业知识的领域。这些行业通常知识更新换代较慢,因此随着年龄的增长,从业者能 ...
2024-11-20数据导入 使用pandas库的read_csv()函数读取CSV文件或使用read_excel()函数读取Excel文件。 支持处理不同格式数据,可指定分隔 ...
2024-11-20大数据与会计专业是一门结合了大数据分析技术和会计财务理论知识的新型复合型学科,旨在培养能够适应现代会计业务新特征的高层次 ...
2024-11-20要成为一名数据分析师,需要掌握一系列硬技能和软技能。以下是成为数据分析师所需的关键技能: 统计学基础 理解基本的统计概念 ...
2024-11-20是的,Python可以用于数据分析。Python在数据分析领域非常流行,因为它拥有丰富的库和工具,能够高效地处理从数据清洗到可视化的 ...
2024-11-20在这个数据驱动的时代,数据分析师的角色变得愈发不可或缺。他们承担着帮助企业从数据中提取有价值信息的责任,而这些信息可以大 ...
2024-11-20数据分析作为现代信息时代的支柱之一,已经成为各行业不可或缺的工具。无论是在商业、科研还是日常决策中,数据分析都扮演着至关 ...
2024-11-20数字化转型已成为当今商业世界的热点话题。它不仅代表着技术的提升,还涉及企业业务流程、组织结构和文化的深层次变革。理解数字 ...
2024-11-20在现代社会的快速变迁中,选择一个具有长期增长潜力的行业显得至关重要。了解未来发展前景好的行业不仅能帮助我们进行职业选择, ...
2024-11-20