数据“沉睡” 制约大数据产业发展
小到敲击键盘、迈开步子,大到征信系统、政务记录,数据已成这个时代最活跃的要素和最有价值的“信息矿产”。无论“互联网+”、物联网还是智能制造,数据的触角几乎无远弗届,影响着几乎所有产业生态未来的走向。
据中国信息通信研究院发布的《大数据白皮书(2016)》分析,未来五年,全球数据量将呈指数级增长。但庞大的总量却并不意味着完全有效的开发利用。《经济参考报》记者采访了解到,除了技术瓶颈外,开放和合作的障碍正在让大量数据陷入“沉睡”。数据原材料的缺乏与信息“孤岛”的形成,严重制约着大数据产业的发展。
壁垒让数据“沉睡”
国际数据公司(IDC)的数据显示,按目前发展趋势,预计2020年全球大数据总存储量将达到44ZB(1ZB约等于10000亿GB)。我国数据总量为909EB(1EB约等于1000亿GB),占全球数据总量的13%。
目前数据层面的壁垒普遍存在于政企、企业间,业内人士表示针对现状普遍是通过购买和“爬虫”(自动获取网页内容的手段)的方式获取,但数据存在不准确、不全和非结构化等问题。
“相比于行业间的数据流通,政企之间的壁垒更是一块沉睡数据的‘集聚地’。”中关村大数据产业联盟秘书长赵国栋说,“目前一些上市数据如股权占比、科研数据都是价值密度比较高的沉睡数据。”
据中国信息通信研究院2015年对国内800多家企业的调研来看, 企业内部数据仍是大数据的主要来源。当前有32%的企业通过外部购买数据;只有18%的企业使用政府开放数据。
业内人士指出,大数据时代的数据资源广泛散布于政府、行业、企业三个子系统中,其中,信息数据资源80%以上掌握在各级政府部门手里。而与此同时,区域部门间基本实现共享的省级地方仅占13%,区域部门间少量实现共享的地市和区县仅占32%和28%,信息共享和业务协同在地市和区县进展缓慢。
“如果更多数据可以开放,将会对产业转型、政务和公共服务效率提升等大有裨益。”上海至信普林科技有限公司总经理顾敏洁说,“比如中国人民银行上海总部自2006年起公开金融信息后,催生了一批金融信息咨询服务公司,其中还有5家上市公司,拉动的就业人数也非常可观。”
数据割据、技术壁垒和标准缺失形成数据孤岛
“数据孤岛的成因主要有三个,数据割据、技术壁垒和标准缺失。”赵国栋说。观念问题是主观意愿缺失的症结。“政府部门由于缺乏企业间基于共同利益开发这样的主观能动性,导致数据开放滞后。除了政府部门,一些大企业也应该认识到数据合理开放可以造就更好的社会和行业生态价值。”
外部管理规范、法规的缺失也使部分主体对开放数据保持顾虑。“目前如果只遵循‘谁的数据谁负责’这一简单的准则,要调动政府部门开放数据的积极性比较困难。”DT大数据产业创新研究院院长陈新河说。
除了主观意愿,技术和标准也是一道“硬门槛”。“比如目前信息共享的安全问题。公共云的运维工作面临着一些新的安全风险和挑战。计算环境从本地到云端的自身安全性是提高了,但由于公共云的运维管理工作必须通过互联网完成,和传统IT环境运维有很大不同,容易造成管理员权限被劫持攻击,造成运维管理账号和凭证泄露等问题。”顾敏洁说。
目前开放的数据同样因为格式标准缺失成了“开放的孤岛”。公布类似停车位数量、开放非标准化的图表等形式的数据都是不可机读的。这类“伪开放”并没有真正整合数据的价值。“不同行业数据整合必然需要标准化的数据格式,比如从卫生、人口的角度用数据对‘人’进行的描述就是不一样的。”全国信息安全标准化技术委员会大数据标准工作组成员张群说。
“因此目前要开放的应该是底层数据,而不仅提供根据数据分析出来的结果或产品。”业内专家表示,这类数据在技术上应该有其标准形式,可以被计算机抓取、调用,而且在法律上也是可以进行各种使用的。
开放整合数据需围绕应用场景
要打通数据孤岛,一方面是技术上的革新和标准化的推进,同时包括数据安全领域建设。“在物联网时代,需要从政府等层面推进包括身份识别、信息安全系统等庞大的安全体系建设。”赵国栋说。
“目前全国信息技术标准化技术委员会已推进获批了6项大数据领域的标准,包括了大数据技术参考模型、数据能力成熟度评价模型标准等。”张群说。
另一方面,在法律维度,立法推进的前提是明确数据权属。对此,赵国栋建议,可以参照土地管理的做法,将数据权属划分为所有权、处置权、使用权和收益权。“例如处置权应归国家,规定归档、删除的各种条件等。只有权属清楚才能推动法律保护。”
政府数据开放也并非一蹴而就,需要循序渐进。业内人士普遍认为,不涉及隐私和安全的数据可以率先开放,比如气象这类数据。同时政府部门和行业协会可以推动统一数据平台的建设,改变目前碎片化的现状。
杭州市经信委云计算与大数据产业处处长黄左彦说:“杭州整合数据、搭建平台过程中的经验就是以项目为突破,目前类似‘5G’车联网项目、城市数据大脑等都是以交通为突破点。由政府主导政务数据开放共享,企业自带资金深度合作开发,其中包括数据交流。”
“目前观念上有一个原则是被忽视的:即‘开放是常规,封闭才是例外’。”陈新河说,“政企间或者政府牵头整合数据仍应围绕应用场景、项目工程来,否则目前‘唤醒’的数据早晚也会重新‘落满灰尘’。”
数据分析咨询请扫描二维码
数据分析涉及多个方面的学习,包括理论知识和实践技能。以下是数据分析需要学习的主要方面: 基础知识: 数据分析的基本概念 ...
2024-11-22数据分析适合在多个单位工作,包括但不限于以下领域: 金融行业:金融行业对数据分析人才的需求非常大,数据分析师可以从事经 ...
2024-11-22数据分析是一种涉及从大量数据中提取有用信息和洞察力的过程。其工作内容主要包括以下几个方面: 数据收集与整理:数据分析师 ...
2024-11-22数据分析师需要掌握多种技能,以确保能够有效地处理和分析数据,并为业务决策提供支持。以下是数据分析师需要掌握的主要技能: ...
2024-11-22数据开发和数据分析是两个密切相关但又有所区别的领域。以下是它们的主要区别: 定义和目标: 数据开发:数据开发涉及数据的 ...
2024-11-22数据架构师是负责设计和管理企业数据架构的关键角色,其职责涵盖了多个方面,包括数据治理、数据模型设计、数据仓库构建、数据安 ...
2024-11-22数据分析师需要具备一系列技能,以确保能够有效地处理、分析和解释数据,从而支持决策制定。以下是数据分析师所需的关键技能: ...
2024-11-22数据分析师需要具备一系列技能,以确保能够有效地处理、分析和解释数据,从而支持决策制定。以下是数据分析师所需的关键技能: ...
2024-11-22数据分析师需要具备一系列的技能和能力,以确保能够有效地处理、分析和解释数据,从而支持业务决策。以下是数据分析师所需的主要 ...
2024-11-22需求持续增长 - 未来数据分析师需求将持续上升,企业对数据驱动决策的依赖加深。 - 预测到2025年,中国将需要高达220万的数据人 ...
2024-11-22《Python数据分析极简入门》 第2节 4 Pandas条件查询 在pandas中,可以使用条件筛选来选择满足特定条件的数据 importpanda ...
2024-11-22数据分析师的工作内容涉及多个方面,主要包括数据的收集、整理、分析和可视化,以支持商业决策和问题解决。以下是数据分析师的一 ...
2024-11-21数据分析师必须掌握的技能可以从多个方面进行归纳和总结。以下是数据分析师需要具备的主要技能: 统计学基础:数据分析师需要 ...
2024-11-21数据分析入门的难易程度因人而异,总体来看,入门并不算特别困难,但需要一定的学习和实践积累。 入门难度:数据分析入门相对 ...
2024-11-21数据分析是一项通过收集、整理和解释数据来发现有用信息的过程,它在现代社会中具有广泛的应用和重要性。数据分析能够帮助人们更 ...
2024-11-21数据分析行业正在迅速发展,随着技术的不断进步和数据量的爆炸式增长,企业对数据分析人才的需求也与日俱增。本文将探讨数据分析 ...
2024-11-21数据分析的常用方法包括多种技术,每种方法都有其特定的应用场景和优势。以下是几种常见的数据分析方法: 对比分析法:通过比 ...
2024-11-21企业数字化转型是指企业利用数字技术对其业务进行改造和升级,以实现提高效率、降低成本、创新业务模式等目标的过程。这一过程不 ...
2024-11-21数据分析作为一个备受追捧的职业领域,吸引着越来越多的女性加入其中。对于女生而言,在选择成为一名数据分析师时,行业选择至关 ...
2024-11-21大数据技术专业主要学习计算机科学、数学、统计学和信息技术等领域的基础理论和技能,旨在培养具备大数据处理、分析和应用能力的 ...
2024-11-21