大数据与云计算,拯救帕金森_数据分析师
医疗行业的变革正成为新的风口,今天作者想讲讲大数据与基因技术结合,正在产生什么新的想象力。其中尤以基因检测技术走到了前面,让我们谈谈“帕金森综合症”:
在未来,基因检测术将会成为医疗不可或缺的一部分。越来越多的人会进行基因测序来了解自己的生命体征和健康状况。国内最大的基因检测机构华大基因,也正在抓住机会,用信息技术提升基因检测技术,致力于提供更好的基因服务。
基因,这个被我们熟悉却又十分陌生的词汇开始频繁出现。然而基因检测海量、复杂、多变的数据计算需求一直是华大基因前进道路上的鸿沟。解决数据分析和计算成了必须要克服的问题。
大数据打入帕金森
2014年8月13日,迈克尔·J·福克斯帕金森氏症研究基金会(MJFF)和英特尔公司对外宣布了一项合作,促进帕金森氏症的研究和治疗——帕金森氏症是一种全球范围的、患病率仅次于阿兹海默氏症的神经退行性脑部疾病。这项合作将利用全新的大数据分析平台进行多阶段研究——利用可穿戴技术监测患者症状,并用收集得来的数据探索相关模型。
可穿戴设备能够24×7全天候地在后台实时收集和传输相关客观数据。通过这种方法,研究人员能以每秒数百读数的速度分析来自成千上万患者的数据,同时获得海量数据以用于探索模型和获取新发现,再也不必受限于零星收集得来的少量数据信息和繁杂的书面患者日志。
所有这些,都可进一步帮助实现针对帕金森氏症本质的洞察,从而帮助科学家们衡量新药品的功效,以及协助医生制定预后方案。
英特尔公司高级副总裁兼数据中心事业部总经理柏安娜表示,“帕金森氏症症状的多样性给疾病检测的进展带来了巨大挑战。新兴的技术不仅可以创建一个测量帕金森氏症的全新范例,还能为医学界提供更多数据,以便找出目前尚未明确的疾病特征,从而开拓全新的研究领域。”
大数据和云计算给医疗界带来了新的光明,利用它们来解决基因测序带来的问题是大势所趋。
解决信息技术瓶颈
“只有以科学发展,以大技术、大平台、大数据支撑下的基因产业,才是无穷无尽的,永远没有冬天。”华大基因总裁、深圳华大基因研究院院长汪建先生如是说。这也最终促成了华大基因与英特尔的合作。
华大基因在基因测序计算中应用的BWA(Burrows-Wheeler Aligner),是基因研究中一款十分优秀并且被广泛使用的序列比对软件。由于BWA软件代码分支多,并且有很多随机访问,起初大家都不看好BWA的移植效果。但实际测试性能却已经完全出乎专家预期。
BWA包括6种优化方法:
第一,使用OpenMP代替Pthreads,使用schedule实现负载均衡、使用KMP_AFFINITY=balanced, granularity=thread实现线程绑定。
第二,使用双缓存,同时进行数据读取和计算。
第三,使用TBB的内存分配代理取代glibc的内存分配。
第四,使用多缓存进一步减少IO瓶颈。
第五,简化耗时函数中的循环。
第六,在至强融核上增加任务级并行按照输入文件进行任务划分,每个任务处理一部分输入数据,避免OpenMP的Map-Reduce并行模式带来的负载不均衡的开销。
在尝试了6种优化方法之后,BWA获得的最好加速比已经达到2.19。
而不得不说的是至强和至强融核的组合在代码迁移和优化上为基因测序带来了非常大的优势。王丙强博士说:“代码的修改工作量不大,只需要对源代码进行很小幅度的修改,是添加一些辅助编译指示,就能在这个组合上运行的相当好。”
实际应用中,借助英特尔的产品技术,计算效率能大大提高。以测序为例,以前传统的方式需要几个星期时间,而现在8个小时就可以完成。这是非常大的突破。
这一重大突破的背后,则是英特尔至强融核协处理器(Xeon Phi)。这是英特尔面向高度并行的高性能计算(HPC)应用所推出的协处理器,能够提供多达61个内核、244个线程和1.2万亿次浮点运算性能。此外,英特尔至强处理器架构使用同样的编程语言、并行模式、技术和开发人员工具,因此以往在至强处理器上运行的应用,在向至强融核上迁移时,具有更便捷、更易于移植等优势。
其编码的简单可移植性,正是基因测序相关程序中的重要需求。而其强大的计算能力为提高基因测序速度提供源动力,标准的编程模型也为基因测序向至强融核上的移植提供了便利。
在测试基于英特尔至强和至强融核的高性能计算平台的同时,华大基因也正在执行3M百万基因组计划,即百万动植物基因组计划、百万人基因组计划、百万微生态基因组计划。该项目将联合全球科学家,通过上百万样本的测序构建遗传信息的数据库,进一步推动基因组测序和生物信息分析技术在粮食安全、医学应用、生态保护等重大发展问题的应用。
现代生命科学和医疗健康正转变为由大数据和大计算推动。在这个技术为王的时代,任何独立的高端技术都将面临寒潮。只有相互协作,共同探索开发,才能真正的造福于人类。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31