“每天一个数据分析师”在第九期有幸采访了李敏,她是管理科学与工程专业博士生,同时是中国首批数据建模师(CDA 2),目前在上海某三甲医院工作。
DA:您是如何入行的?
李敏:2005年跟随先生举家搬迁并成为新上海人,到上海后由原来从事优生优育的技术人员转到医院的行政管理部门,不适应,决心成为专业管理人士。于是从撰写医院管理论文、开展课题开始一步一步走,要发表医学论文就离不开统计分析,越学越深入,自然而然就学习到数据挖掘技术了。后期又借助管理科学与工程专业博士学习深入接触数据挖掘行业。同时,非常幸运的是,在我整个转型期遇到了“指点的高人、相助的贵人”。
DA:您的工作经历,目前的工作职责(做哪块),工作中曾做过的数据分析实例,以及您的职业规划?
李敏:我是生在医院、长在医院、工作在医院,目前主要从事医院内部数据挖掘工作,曾经做过患者画像和患者疾病关联规划分析。我希望能致力于医院数据挖掘工作,玩转医院内部数据,成为医疗行业优秀数据分析师。
DA:能否给我们讲讲您在工作中遇到的印象深刻的困难及其背景成因?
李敏:大数据包括结构化、非结构化和半结构化的数据,通常数据量都非常大,处理起来相当复杂。在我的数据挖掘工作中,获取和使用高质量数据非常重要。在我看来,高质量的数据主要有以下特征:(1)数据源可信。数据源有内部和外部,外部数据源(如网上的社交媒体数据)的数据有多值得信任?(2)不是“脏数据”。脏数据指不准确、不完整、错误的数据,包括杂乱的数据、拼写错误的单词、坏掉的传感器、不恰当的标准、某种程度上被破坏的数据、重复的数据。(3)“信燥比”不低。可用信息(信号)可能占数据中较大的比例,噪音不多。
数据清洗、字段扩充后,我们在进入患者疾病关联规则分析时,遇到了很大的困难。我们发现疾病诊断名称在500种以上,各患者患病各不相同,患病总不能像大家在超市商场那样一购买就购买一车子商品吧?
DA:这个问题最终是如何解决的呢?能否向广大同行分享一下思路?
李敏:为解决这个问题,首先,我们根据关联规则挖掘出两个子问题:1.找出事物数据库中所有大于等于用户指定的最小支持度的频繁项集。2.利用频繁项集生成所有的关联规则,根据用户设定的最小置信度进行取舍,最后得到强关联规则。
第二步,根据C.H.Cai等人的加权关联规则,即给每个项目分配了一个反应其重要程度的权值,并给出了项目集和规则的加权支持度,从而扩展了现有的关联规则问题模型。
第三步,在加权关联规则算法计算支持度时,既要考虑规则中所有项目在数据库中同时出现的频率,也要考虑所有项目的加权值。关联规则算法中,以Agrawal R.等人提出的Apriori算法最为著名,即一个频繁项目集的任一个集必定也是频繁项目集,它是通过项目集元素数目不断增长来逐步完成频繁项目集发现的——首先产生1-频繁项集L1,然后是2-频繁项集L2,直到不再能扩展频繁项集的元素数目而算法停止。在第K次循环中,过程先产生K-候选项集的集合CK,然后通过扫描数据库生成支持度,并测试产生K-频繁项集LK。
Apriori算法主要包括三个步骤:(1)由频繁K-1项集通过自连接产生长度为K的候选K项集CK。(2)对至少有一个非频繁子集的候选项进行剪枝。(3)扫描所有的事务来获得候选项集的支持度。
因此,我们首先找出前6名主要诊断的疾病名;再确定常见20种辅助诊断疾病名,最后倒入Apriori算法,从而找到了比较有趣的规则,如肝炎后肝硬化患者与高血压、糖尿病高度相关,这更需要中国加快远程病人监控的研究与应用。
DA:请问您对希望从事数据分析行业的职场人有哪些建议?
李敏:在我们开始大数据之旅前,我们需要深刻理解以下内容与步骤:
(1)理解目标,明确受益点或明确项目开始。成立一个可以发展成为一个专门用来帮助各个部门进行最佳的大数据实践的团队。
(2)建立路线图。路线图就是行动计划,确保路线图有一个合理的、可实现的基准。
(3)发现数据。这个数据策略和计划应当是找到一条能过利用数据来产生可预测业务产生的途径。
(4)清楚缺少什么数据。当开始决定需要什么和缺少什么时,鼓励团队突破思维定势是非常有益。
(5)理解可选技术方案。让团队对这些技术拥有足够深刻的理解有利于团队做出明智的选择。(6)规划大数据安全,应防范公司外部和内部的数据安全风险。
(7)规划大数据管理策略。信息管理的意义在于建立一种能够被员工、合作者和用户信任的信息资源。
(8)规划数据管家,如建立使用数据仓库。
(9)持续测试。不能假设数据总是对的,要持续测试数据和团队对业务的理解。
(10)学习最佳实践和利用模式。随着大数据的成熟,我们将能够获取更多被验证过的最佳实践,用来增强我们的策略,使计划执行得更成功。
另外,我们还需要注意以下事情:
(1)要将所有业务单元都涵盖在大数据战略中。
(2)要评估所有的大数据分发模型。
(3)要将传统数据源作为大数据战略的一部分。
(4)要计划持久化元数据。
(5)不要依赖于单一的大数据分析方法。
(6)不要在准备充分之前就膨胀。
(7)不要忽略数据集成的需求。
(8)不要忘记安全地管理数据。
(9)不要忽略数据的管理效率。
DA:请您推荐一些平时在网络上学习专业知识的平台吧。
李敏:最早接触数据挖掘是跟随在人大经济论坛(现为经管之家)学习,从SPSS开始学起,最终通过数据挖掘技术学习并获得中国首批数据建模师资格(CDA 2)。平时一直关注“CDA数据分析师”栏目,上面信息新、内容大多比较专业,对从事数据挖掘技术人员是非常不错的选择,并会推荐国外一些专业网站学习。高校图书馆也是一种选择,我曾花了整整2天时间,把某高校图书馆关于数据挖掘的图书全部锁定放置书架的位置、图书种类、数量;曾在2天时间内泛读20本书。当然还必须花些时间精读数据挖掘的理论、操作书籍并不断上机练习。
另外再推荐几个数据资源网:
(1)大数据会议。The Data Warehousing Institute(TDWI),赞助很多关于数据仓库和大数据的会议、研讨会和教育论坛。Big Data Conference:大数据的分析和应用。Big Data Retail Forum:一个为关注向零售商和消费品生产商提供实时信息分析的公司服务的会议。Hadoop World:O,Reilly 赞助的会议。
(2)开放数据基会。www.opendatafoundation.org.这是一个致力于推进全球元数据标准和发展开源统计数据的非营利性组织,专注于提高在经济学、财政、医疗、教育、劳动、社会科学、技术、农业、发展和环境等领域中的元数据。
(3)供应商的网站,主要是看公司的思想领袖博客。
Google:http://research.google.com
Amazon:http://aws.amazon.com/big-data
IBM:http://bigdatauniversity.com/
http://www-01.ibm.com/software/data/digdata
SAS institute:http://www.sas.com
DA:平时工作之余都做些什么呢?有什么特长爱好呢?
李敏:我的一大爱好是旅游,希望游遍世界各地、吃遍世界美食。另外就是唱歌了,我是上海市医务系统天使合唱团的女高音。
DA:最后,方便留下您的联系方式以便交流吗?(建议大家直接在后台提问,我们会统一整理并反馈给被访者,这样彼此都能节约时间提高效率。)
李敏:QQ:2307931184
Tel:18916269881
Email:minliji@aliyun.com
DA:谢谢您。今天的采访到此结束,我们再会。
后记:这是“每天一个数据分析师”的第九期采访,非常感谢受访的各位老师以及订阅读者向我们提出的各种建议,我们期待更多的声音!我们计划每天采访一个数据分析师(覆盖各行各业),听TA在从业路上的故事,讲TA在工作中遇到的种种困难以及采取的解决方案。欢迎大家踊跃推荐或者自荐。联系我们请直接在微信留言或发邮件到:adaaday@pinggu.org。
简介:我们是经管之家(原人大经济论坛)CDA数据分析师培训旗下的公众账号“每天一个数据分析师“。旨在通过采访数据分析师来讲述数据分析在各行业应用情况或其他重要问题,藉此展示分析师自身水平和风采,打造个人品牌,助力升职加薪和求职。同时也让社会公众了解数据分析师这个群体。每一篇头条专访将会给您带来大量关注,这是为您精心打造的炫丽舞台,请善用这个共同的平台。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在当今信息爆炸的时代,数据已经像空气一样无处不在,而数据分析则是解锁这些信息宝藏的钥匙。数据分析的过程就像是一次探险,从 ...
2024-12-25在职场上,拍脑袋做决策的时代早已过去。数据分析正在成为每个职场人的核心竞争力,不仅能帮你找到问题,还能提供解决方案,提升 ...
2024-12-24Excel是数据分析的重要工具,强大的内置功能使其成为许多分析师的首选。在日常工作中,启用Excel的数据分析工具库能够显著提升数 ...
2024-12-23在当今信息爆炸的时代,数据分析师如同一位现代社会的侦探,肩负着从海量数据中提炼出有价值信息的重任。在这个过程中,掌握一系 ...
2024-12-23在现代的职场中,制作吸引人的PPT已经成为展示信息的重要手段,而其中数据对比的有效呈现尤为关键。为了让数据在幻灯片上不仅准 ...
2024-12-23在信息泛滥的现代社会,数据分析师已成为企业决策过程中不可或缺的角色。他们的任务是从海量数据中提取有价值的洞察,帮助组织制 ...
2024-12-23在数据驱动时代,数据分析已成为各行各业的必需技能。无论是提升个人能力还是推动职业发展,选择一条适合自己的学习路线至关重要 ...
2024-12-23在准备数据分析师面试时,掌握高频考题及其解答是应对面试的关键。为了帮助大家轻松上岸,以下是10个高频考题及其详细解析,外加 ...
2024-12-20互联网数据分析师是一个热门且综合性的职业,他们通过数据挖掘和分析,为企业的业务决策和运营优化提供强有力的支持。尤其在如今 ...
2024-12-20在现代商业环境中,数据分析师是不可或缺的角色。他们的工作不仅仅是对数据进行深入分析,更是协助企业从复杂的数据信息中提炼出 ...
2024-12-20随着大数据时代的到来,数据驱动的决策方式开始受到越来越多企业的青睐。近年来,数据分析在人力资源管理中正在扮演着至关重要的 ...
2024-12-20在数据分析的世界里,表面上的技术操作只是“入门票”,而真正的高手则需要打破一些“看不见的墙”。这些“隐形天花板”限制了数 ...
2024-12-19在数据分析领域,尽管行业前景广阔、岗位需求旺盛,但实际的工作难度却远超很多人的想象。很多新手初入数据分析岗位时,常常被各 ...
2024-12-19入门数据分析,许多人都会感到“难”,但这“难”究竟难在哪儿?对于新手而言,往往不是技术不行,而是思维方式、业务理解和实践 ...
2024-12-19在如今的行业动荡背景下,数据分析师的职业前景虽然面临一些挑战,但也充满了许多新的机会。随着技术的不断发展和多领域需求的提 ...
2024-12-19在信息爆炸的时代,数据分析师如同探险家,在浩瀚的数据海洋中寻觅有价值的宝藏。这不仅需要技术上的过硬实力,还需要一种艺术家 ...
2024-12-19在当今信息化社会,大数据已成为各行各业不可或缺的宝贵资源。大数据专业应运而生,旨在培养具备扎实理论基础和实践能力,能够应 ...
2024-12-19阿里P8、P9失业都找不到工作?是我们孤陋寡闻还是世界真的已经“癫”成这样了? 案例一:本硕都是 985,所学的专业也是当红专业 ...
2024-12-19CDA持证人Louis CDA持证人基本情况 我大学是在一个二线城市的一所普通二本院校读的,专业是旅游管理,非计算机非统计学。毕业之 ...
2024-12-18最近,知乎上有个很火的话题:“一个人为何会陷入社会底层”? 有人说,这个世界上只有一个分水岭,就是“羊水”;还有人说,一 ...
2024-12-18