“每天一个数据分析师”在第九期有幸采访了李敏,她是管理科学与工程专业博士生,同时是中国首批数据建模师(CDA 2),目前在上海某三甲医院工作。
DA:您是如何入行的?
李敏:2005年跟随先生举家搬迁并成为新上海人,到上海后由原来从事优生优育的技术人员转到医院的行政管理部门,不适应,决心成为专业管理人士。于是从撰写医院管理论文、开展课题开始一步一步走,要发表医学论文就离不开统计分析,越学越深入,自然而然就学习到数据挖掘技术了。后期又借助管理科学与工程专业博士学习深入接触数据挖掘行业。同时,非常幸运的是,在我整个转型期遇到了“指点的高人、相助的贵人”。
DA:您的工作经历,目前的工作职责(做哪块),工作中曾做过的数据分析实例,以及您的职业规划?
李敏:我是生在医院、长在医院、工作在医院,目前主要从事医院内部数据挖掘工作,曾经做过患者画像和患者疾病关联规划分析。我希望能致力于医院数据挖掘工作,玩转医院内部数据,成为医疗行业优秀数据分析师。
DA:能否给我们讲讲您在工作中遇到的印象深刻的困难及其背景成因?
李敏:大数据包括结构化、非结构化和半结构化的数据,通常数据量都非常大,处理起来相当复杂。在我的数据挖掘工作中,获取和使用高质量数据非常重要。在我看来,高质量的数据主要有以下特征:(1)数据源可信。数据源有内部和外部,外部数据源(如网上的社交媒体数据)的数据有多值得信任?(2)不是“脏数据”。脏数据指不准确、不完整、错误的数据,包括杂乱的数据、拼写错误的单词、坏掉的传感器、不恰当的标准、某种程度上被破坏的数据、重复的数据。(3)“信燥比”不低。可用信息(信号)可能占数据中较大的比例,噪音不多。
数据清洗、字段扩充后,我们在进入患者疾病关联规则分析时,遇到了很大的困难。我们发现疾病诊断名称在500种以上,各患者患病各不相同,患病总不能像大家在超市商场那样一购买就购买一车子商品吧?
DA:这个问题最终是如何解决的呢?能否向广大同行分享一下思路?
李敏:为解决这个问题,首先,我们根据关联规则挖掘出两个子问题:1.找出事物数据库中所有大于等于用户指定的最小支持度的频繁项集。2.利用频繁项集生成所有的关联规则,根据用户设定的最小置信度进行取舍,最后得到强关联规则。
第二步,根据C.H.Cai等人的加权关联规则,即给每个项目分配了一个反应其重要程度的权值,并给出了项目集和规则的加权支持度,从而扩展了现有的关联规则问题模型。
第三步,在加权关联规则算法计算支持度时,既要考虑规则中所有项目在数据库中同时出现的频率,也要考虑所有项目的加权值。关联规则算法中,以Agrawal R.等人提出的Apriori算法最为著名,即一个频繁项目集的任一个集必定也是频繁项目集,它是通过项目集元素数目不断增长来逐步完成频繁项目集发现的——首先产生1-频繁项集L1,然后是2-频繁项集L2,直到不再能扩展频繁项集的元素数目而算法停止。在第K次循环中,过程先产生K-候选项集的集合CK,然后通过扫描数据库生成支持度,并测试产生K-频繁项集LK。
Apriori算法主要包括三个步骤:(1)由频繁K-1项集通过自连接产生长度为K的候选K项集CK。(2)对至少有一个非频繁子集的候选项进行剪枝。(3)扫描所有的事务来获得候选项集的支持度。
因此,我们首先找出前6名主要诊断的疾病名;再确定常见20种辅助诊断疾病名,最后倒入Apriori算法,从而找到了比较有趣的规则,如肝炎后肝硬化患者与高血压、糖尿病高度相关,这更需要中国加快远程病人监控的研究与应用。
DA:请问您对希望从事数据分析行业的职场人有哪些建议?
李敏:在我们开始大数据之旅前,我们需要深刻理解以下内容与步骤:
(1)理解目标,明确受益点或明确项目开始。成立一个可以发展成为一个专门用来帮助各个部门进行最佳的大数据实践的团队。
(2)建立路线图。路线图就是行动计划,确保路线图有一个合理的、可实现的基准。
(3)发现数据。这个数据策略和计划应当是找到一条能过利用数据来产生可预测业务产生的途径。
(4)清楚缺少什么数据。当开始决定需要什么和缺少什么时,鼓励团队突破思维定势是非常有益。
(5)理解可选技术方案。让团队对这些技术拥有足够深刻的理解有利于团队做出明智的选择。(6)规划大数据安全,应防范公司外部和内部的数据安全风险。
(7)规划大数据管理策略。信息管理的意义在于建立一种能够被员工、合作者和用户信任的信息资源。
(8)规划数据管家,如建立使用数据仓库。
(9)持续测试。不能假设数据总是对的,要持续测试数据和团队对业务的理解。
(10)学习最佳实践和利用模式。随着大数据的成熟,我们将能够获取更多被验证过的最佳实践,用来增强我们的策略,使计划执行得更成功。
另外,我们还需要注意以下事情:
(1)要将所有业务单元都涵盖在大数据战略中。
(2)要评估所有的大数据分发模型。
(3)要将传统数据源作为大数据战略的一部分。
(4)要计划持久化元数据。
(5)不要依赖于单一的大数据分析方法。
(6)不要在准备充分之前就膨胀。
(7)不要忽略数据集成的需求。
(8)不要忘记安全地管理数据。
(9)不要忽略数据的管理效率。
DA:请您推荐一些平时在网络上学习专业知识的平台吧。
李敏:最早接触数据挖掘是跟随在人大经济论坛(现为经管之家)学习,从SPSS开始学起,最终通过数据挖掘技术学习并获得中国首批数据建模师资格(CDA 2)。平时一直关注“CDA数据分析师”栏目,上面信息新、内容大多比较专业,对从事数据挖掘技术人员是非常不错的选择,并会推荐国外一些专业网站学习。高校图书馆也是一种选择,我曾花了整整2天时间,把某高校图书馆关于数据挖掘的图书全部锁定放置书架的位置、图书种类、数量;曾在2天时间内泛读20本书。当然还必须花些时间精读数据挖掘的理论、操作书籍并不断上机练习。
另外再推荐几个数据资源网:
(1)大数据会议。The Data Warehousing Institute(TDWI),赞助很多关于数据仓库和大数据的会议、研讨会和教育论坛。Big Data Conference:大数据的分析和应用。Big Data Retail Forum:一个为关注向零售商和消费品生产商提供实时信息分析的公司服务的会议。Hadoop World:O,Reilly 赞助的会议。
(2)开放数据基会。www.opendatafoundation.org.这是一个致力于推进全球元数据标准和发展开源统计数据的非营利性组织,专注于提高在经济学、财政、医疗、教育、劳动、社会科学、技术、农业、发展和环境等领域中的元数据。
(3)供应商的网站,主要是看公司的思想领袖博客。
Google:http://research.google.com
Amazon:http://aws.amazon.com/big-data
IBM:http://bigdatauniversity.com/
http://www-01.ibm.com/software/data/digdata
SAS institute:http://www.sas.com
DA:平时工作之余都做些什么呢?有什么特长爱好呢?
李敏:我的一大爱好是旅游,希望游遍世界各地、吃遍世界美食。另外就是唱歌了,我是上海市医务系统天使合唱团的女高音。
DA:最后,方便留下您的联系方式以便交流吗?(建议大家直接在后台提问,我们会统一整理并反馈给被访者,这样彼此都能节约时间提高效率。)
李敏:QQ:2307931184
Tel:18916269881
Email:minliji@aliyun.com
DA:谢谢您。今天的采访到此结束,我们再会。
后记:这是“每天一个数据分析师”的第九期采访,非常感谢受访的各位老师以及订阅读者向我们提出的各种建议,我们期待更多的声音!我们计划每天采访一个数据分析师(覆盖各行各业),听TA在从业路上的故事,讲TA在工作中遇到的种种困难以及采取的解决方案。欢迎大家踊跃推荐或者自荐。联系我们请直接在微信留言或发邮件到:adaaday@pinggu.org。
简介:我们是经管之家(原人大经济论坛)CDA数据分析师培训旗下的公众账号“每天一个数据分析师“。旨在通过采访数据分析师来讲述数据分析在各行业应用情况或其他重要问题,藉此展示分析师自身水平和风采,打造个人品牌,助力升职加薪和求职。同时也让社会公众了解数据分析师这个群体。每一篇头条专访将会给您带来大量关注,这是为您精心打造的炫丽舞台,请善用这个共同的平台。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31