机器学习常见的两个大坑-CDA数据分析师官网

机器学习常见的两个大坑

2019-04-01

大家都知道，不管是什么学科都有很多陷阱，由于我们对这一知识的了解不够，就很容易掉进这个坑里，所以说我们一定要加强知识储备。而在机器学习中有很多前辈们总结下来的陷阱，在这篇文章中我们给大家介绍一下机器学习中常见的两个大坑，希望能够帮助的大家尽早脱坑。

首先我们给大家介绍一下第一个坑，那就是系统边界模糊和巨型系统。其实机器学习系统与其他软件系统相比，有一个显著的特点，那就是它是建立在实验性、探索性开发的基础上的。尤其是在初次搭建系统的时候，很难做到在完整设计的指导下开发，而大多是一边探索尝试一边开发，到最后达到上线要求的时候，系统也就随之成型了。不过这样构建出的系统，有个很大的问题，就是很容易做成一个边界模糊、模块耦合、结构复杂的“巨型系统”，这种系统的典型特征包括三点，第一就是模块间不可拆分，样本、特征、训练等步骤都偶合在一起。第二就是很多实验性、探索性代码遍布其中，搞不清楚哪些在用，哪些已失效。第三就是pipeline特别长，其中包括一些可能已经无用的流程。

那么为什么会出现这样的系统呢？重要原因之一就是前面提到过的，机器学习系统的探索式的本质。在刚开始做系统的时候，可能样本处理、特征处理这些都比较简单，所以就都写在了一起。随着各个流程处理的精细化、复杂化，每个步骤都在变复杂，但是由于这种变化是在慢慢发生的，导致系统慢慢变得不可控。

机器学习中第二个坑就是不重视基础数据架构建设，一般来说，数据是机器学习系统的核心，这里面包括各种样本数据，原始特征数据，处理后的特征数据，支撑数据等等，那么提供这些数据的系统和架构也是同样重要的，机器学习系统在构建初期，对待各种数据的态度往往是辅助性质的，认为这些数据只是为了模型服务的原料，而没有把它们本身作为严肃的子系统来对待，所以这些数据的架构往往缺乏设计，大多比较随意，可能会有很多难以复用代码。不过这容易导致出一个严肃而复杂的问题，这个问题不是一两个简单方法就可以解决的，而是需要从数据源开始做仔细的设计，设计时充分考虑数据可能的用法，并留有一定扩展性，保证数据的可用性和可探索性。

在这篇文章中我们给大家介绍了关于机器学习中容易存在的问题，其实这些问题都是值得我们关注的。所以说，我们在学习机器学习的时候一定要注意好这些问题，这样我们才能够更好解决其中的问题。

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试详情；

▷ 想查询CDA考试成绩，点击>>> “CDA成绩” 了解CDA考试详情；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想获取CDA考试时间/费用/条件/大纲/通过率，点击 >>>“CDA考试官网” 了解CDA考试详情；

机器学习特征数据架构

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇机器学习的要素是什么？

下一篇机器学习常用算法的优缺点之聚类算法和排序算法

机器学习常见的两个大坑

CDA考试动态

CDA报考指南

热门栏目

最新资讯

【干货】你在纳闷用户为啥流失?华为已经用关系分析 ...

【干货】2小时用AI完成的SQL教程也太赞了吧，不推荐 ...

【干货】指标波动归因分析：数据背后的故事 ...

数据分析学习指南：从踩坑到精通的成长之路 ...

数据分析学习指南

Deepseek如何帮助公司深入挖掘用户价值？ ...

【干货】Deepseek教我数据可视化看板实时更新 ...

一秒精通 Deepseek

Deepseek教我自学Python，貌似30天就够了 ...

【干货】2步学会构成分析，找到业务增长关键 ...

【2月】CDA网校2025 数据分析组队打卡学习活动第4期 ...

【干货】画用户画像与找相亲对象一样简单 ...

统计分析与数据挖掘的联系与区别

【干货】5分钟学会数据分析方法之【对比分析法】 ...

【干货】半监督学习（下）Label Spreading ...

【干货】用半监督学习方法处理标签（上）Label Prop ...

【干货】掌握这50个常用Excel函数，你的Excel就无敌 ...

【干货】7类常见的统计分析错误

【干货】“数据敏感”不是天赋！如何培养数据敏感度 ...

【干货】2025年必学技能：想转行数据分析看过来！ ...