以下是我作为数据科学家管理自己的可重复使用的Python代码的一些方法,从最常用的代码到最不常用的代码,并针对初学者介绍。
分享38
有很多不同的方法来管理你自己的代码,这将取决于你的要求、个性、技术知识、角色和许多其他因素。一个经验丰富的开发者可能会有一个非常规范的方法来组织他们的代码,跨越多种语言、项目和用例,而一个很少写自己的代码的数据分析师可能会因为缺乏必要而更加临时和缺乏动力。其实没有什么对错之分,这只是一个对你有用的问题,而且是合适的。
具体地说,我所说的“管理代码”是指如何组织、存储和调用您自己编写并发现作为编程工具箱的长期补充有用的不同代码片段。编程都是关于自动化的,因此,如果作为一个编写代码的人,你发现自己在重复执行类似的任务,那么以某种方式自动调用与该任务相关的代码才有意义。
这就是为什么您已经在使用第三方库。无需每次使用时从头开始重新实现支持向量机代码库;相反,您可以使用一个库(可能是Scikit learn),并利用大量人员的集体工作,随着时间的推移完善一些代码。
将这个想法扩展到个人编程领域才有意义。您可能已经在这样做了(我希望您是这样),但如果不是的话,以下是我作为一名数据科学家为管理自己的可重用Python代码而确定的几种方法,从最常用的代码使用到最不常用的代码使用。
完整的库
这是最通用的方法,也可以说是最 "专业 "的方法;但是,仅仅这一点并不意味着它在任何时候都是正确的选择。
如果你发现你在许多用例中使用相同的功能,并且经常这样做,这就是要走的路。如果你想重用的功能很容易被参数化,这也是有意义的;也就是说,通过编写和调用一个通用的函数,你可以在每次调用时定义变量,就可以反复地处理这个任务。
例如,我经常发现我想在一个字符串中找到某个子串的第n次出现,而Python标准库中没有这样的函数。因此,我有一段简单的代码,它接受一个字符串、子串和我要找的第n次出现作为输入,并返回这个第n次出现在字符串中开始的位置(很久以前从这里搬来的)。
def find_nth(haystack, needle, n):
start = haystack.find(needle)
while start >= 0 and n > 1:
start = haystack.find(needle, start+len(needle))
n -= 1
return start
由于我处理了大量的文本处理,我把它和我经常使用的许多其他文本处理函数一起收集起来,并创建了一个库,像其他Python库一样驻留在我的计算机上,并且能够像其他库一样导入这个库。创建这个库的步骤有些冗长,虽然很简单,所以我不会在这里介绍,但这篇文章是众多做得很好的文章之一。
因此,现在我有了一个textproc库,我可以很容易地导入和使用我的find_nth函数,而且可以随心所欲地使用,而不必在我写的每个程序中都复制和粘贴该函数。
from textproc import find_nth
segment = line[:find_nth(line, ',', 4)].strip()
另外,如果我想扩展这个库,增加更多的功能,或者改变现有的find_nthcode,我可以在一个地方完成,只需重新导入。
特定项目的共享脚本
也许你不需要一个完整的库,因为你想重用的代码似乎没有超出你目前正在进行的项目的用途,但你确实需要在一个特定的项目中重用它。在这种情况下,你可以把这些函数放在一个脚本中,并简单地按名称导入该脚本。这是一个可怜的女人的图书馆,但它往往正是我们所需要的。
在我的研究生工作中,我不得不写很多与无监督学习有关的代码,特别是k-means聚类。我写了一些初始化中心点、计算数据点和中心点之间的距离、重新计算中心点等的函数,并使用不同的算法完成了许多这些任务。我很快发现,保留一个单独的脚本并复制其中的一些算法函数并不是最佳选择,因此将它们移出到自己的脚本中,以便导入。它的工作方式几乎与库相同,但这个过程是特定路径的,而且只为这个项目而设。
很快我就有了不同的中心点初始化函数和距离计算函数的脚本,以及数据加载和处理函数。随着这些代码变得越来越多的参数化和普遍有用,这些代码最终进入了一个合法的库。
至少在我的经验中,事情似乎就是这样发展的。你在你的脚本中写了一个你现在需要使用的函数,然后你使用了它。项目扩大了,或者你转到了一个类似的项目,你意识到现在拥有同样的功能会很方便。于是,这个功能被下放到一个自己的脚本中,并被你导入使用。如果这种有用性持续到近期,并且你发现这个函数有更普遍和更长期的用途,那么这个函数现在就会被添加到一个现有的库中,或者成为一个新库的基础。
然而,导入简单脚本的另一个具体有用的方面是在使用Jupyter笔记本的时候。鉴于Jupyter笔记本中的大部分内容都具有临时性、探索性和实验性,我并不喜欢将笔记本作为模块导入其他笔记本中。如果我发现一个以上的笔记本经常使用一些代码摘录,那么这些代码就会被下放到存储在同一文件夹中的脚本中,然后被导入到笔记本中。这种方法对我来说更有意义,并提供了更多的稳定性,因为我知道另一个笔记本所依赖的一个笔记本没有被以有害的方式编辑过。
特定任务的模板
我发现我经常重复执行一些相同的任务,这些任务不适合被参数化,或者是可以被参数化的任务,但要付出更多的努力,这是不值得的。在这种情况下,我采用了代码模板化,或称锅炉式模板化。这就是我在本文一开始就想避免的复制和粘贴代码的做法,但有时这也是正确的选择。
例如,我经常需要对Pandas DataFrame的内容进行 "列表",因为缺乏一个更好的词,虽然写一个函数可以确定列的数量,可以接受作为输入的列,等等,但往往输出也需要调整,所有这些都表明写一个函数太耗时了。
在这种情况下,我只是写了一个很容易改变的脚本模板,并把它放在一个类似模板的文件夹里,很方便。下面是listify_df的摘录,它从CSV文件到Pandas DataFrame,再到想要的HTML输出。。
在这种情况下,清晰的文件名和文件夹组织有助于管理这些经常有用的片段。
简短的单行字和块
最后,有很多重复的片段你可能经常输入。那么你为什么要这样做呢?
你应该利用文本扩展工具,在需要时插入简短的 "短语"。我使用AutoKey来管理这些短语,这些短语与触发关键词相关联,然后在输入这些关键词时插入。
例如,你是否为你的所有特定类型的项目导入大量相同的库?我有。例如,你可以通过输入#nlpimport来设置你在某一特定任务中所需要的所有导入,一旦输入,就会被识别为一个触发关键词,并被替换为以下内容。
import sys, requests
import numpy as np
import pandas as pd
import texthero
import scattertext as st
import spacy
from spacy.lang.en.stop_words import STOP_WORDS
from datasets import load_metric, list_metrics
from transformers import pipeline
from fastapi import FastAPI
应该指出的是,有些IDE有这些功能。我自己一般使用美化的文本编辑器来编码,所以自动键在我的情况下是必要的(而且非常有用)。如果你有一个集成开发环境可以照顾到这一点,那太好了。关键是,你不应该一直重复输入这些东西。
以上是对作为一个数据科学家管理可重用的Python代码的概述。我希望你能发现它是有用的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31本人基本情况: 学校及专业:厦门大学经济学院应用统计 实习经历:快手数据分析、字节数据分析、百度数据分析 Offer情况:北京 ...
2025-01-3001专家简介 徐杨老师,CDA数据科学研究院教研副总监,主要负责CDA认证项目以及机器学习/人工智能类课程的研发与授课,负责过中 ...
2025-01-29