Hunk/Hadoop: 性能最佳实践
文 | Jonathan Allen
翻译 | 李建盛
无论有没有使用Hunk,当运行Hadoop时,有很多种方式导致偶尔的性能底下。多数时候人们是增加更多的硬件来解决问题,但是有时候只需要简单更改下文件的名称就可以解决问题。
运行Map-Reduce任务[Hunk]
Hunk运行在Hadoop之上,但是这并不意味着一定做到有效的使用。如果Hunk运行在“复杂模式”,而不是“智能模式”的话,它就没有真正的用到Map-Reduce。相反它会直接将所有的Hadoop数据拉到Splunk引擎,并在那里处理它。
HDFS存储[hadoop]
在Hadoop的很多事项和Hunk有关联时如何部署文件?你需要在文件路径中包含时间戳,Hunk可以使用目录结构来当作一个过滤器,可以极大的减少被拉到Splunk的数据量。
在文件名称中包含时间戳也可以生效,但是效果较差,因为Hunk仍然会读取所有的文件名。
为了更好的性能,你可以在文件路径中包含一个健-值对。例如 “…/2015/3/2/app=webserver/…” 。在遍历目录时查询指令会将包含键-值对的过滤掉,再次减少了被拉到Splunk的数据量。
基于时间戳的VIX/indexs.conf[hunk]
当文件存储模式对于任何的Hadoop Map-Reduce有利时,你就需要修改indexs.conf,以让Hunk可以识别目录结构。
文件格式[Hunk]
诸如JSON和CSV这样的自我描述的文件,对于Hunk来说是很容易读取的,它们更加的详细,且消除了代价昂贵的映射操作。
压缩类型/文件大小 [Hdaoop]
要避免过大的文件,例如500MB的GZ压缩且没有分片的文件。(诸如LZO压缩的分片文件也是可以接受的。)对于没有分片的文件来说,在core和文件之间是一对一的映射关系,这就意味着只能有一个core来处理大文件,而其它定core只能空转等待。也就是说处理没有分片的文件花费了大量的时间,那么Map-Reduce的任务就无法快速的处理。
同样,你也应该避免使用大量的大小在几十KB到几百KB之间的碎文件。如果文件太小,你会在启动和管理任务花费大量的时间,而不是真正的用在处理数据本身之上。
报告加速[hunk]
Hunk现在可以利用Splunk的报告加速功能了,这会在HDFS中缓存搜索的结果,减少或消除了需要从主的Hadoop集群中读取数据量。
在你启用此功能之前,请确保你的Hadoop集群拥有足够的空间来存储缓存。
硬件[Hadoop]
确保你拥有合适的硬件。虽然Hadoop是能够运行在甚至是双核的笔记本电脑中,但是你要真正使用它,还是需要每个节点拥有至少4颗4个核的CPU,为了能够确保拥有足够的暂存空间,你须配置至少12GB的内存,两块本地磁盘(10K或固态)
搜索Head Clustering[Hunk]
搜索Head Clustering在Splunk 6.2中是相对较新的一个特性,在Splunk6.3中,对于基于Hunk的查询将是一个可行的属性。
来自InfoQ
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪 ...
2024-12-31数据分析,听起来好像是技术大咖的专属技能,但其实是一项人人都能学会的职场硬核能力!今天,我们来聊聊数据分析的核心流程,拆 ...
2024-12-31提到数据分析,你脑海里可能会浮现出一群“数字控”抱着电脑,在海量数据里疯狂敲代码的画面。但事实是,数据分析并没有你想象的 ...
2024-12-31关于数据分析师是否会成为失业高危职业,近年来的讨论层出不穷。在这个快速变化的时代,技术进步让人既兴奋又不安。今天,我们从 ...
2024-12-30数据分析师在现代企业中扮演着关键角色,他们的工作内容不仅丰富多样,还对企业的决策和发展起着重要的作用。正如一个经验丰富的 ...
2024-12-29数据分析师的能力要求 在当今的数据主导时代,数据分析师的角色变得尤为重要。他们不仅需要具备深厚的技术背景,还需要拥有业务 ...
2024-12-29随着技术的飞速发展与行业的持续变革,不少人心中都存有疑问:到了 2025 年,数据分析师还有前途吗?给你分享一篇阿里P8大佬最近 ...
2024-12-29如何构建数据分析整体框架? 要让数据分析发挥其最大效能,建立一个清晰、完善的整体框架至关重要。今天,就让我们一同深入探讨 ...
2024-12-27AI来了,数分人也可以很省力,今天给大家介绍7个AI+数据分析工具,建议收藏。 01酷表 EXCEL 网址:https://chatexcel.com/ 这是 ...
2024-12-26一个好的数据分析模型不仅能使分析具备条理性和逻辑性,而且还更具备结构化和体系化,并保证分析结果的有效性和准确性。好的数据 ...
2024-12-26当下,AI 的发展堪称狂飙猛进。从 ChatGPT 横空出世到各种大语言模型(LLM)接连上线,似乎每个人的朋友圈都在讨论 AI 会不会“ ...
2024-12-26数据分析师这个职业已经成为了职场中的“香饽饽”,无论是互联网公司还是传统行业,都离不开数据支持。想成为一名优秀的数据分析 ...
2024-12-26在数据驱动决策成为商业常态的今天,数据分析师这一职业正迎来前所未有的机遇与挑战。很多希望转行或初入职场的人士不禁询问:数 ...
2024-12-25数据分析师,这一近年来炙手可热的职业,吸引了大量求职者的注意。凭借在大数据时代中的关键作用,数据分析师不仅需要具备处理数 ...
2024-12-25在当今数字化变革的浪潮中,数据分析师这一职业正迎来前所未有的发展机遇。回想我自己初入数据分析行业时,那种既兴奋又略显谨慎 ...
2024-12-25在当今信息爆炸的时代,数据已经像空气一样无处不在,而数据分析则是解锁这些信息宝藏的钥匙。数据分析的过程就像是一次探险,从 ...
2024-12-25在职场上,拍脑袋做决策的时代早已过去。数据分析正在成为每个职场人的核心竞争力,不仅能帮你找到问题,还能提供解决方案,提升 ...
2024-12-24