Spark Streaming 妙用之实现工作流调度器-低调大师

Spark Streaming 妙用之实现工作流调度器

2017-07-31 748

之前有说过要设计一个工作流调度器。开发一个完善的工作流调度器应该并不是一件简单的事情。但是通过Spark Streaming(基于Transfomer架构的理念)，我们可能能简化这些工作。我在这块并没有什么经验，这只是一个存在于脑海中的东西。

下面是Azkaban的架构图：

也就是说要搭建一个稳定可靠的Azkaban的工作流调度器，你可能需要

两台互为主备MySQL
两台Executor Server
一台Web Server

你需要做架构设计，考虑WebServer 和 Executor Server的通讯问题

扩展性问题。Executor 能够动态调整?

稳定性问题。毕竟24小时运行的

然而，我们其实是不需要关注这么多东西的。我们真正关注的是：

Web UI
工作流的生成，解析，运行和存储

其他的都是基础设施。按照Transfomer架构的设计理念,我们应该可以找到一个Estimator ，作为我们的基础设施，我们只要关注上面两点即可，不需要为部署，高可用，稳定等发愁。同时我们也希望譬如WebUI等工作不是从头开始，而是按部就班添加新功即可。所以有了Estimator，我们只要做三点：

实现业务逻辑，也就是工作流的生成，解析，运行和存储等操作。
实现管理页面逻辑
指定需要的资源cpu/内存，就能Run起来这个Transformer

我搜罗了一圈，发现Spark Streaming 是能够满足该需求的一个Estimator。

这得益于，Spark Streaming 从某个角度而言就是个定时任务调度系统，也就是我们说的微批处理。对于工作流调度器而言，无非就是每个周期(duration)在Driver端启动线程扫描MySQL,实现任务的分发和执行。

那如果实现一个类似Azkaban 能够的做的事情，前面我们提到，要做三件事情，分别对应为：

1.实现业务逻辑，也就是工作流的生成，解析，运行和存储等操作。其中生成，解析，存储三个环节可以放在Driver端,也可以都放在Executor 端。也就是说：Driver的设计可重可轻。重的设计可由Driver读取MySQL 并且解析成工作流任务，然后发送给Executor 去执行。轻的设计Driver仅仅是读取MySQL,然后就简单将id分发给各个Executor,各个Executor 负责解析执行和反馈结果。

2.增强 Spark Streaming UI,添加管理页面，实现Azkaban Web Server类似界面。

3.按标准的Spark Streaming 程序提交该实现到集群即可完成部署。

我们看到，我们真正做到了只关注核心业务逻辑的实现，所谓部署，安装，运行等环节都实现了平台化(其实Estimator完成了)。而且实现了资源的细粒度(CPU/内存)划分，而不再是以服务器为基本单元。

事实上，我们也可以将一个Spark Streaming当做一个crontab 任务，这样就自然具有了一个分布式的crontab系统，并且提供更友好的管理，甚至能将任务本身融入到crontab中。

后话

Spark Streaming 不一定是最合适的Estimator,你可以自己实现一套类似的Estimator,最终形成所谓的 Azkaban On Yarn的程序。

作者：祝威廉

来源：51CTO

微信关注我们

原文链接：https://yq.aliyun.com/articles/196577

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

《UX最佳实践：提高用户体验影响力的艺术》一2.5　主要经验与建议

2.5　主要经验与建议经历了项目的各个阶段，我们知道了哪些实践是可行的，哪些需要改进。这曾是一个不断学习的过程，如今我们依然还在学习。本章中推荐的大部分UX实践对你和你的公司应该会有所帮助。但有些实践更适合在流程更复杂的大型公司和全球性组织中执行。你可以听取一些我们的建议，试着在你的公司中执行。你将会知道哪些实践经验是有用的，哪些需要根据自己的实际情况做调整。 2.5.1　关于扩大对技术影响力的建议明确UI需求的优先级　从客户和用户的角度考虑UI需求的优先级。运用用户研究数据和最终用户UI验证结果证明优先级的正确性。让UI需求变得简单易懂　决策者需要理解UI需求。通过截图表达视觉效果，使用简单易懂的术语。如果你的需求是从可用性测试结果中发现的，还可以播放一段用户界面令用户抓狂的视频，只需要截选亮点即可。为UI架构团队提出需求　在为U

2017-07-31

743

2015可谓是物联网发展的井喷之年，“互联网+”的政策扶持下，交通、能源、零售等行业联动发展，可穿戴设备、工业互联网惊喜亮相，物联网远不止2015年这么亮眼。一个大方向第十二届全国人民代表大会期间，李克强总理提出制定“互联网+”行动计划——推动移动互联网、云计算、大数据、物联网等与现代制造业结合，促进电子商务、工业互联网和互联网金融健康发展，引导互联网企业拓展国际市场。从通信、电子等信息科技企业到交通、零售等传统企业，大家都在积极借助“互联网+”计划促进产业新升级，新发展。而物联网在这个过程中也在积极响应“互联网+”战略号召，借助互联网的深入发展，物联网也逐渐扩张其发展版图，从交通、工业、能源等国计民生领域到家庭、课堂等走到人们身边。物联网也在不断深入人们生活，改变人们与世界相处的方式与体验。一个新领域随着“互联网+”战略的深入，传统产业也在积极探索互联网环境下的新发展，其中令我们耳目一新的要数工业互联网。其实工业互联网并不是一个新概念，它是2013年由GE研发部门命名并提出，借助传感技术、大数据、物联网能多项技术提高工业发展的效率与安全性，优化工业生产模式，提高经济效益。我...

2017-07-31

658

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。