离线计算平台系列之一

2016-08-02 805

离线计算平台简介

在蚂蚁金服风控体系里面，有一个重要的环节就是离线仿真，在规则，模型上线之前，在离线的环境里面进行仿真验证，来对规则和模型进行效能的评估，避免人为因素造成不准确性从而造成的资损。起初为了达到这个目的，离线计算平台就这样孕育而生了，慢慢地整个离线平台覆盖了更多风控的业务，也慢慢变成目前Odps-Spark最大的用户，拥有的集群数目也是最大的。离线计算平台主要以Spark为基础，在其上建立起来的一套平台. 后面我们团队会给大家带来一系列，关于离线平台的架构以及我们做过相应业务以及经验，希望和大家一起来探讨。
下面由我来给大家分享下，我们整个团队建立起离线计算平台里面的SparkContext管理以及几个Spark优化手段。

SparkContext 管理

在我们的离线业务场景里面，我们需要持续地接受用户提交实验任务进行分析以及

微信关注我们

原文链接：https://yq.aliyun.com/articles/58742

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

MapReduce优化----Shuffle过程剖析及性能优化

1.Map端当Map开始产生输出时，它并不是简单的把数据写到磁盘，因为频繁的磁盘操作会导致性能严重下降。它的处理过程更复杂，数据首先是写到内存中的一个缓冲区，并做了一些预排序，以提升效率。每个Map任务都有一个用来写入输出数据的循环内存缓冲区。这个缓冲区默认大小是100MB，可以通过io.sort.mb属性来设置具体大小。当缓冲区中的数据量达到一个特定阀值(io.sort.mb * io.sort.spill.percent，其中io.sort.spill.percent默认是0.80)时，系统将会启动一个后台线程把缓冲区中的内容spill到磁盘。在spill过程中，Map的输出将会继续写入到缓冲区，但如果缓冲区已满，Map就会被阻塞直到spill完成。spill线程在把缓冲区的数据写到磁盘前，会对它进行一个二次快速排序，首先根据数据所属的partition排序，然后每个partition中再按Key排序。输出包括一个索引文件和数据文件。如果设定了Combiner，将在排序输出的基础上运行。Combiner就是一个Mini Reducer，它在执行Map任务的节点本身运行，先对M...

2016-08-01

746

Live long and process (#LLAP) sershe, sseth, hagleitn, 2014-08-27. Overview综述 Hive has become significantly faster thanks to various features and improvementsthat were built by the community over the past two years. Keeping themomentum, here are some examples of what we think will take us to the nextlevel: asynchronous spindle-aware IO, pre-fetching and caching of column chunks,and multi-threaded JIT-friendly operator pipelines. 得益于在过去两年里社区提交的各种特性和改进，Hive能够显著的变快。为保持这一势头，这里有一些示例，被认为能够带领我们（将Hive）...

2016-08-02

664

资源下载

更多资源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。

离线计算平台系列之一

离线计算平台简介

SparkContext 管理

MapReduce优化----Shuffle过程剖析及性能优化

Live long and process (#LLAP) 翻译

相关文章

发表评论

资源下载

腾讯云软件源

Nacos

Rocky Linux

WebStorm

欢迎您来访！