Apache Spark机器学习.2.2　数据清洗-低调大师

Apache Spark机器学习.2.2　数据清洗

2017-05-01 656

2.2　数据清洗

在本节中，我们将回顾一些Spark平台上的数据清洗方法，重点关注数据不完备性。然后，我们将讨论一些Spark数据清洗方面的特殊特征，以及一些基于Spark平台更加容易的数据清洗解决方案。

学习完本节，我们将能够完成数据清洗，并为机器学习准备好数据集。

2.2.1　处理数据不完备性

对于机器学习，数据越多越好。然而，通常数据越多，“脏数据”也会越多——这意味着会有更多的数据清洗工作。

数据质量控制可能会有许多问题需要处理，有些问题可能很简单，如数据输入错误或者数据复制。原则上，解决他们的方法是类似的——例如，利用数据逻辑来实现探索和获取项目的本质知识，利用分析逻辑来纠正他们。为此，在本节中，我们将重点关注缺失值处理，以便说明在这个主题上Spark的使用方法。数据清洗涵盖了数据的准确性、完整性、独特性、时效性和一致性。

虽然听起

微信关注我们

原文链接：https://yq.aliyun.com/articles/84530

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

《Flume日志收集与MapReduce模式》一3.3　小结

本节书摘来自华章出版社《Flume日志收集与MapReduce模式》一书中的第3章，第3.3节，作者［美］史蒂夫·霍夫曼（Steve Hoffman）斯里纳特·佩雷拉（Srinath Perera），更多章节内容可以访问云栖社区“华章计算机”公众号查看 3.3　小结本章介绍了在数据处理管道中常用的两类通道。内存通道提供了更快的速度，这是以故障事件出现时数据丢失为代价的。此外，文件通道提供了更可靠的传输，因为它能容忍代理故障与重启，这是以牺牲性能为代价的。你需要确定哪种通道更适合于你的使用场景。在确定内存通道是否适合时，请问问自己丢失一些数据的经济上的代价如何。在考虑是否使用持久化通道时请衡量它与添加更多的硬件以弥补性能上的差异时的代价相比如何。另一个考虑就是数据问题了。写入到Hadoop中的数据不一定都来自于流式应用日志。如果接

2017-05-01

653

前言 Storm技术内幕与大数据实践本书意在介绍实时大数据的各个方面，分享我们在设计实时应用过程中遇到的一些问题，让一些从零开始构建实时计算平台的公司少走弯路。我们力图使不同背景的读者都能从其中获益。如果你从事基础架构方面的工作，可以着重阅读以下几章：在第1章中，我们整理了国内主要互联网公司在Storm应用方面的一些情况；在第2章中，我们介绍了实时平台的总体架构，随后引入了大众点评和1号店目前实时平台的一些基本情况；在第4章中，我们给出了源码剖析，为了让不懂Clojure语言的读者也能容易地理解Storm的内部原理，我们配了很多顺序图来描述调用逻辑；在第5章中，我们分享了一些在实践中总结出来的监控Storm应用的常用方法；在第6章中，我们介绍了在Storm上如何做一些扩展，方便更好地维护和管理集群；在第10章中，我们主要分享了Storm的一些小技巧和性能优化的经验。如果你是大数据产品的开发和架构人员，可以着重阅读后面的几章，其中分享了我们一年来遇到的一些瓶颈。如果你是算法工程师，可以着重了解第8章和第9章，里面的用户生命周期模型、实时推荐系统的算法和架构、千人千面架构等不少内容...

2017-05-01

691

资源下载

更多资源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。