Apache Spark机器学习.2.3 一致性匹配
2.3 一致性匹配
本节,我们将讨论一个重要的数据准备主题,就是一致性匹配和相关解决方案。我们将讨论几个使用Spark解决一致性问题的特征和使用Spark的数据匹配解决方案。
阅读本节以后,读者可以使用Spark解决一些常见的数据一致性问题。
2.3.1 一致性问题
我们经常需要在数据准备过程中处理一些属于同一个人或单元的数据元素,但这些元素并不相似。例如,我们有一些Larry Z.的购物数据和L. Zhang的网页活动数据。Larry Z.和L. Zhang是否是同一个人?数据中是否有很多一致性的变化。
由于实体变异的类型非常普遍,可能引起的原因有:重复、错误、名字变化和有意的别名等,使得对象匹配成为机器学习数据准备中的一个巨大挑战。有时,完成匹配或寻找关联都非常困难,而且这些工作非常耗时。然而,任何种类的错误匹配将产生许多错误,数据的不