深入理解Spark:核心思想与源码分析. 3.5 Hadoop相关配置及Executor环境变量
3.5 Hadoop相关配置及Executor环境变量
3.5.1 Hadoop相关配置信息
默认情况下,Spark使用HDFS作为分布式文件系统,所以需要获取Hadoop相关配置信息的代码如下。
val hadoopConfiguration = SparkHadoopUtil.get.newConfiguration(conf)
获取的配置信息包括:
将Amazon S3文件系统的AccessKeyId和SecretAccessKey加载到Hadoop的Configuration;
将SparkConf中所有以spark.hadoop.开头的属性都复制到Hadoop的Configuration;
将SparkConf的属性spark.buffer.size复制为Hadoop的Configuration的配置io.file.buffer.si