概述
需求:
由于一个大文件,在spark中加载性能比较差。于是把一个大文件拆分为多个小文件后上传到hdfs,然而在spark2.2下如何加载某个目录下多个文件呢?
public class SparkJob { public static void main(String[] args) { String filePath = args[0]; // initialize spark session String appName = "Streaming-MRO-Load-Multiple-CSV-Files-Test"; SparkSession sparkSession = SparkHelper.getInstance().getAndConfigureSparkSession(appName); // reader multiple csv files. try { Dataset<Row> rows = sparkSession.read().option("delimiter", "|").option("header", false) .csv(filePath).toDF(getNCellSchema()); rows.show(10); } catch (Exception ex) { ex.printStackTrace(); } try { Dataset<String> rows = sparkSession.read().textFile(filePath); rows.show(10); } catch (Exception ex) { ex.printStackTrace(); } SparkHelper.getInstance().dispose(); } private static Seq<String> getNCellSchema() { List<String> ncellColumns = "m_id,m_eid,m_int_id,....."; List<String> columns = new ArrayList<String>(); for (String column : ncellColumns) { columns.add(column); } Seq<String> columnsSet = JavaConversions.asScalaBuffer(columns); return columnsSet; } }
测试结果:
最后
以上就是还单身香烟为你收集整理的Spark:java api读取hdfs目录下多个文件的全部内容,希望文章能够帮你解决Spark:java api读取hdfs目录下多个文件所遇到的程序开发问题。
如果觉得靠谱客网站的内容还不错,欢迎将靠谱客网站推荐给程序员好友。
本图文内容来源于网友提供,作为学习参考使用,或来自网络收集整理,版权属于原作者所有。
发表评论 取消回复