spark 应用场景2-身高统计

原文引自:http://blog.csdn.net/fengzhimohan/article/details/78564610

a. 案例描述

本案例假设我们需要对某个省的人口 (10万) 性别还有身高进行统计,需要计算出男女人数,男性中的最高和最低身高,以及女性中的最高和最低身高。本案例中用到的源文件有以下格式, 三列分别是 ID,性别,身高 (cm),格式如下: 

b.人口数据的生成

利用Java语言随机生成一组人口数据,包括序列ID,性别M/F,身高cm,代码如下:

 1 import java.io.File;
 2 import java.io.FileWriter;
 3 import java.io.IOException;
 4 import java.util.Random;
 5 
 6 /**
 7  * Created by Administrator on 2017/11/13.
 8  */
 9 public class PeopleInfoFileGenerator {
10     public static void main(String[] args){
11         File file = new File("F:\\PeopleInfo.txt");
12 
13         try {
14             Random random = new Random();//生成随机数
15             FileWriter fileWriter = new FileWriter(file);//新建一个文件
16             for (int i=1;i<=1000000;i++){   //生成10万个数字
17                 int height = random.nextInt(220); 
18                 if (height < 50) {
19                     height = height + 50;
20                 }
21              String  gender = getRandomGender(); //性别方法
22              if (height < 100 && gender == "M") {
23                  height = height + 100;
24              }
25               if (height < 100 && gender == "F") {
26                   height = height + 40;
27               }
28              fileWriter.write( i + " " + getRandomGender() + " " + height); //文件格式:ID 性别 身高
29              fileWriter.write(System.getProperty("line.separator"));
30             }
31             fileWriter.flush();
32             fileWriter.close();
33             System.out.println("People Information File generated successfully.");
34         }catch (IOException e){
35             e.printStackTrace();
36         }
37     }
38 
39     public static String getRandomGender(){ //构建一个随机生成性别方法
40         Random random = new Random();
41         int randomNum = random.nextInt(2) + 1;
42         if( randomNum % 2 == 0){
43             return "M";
44         }else{
45             return "F";
46         }
47     }
48 }

c. 实例过程分析

对于这个案例,我们要分别统计男女的信息,那么很自然的想到首先需要对于男女信息从源文件的对应的 RDD 中进行分离,这样会产生两个新的 RDD,分别包含男女信息;其次是分别对男女信息对应的 RDD 的数据进行进一步映射,使其只包含身高数据,这样我们又得到两个 RDD,分别对应男性身高和女性身高;最后需要对这两个 RDD 进行排序,进而得到最高和最低的男性或女性身高。 
第一步,先分离男女信息,使用 filter 算子过滤条件包含”M” 的行是男性,包含”F”的行是女性;第二步我们需要使用 map 算子把男女各自的身高数据从 RDD 中分离出来;第三步我们需要使用 sortBy 算子对男女身高数据进行排序。

特别注意:RDD 转化的过程中需要把身高数据转换成整数,否则 sortBy 算子会把它视为字符串,那么排序结果就会受到影响,例如 身高数据如果是:123,110,84,72,100,那么升序排序结果将会是 100,110,123,72,84,显然这是不对的。

d.求出身高统计代码实现

 1 import org.apache.spark.SparkConf;
 2 import org.apache.spark.api.java.JavaRDD;
 3 import org.apache.spark.api.java.JavaSparkContext;
 4 import org.apache.spark.api.java.function.FlatMapFunction;
 5 import org.apache.spark.api.java.function.Function;
 6 import java.util.Arrays;
 7 /**
 8  * Created by Administrator on 2017/11/17.
 9  */
10 public class PeopleInfoCalculator {
11     public static void main(String[] args){
12         SparkConf sparkConf = new SparkConf().setAppName("PeopleInfoCalculator").setMaster("local[3]");
13         JavaSparkContext sc = new JavaSparkContext(sparkConf);
14         JavaRDD<String> dataFile = sc.textFile("F:\\PeopleInfo.txt");
15 
16         JavaRDD<String> maleFilterData = dataFile.filter(new Function<String, Boolean>() {//过滤出性别为M的数据
17             @Override
18             public Boolean call(String s) throws Exception {
19                 return s.contains("M");
20             }
21         });
22         JavaRDD<String> femaleFilterData = dataFile.filter(new Function<String, Boolean>() {//过滤出性别为F的数据
23             @Override
24             public Boolean call(String s) throws Exception {
25                 return s.contains("F");
26             }
27         });
28         JavaRDD<String> maleHeightData = maleFilterData.flatMap(new FlatMapFunction<String, String>() {//得到性别为M的身高数据
29             @Override
30             public Iterable<String> call(String s) throws Exception {
31                 return Arrays.asList(s.split(" ")[2]);
32             }
33         });
34         JavaRDD<String> femaleHeightData = femaleFilterData.flatMap(new FlatMapFunction<String, String>() {//得到性别为F的身高数据
35             @Override
36             public Iterable<String> call(String s) throws Exception {
37                 return Arrays.asList(s.split(" ")[2]);
38             }
39         });
40         JavaRDD<Integer> maleHeightDataInt = maleHeightData.map(new Function<String, Integer>() {//将字符串格式转化为整型格式
41             @Override
42             public Integer call(String s) throws Exception {
43                 return Integer.parseInt(String.valueOf(s));
44             }
45         });
46         JavaRDD<Integer> femaleHeightDataInt = femaleHeightData.map(new Function<String, Integer>() {//将字符串格式转化为整型格式
47             @Override
48             public Integer call(String s) throws Exception {
49                 return Integer.parseInt(String.valueOf(s));
50             }
51         });
52         //sortBy(<T>,ascending,numPartitions) 解释:
53         //第一个参数是一个函数,该函数的也有一个带T泛型的参数,返回类型和RDD中元素的类型是一致的;
54         //第二个参数是ascending,这参数决定排序后RDD中的元素是升序还是降序,默认是true,也就是升序;
55         //第三个参数是numPartitions,该参数决定排序后的RDD的分区个数,默认排序后的分区个数和排序之前的个数相等,即为this.partitions.size。
56         JavaRDD<Integer> maleHeightLowSort = maleHeightDataInt.sortBy(new Function<Integer,Integer>(){// true表示默认排序,为升序排序,从低到高排
57             public Integer call(Integer s) throws Exception {
58                 return s;
59             }
60         },true,3);
61         JavaRDD<Integer> femaleHeightLowSort = femaleHeightDataInt.sortBy(new Function<Integer,Integer>(){// true表示默认排序,为升序排序,从低到高排
62             public Integer call(Integer s) throws Exception {
63                 return s;
64             }
65         },true,3);
66         JavaRDD<Integer> maleHeightHightSort = maleHeightDataInt.sortBy(new Function<Integer,Integer>(){// false表示为降序排序,从高到低
67             public Integer call(Integer s) throws Exception {
68                 return s;
69             }
70         },false,3);
71         JavaRDD<Integer> femaleHeightHightSort = femaleHeightDataInt.sortBy(new         Function<Integer,Integer>(){// true表示默认排序,为降序排序,从低到高排
72             public Integer call(Integer s) throws Exception {
73                 return s;
74             }
75         },false,3);
76         Integer lowestMale = maleHeightLowSort.first(); //求出升序的第一个数,即最小值
77         Integer lowestFemale = femaleHeightLowSort.first();//求出升序的第一个数,即最小值
78         Integer highestMale = maleHeightHightSort.first();//求出降序的第一个数,即最大值
79         Integer highestFemale = femaleHeightHightSort.first();//求出降序的第一个数,即最大值
80 
81         System.out.println("Number of Female Peole:" + femaleHeightData.count());//求出女性的总个数
82         System.out.println("Number of Male Peole:" + maleHeightData.count());//求出男性的总个数
83         System.out.println("Lowest Male:" + lowestMale);//求出男性最矮身高
84         System.out.println("Lowest Female:" + lowestFemale);//求出女性最矮身高
85         System.out.println("Highest Male:" + highestMale);//求出男性最高身高
86         System.out.println("Highest Female:" + highestFemale);//求出女性最高身高
87 
88     }
89 }

 

e.运行结果:

 

转载于:https://www.cnblogs.com/jinggangshan/p/8109329.html

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/252608.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

阿里云OSS linux使用备忘录

ossutil config example: accessKeyId "AccessKeyId"; accessKeySecret "AccessKeySecret"; ###以上两个在 https://help.aliyun.com/knowledge_detail/38738.html endPoint "http://oss-cn-beijing.aliyuncs.com";转载于:https://www.cnblog…

缠绕多年的PCIE通道数问题终于完全明白了,欢迎指正

CPU的PCIE通道数&#xff0c;之前一直都是一个众说纷纭的问题很多人都会问到&#xff0c;主板上不同的M.2接口&#xff0c;接SSD性能是否一样&#xff0c;接太多的SSD&#xff0c;是否会占用显卡的PCIE带宽&#xff0c;今天我又看了几篇网上的文章&#xff0c;终于十分清楚地搞…

vue-router实例

最近刚刚用vue写了个公司项目&#xff0c;使用vue-cli构建的&#xff0c;算是中大型项目吧&#xff0c;然后这里想记录并且分享一下其中的知识点&#xff0c;希望对大家有帮助,后期会逐渐分享&#xff1b;话不多说&#xff0c;直接上代码&#xff01;&#xff01; app.vue 1 &l…

React学习小结(二)

一、组件的嵌套 1 <!DOCTYPE html>2 <html>3 <head>4 <meta charset"UTF-8">5 <title></title>6 <script src"react.min.js" type"text/javascript" charset"utf-8"></script>7 <…

PCIE2.0/PCIE3.0/PCIE4.0/PCIE5.0接口的带宽、速率计算

一、PCIE接口速率&#xff1a; 二、PCIE相关概念&#xff1a; 传输速率为每秒传输量GT/s&#xff0c;而不是每秒位数Gbps&#xff0c;因为传输量包括不提供额外吞吐量的开销位&#xff1b; 比如 PCIe 1.x和PCIe 2.x使用8b / 10b编码方案&#xff0c;导致占用了20% &#xff08…

华为交换机同一vlan不同网段的通信

在VLANIF接口下配置主从IP地址&#xff0c;可以实现同一VLAN多个网段用户间的互通。 某VLAN10内两个主机Host_1和Host_2分别属于网段10.1.1.1/24和10.1.2.1/24&#xff0c;要求两主机互通。 可以在Switch上进行如下配置&#xff1a; [Switch] interface gigabitethernet 0/0/1 …

hql语法

HQL查询&#xff1a;Criteria查询对查询条件进行了面向对象封装&#xff0c;符合编程人员的思维方式&#xff0c;不过HQL(Hibernate Query Lanaguage)查询提供了更加丰富的和灵活的查询特性&#xff0c;因此Hibernate将HQL查询方式立为官方推荐的标准查询方式&#xff0c;HQL查…

四五月份:关键词是沟通、绘画和SQL

例行总结一下四五月份的感受。 关键词有三个&#xff1a;沟通、绘画和SQL。 整体来说&#xff0c;这两个月在努力跟这三个关键词死磕&#xff0c;略有些进展&#xff0c;因此汇报一下。 虽然这三个关键词从重要度来说是从左到右的&#xff0c;但从叙述来讲&#xff0c;还是先从…

InfiniBand简介

一&#xff0e;什么是infiniband InfiniBand架构是一种支持多并发链接的“转换线缆”技术&#xff0c;它是新一代服务器硬件平台的I/O标准。由于它具有高带宽、低延时、 高可扩展性的特点&#xff0c;它非常适用于服务器与服务器&#xff08;比如复制&#xff0c;分布式工作等…

程序员的视角:java GC

GC&#xff08;Garbage Collection 垃圾回收&#xff09;的概念随着 java 的流行而被人们所熟知。 实际 GC 最早起源于20世纪60年代的 LISP 语言&#xff0c;是一种自动的内存管理机制。 GC 要解决的问题有 3 个&#xff1a;1. 回收什么&#xff1f;&#xff08;what&#xff0…

spring mvc拦截器HandlerInterceptor

本文主要介绍springmvc中的拦截器&#xff0c;包括拦截器定义和的配置&#xff0c;然后演示了一个链式拦截的测试示例&#xff0c;最后通过一个登录认证的例子展示了拦截器的应用 拦截定义 定义拦截器&#xff0c;实现HandlerInterceptor接口。接口中提供三个方法。 public cla…

mysql show 语句大全

mysql show 语句大全 show open tables; 基于本人对MySQL的使用&#xff0c;现将常用的MySQL show 语句列举如下&#xff1a; 1.show databases ; // 显示mysql中所有数据库的名称 2.show tables [from database_name]; // 显示当前数据库中所有表的名称 3.show columns from …

阿里云Aliplayer高级功能介绍(一):视频截图

基本介绍H5 Video是不提供截图的API的&#xff0c; 视频截图需要借助Canvas&#xff0c;通过Canvas提供的drawImage方法&#xff0c;把Video的当前画面渲染到画布上&#xff0c; 最终通过toDataURL方法可以导出图片的base64编码&#xff0c;基本就完成了图片截图的功能。 功能实…

POJ 1151 Atlantis 线段树+扫描线

解题思路: 先将y轴进行离散化。n个矩形的2n个横边纵坐标共构成最多2n-1个区间的边界&#xff0c;对这些区间编号&#xff0c;建立起线段树。 x轴记录左边和右边&#xff0c;左边时是矩形面积增加&#xff0c;覆盖层数增加边&#xff0c;右边是形面积减少&#xff0c;覆盖层数减…

分页

1.首先在数据库中建立一个视图&#xff08;在aspx中sql查询语句是view_student不是student&#xff09;&#xff0c;在视图里创建create view view_student--创建视图as row_number 行号 一条数据是一行 分页功能要根据行数运算select *,row_number() over(order by stuNo desc…

NFS服务端的安装

执行以下四步操作即可完成在虚拟机上安装完成NFS的服务端&#xff1a;第一步&#xff1a;在虚拟机上安装nfs服务&#xff1a; sudo apt install nfs-kernel-server 第二步&#xff1a;修改文件 sudo vi /etc/exports 在文件末尾增加 /home/zzf/hisi-sdk 192.16…

【C++STL/红黑树】POJ 3481 DoubleQueue

POJ 3481 Double Queue 描述&#xff1a; 新成立的BIG-Bank在不切雷斯特开了一间新办公室,使用了由IBM罗马尼亚的现代计算机办公环境,运用了现代信息技术.一般来说,银行的每个顾客都有一个识别码K,并且每一个来银行的顾客都会被给予一个优先级P.银行主管的一个大胆想法震惊了公…

基础表单笔记

表单数据要向服务端提交的话 每个表单都要指定一些属性就是name""和value"" value就是用户写什么就是什么 来提交name就是对这个表单进行一个标识 <from> 输入用户名<input type"text" name"user" value""/>这…

PCIE总线-PCI、PCIE关系及信号定义

PCI(Peripheral Component Interconnect)总线规范在上世纪九十年代由Intel提出。在处理器体系结构中&#xff0c;PCI总线属于局部总线(Local Bus)。局部总线作为系统总线的延伸&#xff0c;主要功能是为了连接外部设备。 处理器主频的不断提升&#xff0c;要求速度更快&#x…