聚合多个文件_python数据分析与挖掘（二十五）--- Pandas高级处理分组与聚合

分组与聚合通常是分析数据的一种方式，通常与一些统计函数一起使用，查看数据的分组情况

想一想其实刚才的交叉表与透视表也有分组的功能，所以算是分组的一种形式，只不过他们主要是计算次数或者计算比例！！看其中的效果：

4.10.1 什么是分组与聚合

4.10.2 分组与聚合API

DataFrame.groupby(key, as_index=False)
- key:分组的列数据，可以多个

案例:不同颜色的不同笔的价格数据

col =pd.DataFrame({'color': ['white','red','green','red','green'], 'object': ['pen','pencil','pencil','ashtray','pen'],'price1':[5.56,4.20,1.30,0.56,2.75],'price2':[4.75,4.12,1.60,0.75,3.15]})color    object    price1    price2
0    white    pen    5.56    4.75
1    red    pencil    4.20    4.12
2    green    pencil    1.30    1.60
3    red    ashtray    0.56    0.75
4    green    pen    2.75    3.15

进行分组，对颜色分组，price进行聚合

# 分组，求平均值
col.groupby(['color'])['price1'].mean()
col['price1'].groupby(col['color']).mean()color
green    2.025
red      2.380
white    5.560
Name: price1, dtype: float64# 分组，数据的结构不变
col.groupby(['color'], as_index=False)['price1'].mean()color    price1
0    green    2.025
1    red    2.380
2    white    5.560

4.10.3 星巴克零售店铺数据案例

现在我们有一组关于全球星巴克店铺的统计数据，如果我想知道美国的星巴克数量和中国的哪个多，或者我想知道中国每个省份星巴克的数量的情况，那么应该怎么办？

数据来源：Starbucks Locations Worldwide

1 数据获取

从文件中读取星巴克店铺数据

# 导入星巴克店的数据
starbucks = pd.read_csv("directory.csv")

2 进行分组聚合

# 按照国家分组，求出每个国家的星巴克零售店数量
count = starbucks.groupby(['Country']).count()

画图显示结果

count['Brand'].plot(kind='bar', figsize=(20, 8))
plt.show()

假设我们加入省市一起进行分组

# 设置多个索引，set_index()
starbucks.groupby(['Country', 'State/Province']).count()

仔细观察这个结构，与我们前面讲的哪个结构类似？？

与前面的MultiIndex结构类似

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.mzph.cn/news/520412.shtml

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

聚合多个文件_python数据分析与挖掘（二十五）--- Pandas高级处理分组与聚合

4.10.1 什么是分组与聚合

4.10.2 分组与聚合API

4.10.3 星巴克零售店铺数据案例

1 数据获取

2 进行分组聚合

相关文章

Linux Shell脚本_设置最大打开文件数

看完这些干货帖，大数据产品从入门到精通

物联网现状及落地难点

aspx转发php_asp,php,aspx一句话合集

Linux Shell脚本_较少Swap使用

物联网落地三大困境破解

阿里如何做到百万量级硬件故障自愈？

京东技术全景图首次展示四大重磅智能技术驱动产业未来

9008刷机怎么刷_手机刷机怎么刷

idea 提示接口注释信息

阿里工业互联网平台“思考”：一场从0到1的蜕变

JSON数据从MongoDB迁移到MaxCompute最佳实践

SpringBoot 整合 Shiro thymeleaf _01_Shiro概念

中正则表达式详解_python ：正则表达式/re库超级详细de注释解释

打破多项世界记录双11背后最大的力量是技术

阿里巴巴下一代云分析型数据库AnalyticDB入选Forrester Wave™ 云数仓评估报告解读

广州云栖大会：阿里云携手虎牙，首次落地直播行业边缘节点及云企业网服务

一行 Python 代码能实现这么多丧心病狂的功能？（代码可复制）

测试私有方法_史上最轻量！阿里开源了新型单元测试Mock工具

SpringBoot 整合 Shiro Thymeleaf Mysql 动态授权