合并Spark社区代码的正确姿势

原创文章,转载请保留出处

最近刚刚忙完Spark 2.2.0的性能测试及Bug修复,社区又要发布2.1.2了,国庆期间刚好有空,过了一遍2.1.2的相关JIRA,发现有不少重要修复2.2.0也能用上,接下来需要将有用的PR合到我们内部维护的2.2.0分支上了。

经常有朋友问我是怎么把社区的PR合到自己分支上的,我之前跟他们介绍的做法是基于PR拉分支,在IDEA中单个文件diff合并。如果是偶尔合下社区代码,这种方式也不算太费事。但是如果PR中改动的文件较多,或者要合并多个PR过来,这种方式也挺麻烦。

废话到此,这篇文章是介绍,如何高效地合并Spark社区PR到自己维护的分支(常说的打Patch),当然,针对其他开源项目,该方法同样适用。

PR:Pull Request是GitHub上的一个功能,开源代码的贡献者,通过发起一个Pull Request向社区贡献代码。

准备Spark代码

一般来说,自己维护一套Spark代码,需要Fork下社区项目,在clone自己Fork的代码,进行开发。我这里以Spark 2.2.0为例。

  1. clone自己Fork的仓库到本地

    # stanzhai是我的GitHub账号,大家需要换成自己的仓库地址
    git clone https://github.com/stanzhai/spark.git
    cd spark
  2. 添加一个名为upstream的远程仓库指向社区的版本库

    git remote add upstream https://github.com/apache/spark.git
  3. 设置PR引用,编辑git配置vi .git/config,找到upstream,添加最后一行fetch

    [remote "upstream"]url = https://github.com/apache/spark.gitfetch = +refs/heads/*:refs/remotes/upstream/*fetch = +refs/pull/*/head:refs/remotes/upstream/pr/*  # 注意添加这行
  4. 同步远端库,更新分支引用(每次合并前都需要执行)

    git remote update
  5. checkout一个2.2.0的维护分支

    git checkout -b my-2.2.0 v2.2.0

我们创建了一个基于2.2.0的my-2.2.0分支,下面的示例是将社区PR合并到my-2.2.0分支中。

提交给社区的PR大致分为2类:

  1. PR被接受,且被合并到社区的仓库
  2. PR没有合并到社区仓库,(代码没问题,有可能commiter还没来得及处理)

整合已被社区合并的PR

被合并到社区的PR已经做了rebase处理,对于这种PR,合并到自己的分支中是非常简单的事情,直接使用git的cherry-pick就可以搞定。

我们以这个卡片为例:https://issues.apache.org/jira/browse/SPARK-22083

这个卡片被标记为resolved,而且PR也被合到社区仓库了:https://github.com/apache/spark/pull/19311,我们打开这个链接,到页面下方,找到这个位置:

spark-pr.png

打开后,会跳转到这个地址:https://github.com/apache/spark/commit/2c5b9b1173c23f6ca8890817a9a35dc7557b0776,地址中后面的一长串就是我们需要的commit-id,得到这个就可以直接合并代码了:

git remote update
git cherry-pick 2c5b9b1173c23f6ca8890817a9a35dc7557b0776

执行完,提示以下信息就表示合并成功了:

➜  spark git:(my-2.2.0) ✗ git cherry-pick 2c5b9b1173c23f6ca8890817a9a35dc7557b0776
[my-2.2.0 529f5ea55ff] [SPARK-22083][CORE] Release locks in MemoryStore.evictBlocksToFreeSpaceAuthor: Imran Rashid <irashid@cloudera.com>Date: Mon Sep 25 12:02:30 2017 -07002 files changed, 153 insertions(+), 13 deletions(-)

如果合并的代码恰好也被你改过了,那么有可能会出现冲突,这种情况正常解决冲突,然后git commit就可以了。

整合尚未合并到社区的PR

由于一个PR可能包含多次提交,整合未合并到社区的PR就比较麻烦了。Spark的主干代码每天都有变动,直接对比两个不同的分支变动通常会比较大,我们需要将PR中n次提交的代码的所有变更梳理出来,然后在做整合。

我们以这个PR为例:https://github.com/apache/spark/pull/19301,这个PR实现上还有待改进,但可以正常工作,因此还没合入社区,我们将这个PR合并到my-2.2.0分支,需要进行以下操作:

# 更新远程仓库及版本引用信息
git remote update# 基于某个PR创建一个分支,这里的19301是这个PR在GitHub上的id
git checkout -b pr-19301 upstream/pr/19301
git checkout pr-19301# PR分支大都基于master开发,以upstream/master分支为基准,重新apply PR分支上的修改
git rebase upstream/master# 通过diff提取这次PR的patch文件
git diff upstream/master > pr-19301.patch# 到目标分支打patch
git checkout my-2.2.0
git apply --reject pr-19301.patch# 查看上一步apply的状态
git status
# apply有可能会不成功,尚未apply的patch被存放到*.rej文件中,需要手动处理,最后提交即可
git commit -a# 清理
rm pr-19301.patch
rm *.rej
git branch -D pr-19301

参考

  • Useful Developer Tools
  • A successful Git branching model
  • Git 分支 - 分支的衍合

最后

上述方法不能保证合PR 100%成功,原则上你的分支和社区代码约近,冲突越少,越容易处理。Spark 2.x的代码有很大的变动,把针对2.x的PR打到1.6的分支上,往往是个麻烦事。

文章首发自知乎专栏:Spark大数据技术,专注大数据、Spark相关技术,欢迎关注。

据说看完这篇文章给个赞的同学,打Patch都不会遇到冲突 ~(≧▽≦)/~

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/287559.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

.NET 中 GC 的模式与风格

垃圾回收&#xff08;GC&#xff09;是托管语言必备的技术之一。GC 的性能是影响托管语言性能的关键。我们的 .NET 既能写桌面程序 (WINFROM , WPF) 又能写 web 程序 (ASP.NET CORE)&#xff0c;甚至还能写移动端程序。。。不同使用场景的程序对 GC 的风格也有不同的要求&#…

[python opencv 计算机视觉零基础到实战] 七、逻辑运算与应用

一、学习目标 了解opencv中图像的逻辑运算了解opencv中逻辑运算的应用 目录 [python opencv 计算机视觉零基础到实战] 一、opencv的helloworld [【python opencv 计算机视觉零基础到实战】二、 opencv文件格式与摄像头读取] 一、opencv的helloworld [[python opencv 计算机…

【ArcGIS风暴】数字化实验:数据采集与编辑完整操作流程

一.实验平台:ArcGIS 9.3 二.实验目的:对甘肃省的十四个地级市进行图像配准、数据采集。 三.实验要求:掌握地理数据采集方法,图像配准及坐标投影,选择主要的点、线、面进行投影。 四.实验数据:甘肃省统计数据,甘肃省行政区划图。 (一).影像配准 第一步:加载…

loadrunner java 参数化_LoadRunner 参数化详解

LoadRunner&#xff0c;是一种预测系统行为和性能的负载测试工具。通过以模拟上千万用户实施并发负载及实时性能监测的方式来确认和查找问题&#xff0c;LoadRunner能够对整个企业架构进行测试。通过使用 LoadRunner&#xff0c;企业能最大限度地缩短测试时间&#xff0c;优化性…

Android之实现RTL的ViewPager

1 问题 如何实现RTL的ViewPager,就是滑动方向和我们之前滑动的方向相反,比如一般,我们用ViewPager滑动4个图片,依次顺序是 1 2 3 4 ,我们在页面1的时候,我们一般都是习惯向左滑动到2,现在需要实现手指向右滑动到2. 2 解决办法 1)我们可以使用ViewPager2,这个是可以支…

Why Apache Spark is a Crossover Hit for Data Scientists [FWD]

Spark is a compelling multi-purpose platform for use cases that span investigative, as well as operational, analytics. Data science is a broad church. I am a data scientist — or so I’ve been told — but what I do is actually quite different from what oth…

Blazor University (21)使用 RenderFragments 模板化组件 —— 传递占位符

原文链接&#xff1a;https://blazor-university.com/templating-components-with-renderfragements/passing-placeholders-to-renderfragments/将占位符传递给 RenderFragments源代码[1]说明&#xff1a;此页面的灵感来自用户 ℳisterℳagoo 的 Twitter 帖子。首先&#xff0c…

物联网(车联网)平台架构方案

技术支持QQ&#xff1a;787728951、车载终端网关采用mina/nettyspring架构&#xff0c;独立于其他应用&#xff0c;主要负责维护接入终端的tcp链接、上行以及下行消息的解码、编码、流量控制&#xff0c;黑白名单等安全控制&#xff0c;网关同时支持交通部JT/T808-2011、JT/T80…

[python opencv 计算机视觉零基础到实战] 八、ROI泛洪填充

一、学习目标 了解什么是ROI了解floodFill的使用方法 如有错误欢迎指出~ 目录 [python opencv 计算机视觉零基础到实战] 一、opencv的helloworld [【python opencv 计算机视觉零基础到实战】二、 opencv文件格式与摄像头读取] 一、opencv的helloworld [[python opencv 计…

解决冲突

人生不如意之事十之八九&#xff0c;合并分支往往也不是一帆风顺的。 准备新的feature1分支&#xff0c;继续我们的新分支开发&#xff1a; $ git checkout -b feature1 Switched to a new branch feature1修改readme.txt最后一行&#xff0c;改为&#xff1a; Creating a new …

HQL入门学习

2019独角兽企业重金招聘Python工程师标准>>> package myHibernate; /** 测试简单的HQL语句* 2010年4月9日 23:36:54* */ import java.text.ParseException; import java.text.SimpleDateFormat; import java.util.Calendar; import java.util.Date; import java.uti…

Oracle精简客户端配置

2019独角兽企业重金招聘Python工程师标准>>> 由于Oracle client体积很大。而且安装后&#xff0c;基本上就用2个功能&#xff1a;TNS配置服务名和SQL*Plus。下面是一种小巧、快捷的Oracle客户端配置方法&#xff1a; 1.下载Instant Client 下载地址&#xff1a; htt…

WinUI迁移到.NET MAUI个人体验

迁移的初衷本人平时是做.net相关的工作&#xff0c;对于.net技术栈也有一些了解&#xff0c;自从新的.net能够跨平台之后&#xff0c;之前也有跨平台的ui框架Xamarin&#xff0c;现在微软推出了.NET MAUI这个说是 统一了开发体验&#xff0c;而且都RC版本了&#xff0c;所以本人…

祝CSDN2021牛气冲天祝我也拨云散雾

前言 2020年4月&#xff0c;我写了一篇用turtle绘制《小清新风格的树》&#xff0c;反响挺好。现在打算使用turtle修改一下绘制方式&#xff0c;因为线条的绘制太过考虑因素过多&#xff0c;如果使用方块进行堆叠&#xff0c;绘制出来的形状可以如马赛克一样&#xff0c;既符合…

FPGA图案--数字表示(代码+波形)

在数字逻辑系统&#xff0c;仅仅存在高低。所以用它只代表一个整数数字。并且有3代表性的种类。这是&#xff1a;原码表示(符号加绝对值值)、反码表示(加-minus标志)而补码(符号加补)。这三个在FPGA中都有着广泛的应用。以下分别讨论。1、原码表示法 原码表示法是机器数的一种简…

WPF效果第一百八十四篇之网页视频保存

一年一度的小学入学采集开始了;我一朋友很是头大,他说头都大了好几圈了;既要准备各种入学材料又要听线上专人视频直播讲解;然而在直播结束后,他发现自己仍是一脸疑惑;虽说直播有回访吧,但是他那蜗牛网速简直了;这时他场外找我,让我看能不能给他自己下载一份;1、毕竟第一次,直接…

【遥感数字图像处理】基础知识:第一章 绪论

第一章 绪 论 ◆ 课程学习要求 主要教学内容&#xff1a;遥感数字图像处理的概念和基础知识&#xff0c;遥感数字图像的几何处理&#xff0c;遥感图像的辐射校正&#xff0c;遥感数字图像的增强处理&#xff0c;遥感图像的计算机分类&#xff0c;遥感数字图像的分析方法&…

自定义Git

在安装Git一节中&#xff0c;我们已经配置了user.name和user.email&#xff0c;实际上&#xff0c;Git还有很多可配置项。 比如&#xff0c;让Git显示颜色&#xff0c;会让命令输出看起来更醒目&#xff1a; $ git config --global color.ui true这样&#xff0c;Git会适当地显…

[python opencv 计算机视觉零基础到实战] 九、模糊

一、学习目标 了解什么是卷积了解模糊的使用方法与应用 如有错误欢迎指出~ 二、了解模糊的应用 上一篇:[python opencv 计算机视觉零基础到实战] 八、ROI泛洪填充 2.1 了解卷积是什么 在本节中&#xff0c;卷积我们不过多的进行深入讲解&#xff0c;我本人对卷积也只是稍…