七月论文审稿GPT第4.5版:通过15K条paper-review数据微调Llama2 70B(含各种坑)

前言

当我们3月下旬微调完Mixtral 8x7B之后(更多详见:七月论文大模型:含论文的审稿、阅读、写作、修订 ),下一个想微调的就是llama2 70B

  1. 因为之前积攒了不少微调代码和微调经验,所以3月底apple便通过5K的paper-review数据集成功微调llama2 70B,但过程中也费了不少劲
  2. 考虑到最后的成功固然令人欣喜,但真正让一个人或一个团队快速涨经验的还是那些在训练过程中走过的踩过的各种坑以及走过的各种弯路,所以本文第一部分我会把apple在训练中的遇到各种报错信息而一步步debug、或各种搜Google、搜GitHub的过程都整理出来

进入到4月份之后,我们先针对数据折腾了一把,毕竟数据质量通常是一个项目效果的天花板,然数据质量的提升不是短短一两周的事情,考虑到为并行加速

三太子进入70B微调组,和apple一起继续拿之前处理好的数据继续微调70B,但这一次是用15K的数据量了

第一部分 通过1.5K条paper-review数据微调LLaMA2 70B

1.1 GPU配置情况:8张80G的A100

以下是训练过程中GPU的占用情况

  1. git lfs clone https://huggingface.co/NousResearch/Llama-2-70b-chat-hf ,这个命令运行结束后,硬盘占用为518GB
  2. 配置环境开始训练后,硬盘占用为522GB
  3. 训练完成后硬盘占用为566GB
  4. merge_lora完成后硬盘占用为694GB,训练结束时内存占用262GB

观测到训练过程中显存最高占用为570GB,故建议使用80GB*8卡训练

1.2 1.5K数据的运行过程记录

  1. 03-19 3:55 flash_attn 设置成false和true都会报错q_len %d should be divisible by group size %d,且每张卡报错by group size后面数字不同
    raise ValueError("q_len %d should be divisible by group size %d." % (q_len, group_size))
    ValueError: q_len 8454 should be divisible by group size 2113.

    最终,修改train.py中的文件引用:即把from attention.llama_attn_replace import replace_llama_attn改成如下图所示,解决报错

  2. 03-19 8:53 8*A100 成功开始训练 1500 条数据

  3. 03-19 9:34 apple按照阿旬建议,多卡训练,需要修改配置文件参数

  4. 03-19 13:09 1500 条数据训练成功完成,2 epoch 用时 3小时07 分

第二部分 开始训练 5000 条数据

2.1 5K数据的训练全程

2.1.1 第一阶段:flash_attn频频出问题

  1. 03-19 18:00 发现训练至 0.48epoch 2小时30分,到batch_id:164 2624条数据报错./aten/src/ATen/native/cuda/Indexing.cu:1141: indexselectLargeIndex: block: [613,0,0], thread.[61,0,0]Assertion`srcIndex<srcSelectDimsize` failed.

  2. 03-19 23:11 之前的训练过程中dataset没加padding
            # 分别计算输入、输出合适的截断# `output_ids` 在整个序列(包括 `input_format_ids` 和 `output_ids`)中所占的比例,然后这个比例乘以最大序列长度,得到的结果就是输出序列的最大长度max_output_len = int(self.max_seq_length * (len(output_ids) / (len(input_format_ids) + len(output_ids))))max_output_len = max(max_output_len, 1)     # 至少保留1个token的outputmax_input_len = self.max_seq_length - max_output_len# 对输入、输出进行截断if len(input_format_ids) > max_input_len:input_format_ids = input_format_ids[:max_input_len]if len(output_ids) > max_output_len:output_ids = output_ids[:max_output_len]
    即如阿荀所说:“我的这个dataset是没实现padding的,所以要用datacollator来做”,故需要在train.py中更正使用DataCollatorForSeq2Seq
        # 加载训练集和验证集if args.sft:# train_dataset = VicunaSFTDataset(args.train_file, tokenizer, args.max_seq_length)train_dataset = Llama2SFTDataset(args.train_file, tokenizer, args.max_seq_length)# data_collator = SFTCollator(tokenizer, args.max_seq_length, -100)data_collator = DataCollatorForSeq2Seq(tokenizer=tokenizer,pad_to_multiple_of=8 if tokenizer.padding_side == "right" else None, # for shift short attentionlabel_pad_token_id=-100)else:train_dataset = PretrainDataset(args.train_file, tokenizer, args.max_seq_length)data_collator = PretrainCollator(tokenizer, args.max_seq_length, -100)
    然并卵,修改后训练仍有index报错
    data_collator = DataCollatorForSeq2Seq(tokenizer=tokenizer,pad_to_multiple_of=8 if tokenizer.padding_side == "right" else None, # for shift short attentionlabel_pad_token_id=-100)
  3. 03-20 1:51 考虑到阿荀建议“看下目前用llama_attn_replace_sft能不能训,不能的话可能可以考虑切换下llama_attn_replace”
    故apple在train.py中更正回train.py引用文件llama_attn_replace使用,可修改后训练仍有index报错
  4. 03-20 4:00 尝试搜索到的解决方案,将结尾pading改为eos,修改后训练仍有index报错
    data_collator = DataCollatorForSeq2Seq(tokenizer=tokenizer,pad_to_multiple_of=8 if tokenizer.padding_side == "right" else None, # for shift short attentionlabel_pad_token_id=tokenizer.eos_token_id)
  5. 03-20 10:11 尝试搜索到的解决方案https://github.com/lm-sys/FastChat/issues/2038,将训练数据中的特殊token清洗,修改后训练仍有index报错

  6. 03-20 11:25 取训练数据2400-2880行,对应batchsize id:150-180,直接训练这个区间 1 epoch,epoch结束后有一个warning,除此之外是没有报错的

  7. 03-20 12:03 训练过程中,在阿荀建议下,尝试关掉flash_attn,训练未开始就会有多个单卡报错OOM
    至于原因,可能是如阿荀所说:“单张不够这长度,因为longqlora的lora是用32位精度的,而70b的产生的kv cache会比7b的大很多”

  8. 03-20 15:23 使用python -m bitsandbytes查看bnb没有编译问题,在阿荀建议下,apple将flash_attn降到2.3.3版本,修改后训练仍有index报错

2.1.2 第二阶段:用上DeepSpeed Zero3

  1. 一开始以为longlora论文中使用deepspeed stage3(当然其只用lora没有用qlora),实现了llama70b训练(但后来才发现,longlora论文中微调70B时,flash_attn其实是加了的
    我们也可以使用stage3优化,这个可以实现关闭flash_attn的情况下,在多卡训练70b,故
    03-22 13:51 设置flash_attn=false,修改配置文件,使用DeepSpeed Zero-3,报错ValueError: DeepSpeed Zero-3 is not compatible with `low_cpu_mem_usage=True` or with passing a `device_map`.需要注释掉train.py中的device_map

  2. 03-22 14:10 报错expected there to be only one unique element in {items}查找到解决方案
    https://github.com/bigcode-project/starcoder/issues/96 https://huggingface.co/docs/peft/v0.10.0/en/accelerate/deepspeed
  3. 03-22 16:30 更换为8*RTX A6000

    quantization_config添加参数:bnb_4bit_quant_storage_dtype=torch.bfloat16
    从运行bash命令到开始训练需要17分钟,进入训练后再次报错expected there to be only one unique element in <generator object Init._convert_to_deepspeed_param.<locals>.all_gather_coalesced.<locals>.<genexpr> at 0x7f6ee96924a0>
  4. 03-22 17:08 查到已经有人提交了修复这个问题的pr Enable ZeRO3 allgather for multiple dtypes (#4647) · microsoft/DeepSpeed@b8e1664 · GitHub,pip uninstall deepspeed 然后pip install deepspeed 下载最新版本。训练未开始便报错cuda out of memory,看来还是要用8*A100
  5. 03-22 19:48再次使用8*A100成功开始训练,最后在第四步报错,如果不开flash_attn即使开了deepspeed stage3也会报显存不够的错误。torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 7.33 GiB (GPU 6; 79.15 GiB total capacity; 44.34 GiB already allocated; 6.52 GiB free; 70.42 GiB reserved in total by PyTorch) If reserved memory is >> allocated memory try setting max_split_size_mb to avoid fragmentation. See documentation for Memory Management and PYTORCH_CUDA_ALLOC_CONF

  6. 考虑到虽然调通了deepspeed stage3 发现即使A100*8,如果不加flash_attn,训练到第4个batch就会out of memory,即准备再打开flash_attn ,将所有buff一起叠加,看看是不是可以(相当于把longqlora、Zero3、flash attention都用上),故
    03-22 20:10 使用8*A100,打开flash_attn,打开deepspeed stage3,开始训练

    这次训练时显存占用呈周期涨落而不是一直上升

    不过仍然结果还是会在batch id 16报错

2.1.3 第三阶段:二分定位筛选有问题的那条数据

我建议apple,既然是跑的5000多条数据,那可以

  1. 考虑把引发异常的那条数据 先直接剔除掉,毕竟如果实在怀疑某些数据有问题的话,先删掉,哪怕最后有个3-4K数据 能跑下来,也算是先有个结果
  2. 之后 再慢慢找问题(总之,算是短期内 没办法的办法了,后续时间充足时,再好好找下 全面的原因)

故apple便开始用二分定位法去排查那条引起异常的数据

  1. 03-23 13:34 将5189数据从上到下的顺序分成3份,1-1730,1730-3460,3461-5189,分别测试查找问题数据所在的区间。第一份在运行至batch_id 33报错。
  2. 03-23 19:33 第二份1730条训练没有报错
  3. 03-23 21:25 之前下午第二份数据在训练中总的迭代次数是432,发现第三份数据在训练中总迭代次数是216,所以其它所有变量相同条件下,由于迭代数减小1/2训练总时间也缩减了1/2,不清楚这里是否正常,训练参数配置文件是相同的,不过1730条数据集第二份的大小是120MB,第三份的大小是50MB,是否是训练数据大小的原因导致训练时产生了自动调整。第三份1728条训练没有报错。
  4. 03-23 22:36 按顺序取出第一份数据的后半部分,866-1730行,训练中batch_id 18
    报错。
  5. 03-23 22:55 按顺序取出第一份数据的前半部分,1-865行,训练没有报错。
  6. 03-24 00:28 按顺序取出第一份数据的,866-1298行,训练没有报错。
  7. 03-24 01:37 按顺序取出第一份数据的,1299-1500行,训练中batch_id 8报错。
  8. 03-24 02:32 按顺序取出第一份数据的,1501-1730行,训练没有报错。
  9. 03-24 03:13 按顺序取出第一份数据的,1299-1400行,训练没有报错。
  10. 03-24 03:46 按顺序取出第一份数据的,1401-1500行,训练中batch_id 1报错
  11. 03-24 05:08 从paper_review_5189.jsonl去除1401-1500行,最终使用5089条数据开始训练

    相当于相当于最终筛到100条的区间,删掉后使用5089条数据微调成功(实在是不易啊,如apple所说:“筛选数据我是二分法,从昨天下午1点一直做到今早凌晨5点。”)
    总之,12小时后训练成功,checkpoint文件夹和merge_lora文件夹结构如下

2.2 对5K训练数据结果的推理

  1. 03-24 18:39 开始推理285条测试数据
  2. 03-25 02:23 285条训练数据推理结束
  3. 在论文审稿效果上超过GPT4-1106,且70B只用了5K数据便和7B用的15K数据打平了

考虑到可能是数据只有5K,效果不一定好上,故如本文开头所说,我们接下来准备一方面提高数据质量,一方面准备用更大的比如15K数据微调

第三部分 15k运行过程记录

3.1 训练全过程

3.1.1 apple继续折腾

  1. 03-27 9:56 继续筛选paper_review_5189.jsonl中的1401-1500行,从中找到具体的报错数据,分析其特征,对15k数据进行清洗
    取出文件中的第1401-1420行另存为output1.jsonl没有问题
    取出文件中的第1421-1440行另存为output2.jsonl没有问题
    取出文件中的第1441-1460行另存为output3.jsonl有报错
    取出文件中的第1461-1480行另存为output4.jsonl没有报错
    取出文件中的第1481-1500行另存为output5.jsonl没有报错
  2. 03-27 17:08 继续筛选paper_review_5189.jsonl中的1441-1460行
    取出文件中的第1441-1445行另存为2output1.jsonl没有问题
    取出文件中的第1446-1450行另存为2output2.jsonl没有问题
    取出文件中的第1451-1455行另存为2output3.jsonl报错
    取出文件中的第1456-1460行另存为2output4.jsonl没有报错
  3. 03-27 17:45 继续筛选paper_review_5189.jsonl中的1451-1455行
    取出文件中的第1451行另存为3output1.jsonl没问题
    取出文件中的第1452行另存为3output2.jsonl没问题
    取出文件中的第1453行另存为3output3.jsonl报错
    取出文件中的第1454行另存为3output4.jsonl
    取出文件中的第1455行另存为3output5.jsonl
    最终的问题数据是第1453行另存为3output3.jsonl报错
  4. 考虑到因为最开始用1.5k的数据微调llama7b时,打开flash_attn会有同样报错,故
    03-30 5:52 经过1d18h使用A6000前置验证没有问题
  5. 03-30 13:06 开始使用8*A100配置环境下载basemodel正式训练,20h后查看到训练中断,可能是服务器平台的未知原因
  6. 03-30 16.01 重新恢复后,继续折腾

3.1.2 三太子接力apple:全力折腾

 一开始三太子先试下5k数据,截断的逻辑也用的七月官网首页的「大模型线上营」中讲的

// 待更

3.2 15K数据的结果评估

// 待更

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/bicheng/491.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

在Java Swing的JPanel中实现动态水印添加技术

在Java Swing的JPanel中实现动态水印添加技术 引言场景一&#xff1a;静态图片水印实现步骤应用示例 场景二&#xff1a;动态生成的组件水印应用示例结论 后续拓展 引言 在Java Swing应用程序开发中&#xff0c;JPanel作为基本的容器组件&#xff0c;常被用来构建丰富的图形用户…

机器视觉【1】-机械臂视觉

文章目录 Eye-to-HandEye-in-Hand基于Eye-in-Hand型机械臂单目视觉定位单目相机标定针孔相机模型畸变标定方法机械臂手眼标定手眼标定求解图像预处理图像灰度化与二值化图像滤波图像特征匹配机械臂单目视觉定位目标物体图像深度信息目标物体中心定位参考文献根据机械臂与相机所…

深圳南玻集团(二面)

不得不说这家公司的办事效率是真的高。我昨天下午3点面试的&#xff0c;4点结束。然后4点45分就跟我说面试通过了&#xff0c;叫我明天早上10点进行二面。二面聊了大概20分钟左右吧&#xff0c;那个面试官是信息部的&#xff0c;好像是个总监还是总经理&#xff0c;反正叫沈总。…

详解人证合一API接口背后的身份信息认证

人证合一API接口是一种高级的身份验证解决方案&#xff0c;它将姓名、身份证号码、头像照片等多种生物特征和身份标识信息相结合&#xff0c;通过云端智能分析并与公安部门权威数据库进行实时比对&#xff0c;以确定用户身份的真实性。这个过程不仅仅停留在表面文字信息的匹配&…

基于PyAutoGUI图片定位的自动化截图工具--完成了

1、计划 压测完成后需要编写性能测试报告&#xff0c;报告中所需数据截图较多&#xff0c;使用自动化操作方便快捷&#xff0c;就编写一个界面工具以便后续复用。 基于PyAutoGUI图片定位的自动化截图工具–jmeter部分 基于PyAutoGUI图片定位的自动化截图工具–jmeter部分&#…

jenkins从节点配置说明

目的 打包构建时使用从节点&#xff0c;从节点所在服务器配置4C8G5000G&#xff08;服务器2&#xff09; 前提 首先在服务器1上部署jenkins服务&#xff0c;即主节点&#xff0c;默认节点名称为master 步骤 1&#xff09;登录进入jenkins平台&#xff0c;在系统设置中&…

AJAX 入门到实战 第1天 2024 笔记

1.1-AJAX入门与axios使用 1.2-认识URL 1.3-查询参数 1.4-案例_地区查询 <script src"https://cdn.jsdelivr.net/npm/axios/dist/axios.min.js"></script><script>/*获取地区列表: http://hmajax.itheima.net/api/area查询参数:pname: 省份或直辖市…

基于adb操作安卓手机封装的python库

import re import shlex import subprocessclass ADBClient:def __init__(self, ip, port):"""初始化ADBClient实例。:param ip: 远程设备的IP地址。:param port: 远程设备的端口号。"""self.ip ipself.port portdef is_app_running(self, pac…

李沐53_语言模型——自学笔记

语言模型 1.预测文本序列出现的概率 2.应用在做预训练模型 3.生成文本&#xff0c;给定前面几个词&#xff0c;不断生成后续文本 4.判断多个序列中哪个更常见 真实数据集的统计 《时光机器》数据集构建词表&#xff0c; 并打印前10个最常用的&#xff08;频率最高的&…

1942年苏军反攻哈尔科夫失败

1942年5月&#xff0c;苏军计划夺回哈尔科夫&#xff0c;消灭城内的德国南方集团军群第6集团军。苏军为这次战役投入了西南方面军和南方面军&#xff0c;苏军元帅铁木辛哥制定了作战计划&#xff0c;非常凑巧的是&#xff0c;德军也于大致相同的时间制定了进攻计划。5月12日&am…

C语言 | 动态内存管理

目录&#xff1a; 1. 为什么要有动态内存分配 2. malloc和free 3. calloc和realloc 4. 常见的动态内存的错误 5. 动态内存经典笔试题分析 6. 柔性数组 1. 为什么要有动态内存分配 我们已经掌握的内存开辟方式有&#xff1a; int val 20; //在栈空间上开辟四个字节 cha…

一篇文章搞定Jenkins自动化部署JDK17+SpringBoot3.X+新版AlibabaCloud打包Docker镜像推送私有镜像仓库

&#x1f680; 作者 &#xff1a;“二当家-小D” &#x1f680; 博主简介&#xff1a;⭐前荔枝FM架构师、阿里资深工程师||曾任职于阿里巴巴担任多个项目负责人&#xff0c;8年开发架构经验&#xff0c;精通java,擅长分布式高并发架构,自动化压力测试&#xff0c;微服务容器化k…

-内核编译-01

挂载根文件系统 1搭建【nfs】 1.1PC端配置 nfs&#xff1a;网络服务器 【sudo /etc/init.d/nfs-kernel-server restart】 【sudo /etc/init.d/nfs-kernel-server status】 【sudo netstat -anp|less】 1重启【nfs】网络服务方法2&#xff1a;查看日志 修改配置文件 进入…

无线通信基本原理笔记

通信&#xff1a;人与人或人与自然之间通过某种行为或媒介进行的信息交流与传递。 通信模型&#xff1a;信源→发送设备→信道&#xff08;↑噪声&#xff09;→接收设备→信宿 调制&#xff1a;把基带信号变换成适合在信道中传输的信号的技术。通过改变高频载波的幅度、相位…

计算机网络基础1--基础概念

1. IP地址 1.1 IPv4地址 分为网络号和主机号 地址块的第一个地址和最后一个地址通常不使用。 广播地址为主机号全取1的情况。 2. 常用报文格式 2.0 ethernet协议 2.1 arp协议 2.2 ip协议 2.3 tcp协议 2.4 udp协议 2.5 icmp协议

LeetCode-2007. 从双倍数组中还原原数组【贪心 数组 哈希表 排序】

LeetCode-2007. 从双倍数组中还原原数组【贪心 数组 哈希表 排序】 题目描述&#xff1a;解题思路一&#xff1a;排序 哈希表解题思路二&#xff1a;排序 队列解题思路三&#xff1a;消消乐 题目描述&#xff1a; 一个整数数组 original 可以转变成一个 双倍 数组 changed &…

2024年150道高频Java面试题(三十二)

63. 线程的 run() 和 start() 有什么区别&#xff1f; 在Java中&#xff0c;run()方法和start()方法是线程操作中的两个核心方法&#xff0c;它们来自于Thread类。 run()方法&#xff1a; run()方法是一个线程的实际执行代码所在的方法。它是一个由Runnable接口定义的抽象方…

java文件夹文件比较工具

import java.io.BufferedReader; import java.io.File; import java.io.FileReader; import java.io.IOException; import java.util.HashSet; import java.util.Set;public class FolderFileNames {public static void main(String[] args) {// 假设您要读取的文件夹路径是 &q…

35. 搜索插入位置 C++

今天开始刷力扣hot100&#xff0c;还是那句话&#xff0c;把时间投资在自己身上绝对是最最值最最赚的&#xff0c;我相信我自己&#xff0c;我也相信坚持付出的力量&#xff0c;力扣这边刷题我准备主打C&#xff0c;加油&#xff0c;先从二分查找开始&#xff01; 给定一个排序…

ubuntu 配置 spacemouse以及通过python/robosuite使用spacemouse

一 前言 3dconnexion 早在2014年就不更新对linux系统的驱动&#xff0c;因此安装驱动需要参考另一个网站&#xff1a;https://spacenav.sourceforge.net/ 二 安装步骤 1 安装 spacenavd 先安装依赖库 sudo apt install libxext-dev libxrender-dev libxmu-dev libxmuu-dev…