【2021集创赛】海云捷迅杯一等奖:基于稀疏卷积与层融合的流水线优化方案

海云捷迅杯:基于FPGA C5Soc的MobileNetV1 SSD目标检测方案设计

本作品参与极术社区组织的有奖征集|秀出你的集创赛作品风采,免费电子产品等你拿~活动。

**杯赛题目:**海云捷迅杯——基于FPGA C5Soc的MobileNetV1 SSD目标检测方案设计
设计任务:

  1. 基于已训练好的SSD模型参数文件、基于已有的Intel FPGA工程网表文件、Linux-C5soc平台的Paddle-Paddle框架驱动为参考,优化或者重新设计加速器以及对应驱动,并部署SSD模型到FPGA进行推理。
  2. 对方案进行评估和实现。
  3. 提出设计方案,提升性能并实现。

团队介绍

**参赛单位:**南京大学
**队伍名称:**爱卡丝俱乐部
**指导老师:**王中风
**参赛队员:**薛睿鑫、程昕、苏天祺
**总决赛奖项:**一等奖和企业大奖

项目介绍

本项目采用Intel Cyclone V系列的SoC芯片进行开发,部署以MobileNet V1为backbone的SSD目标检测模型,对硬软件进行协同优化,以提高目标检测效率。整个系统包括PS (processing system) 端和PL (programmable logic) 端两部分,PS端包括ARM处理器、Memory,负责数据传输及计算流程的预处理和控制;PL端则包括卷积和偏置激活计算单元、SRAM等,负责对高负载的运算进行加速。PL端的数据通过Avalon总线与DRAM进行交互。

我们在量化排序传输计算流水线这五个方面对系统进行了优化,具体的优化手段如下图所示。通过上述优化,目标检测的速度提升超过3.5倍

在这里插入图片描述

我们的技术创新点体现在以下几个方面:

  1. 重新设计了稀疏卷积的数据流,采用Row-wise、Weight stationary的滑窗卷积方式,将计算并行度提高到96,并支持channel-wise的input数据稀疏,提高了FPGA上数据的复用性,大大减少数据的传输量,从而减少数据的传输时间、降低功耗。
  2. 采用层融合方式处理每层的偏置和激活操作,在FPGA上的卷积计算完成后,将结果直接传到偏置激活计算单元进行计算,再将偏置激活的计算结果经过SRAM传到片外。这样一方面能够加速偏置激活的计算,另一方面,经过偏置激活的计算后,数据能够支持量化为更低比特而不损失精度,从而进一步减少数据的传输。
  3. 增加input、weight、bias和output四个 Ping Pong Buffer,使数据传输与计算时间能够重叠,这样进一步优化了数据计算的流水线,在同一时间内进行数据传输和计算,从而实现对系统的加速。
  4. 在进行模型预测之前将量化并重排的权重和偏置保存,避免每次预测时对权重和偏置数据的重复量化和重排。

系统架构

为实现快速的目标检测效果,我们设计的系统整体架构图如下图所示。数据经UpSizer和BusMatrix单元进行仲裁,存储到相应的SRAM中。当计算开始时,卷积模块可以直接从SRAM中读取数据,卷积的结果直接传入BiasRelu单元进行计算,再写入Output Ping Pong Buffer,最终的output再经过BusMatrix和UpSizer单元传回DRAM。

在这里插入图片描述

优化效果

经过充分的仿真验证和上板调试,系统能够正确完成目标检测任务,最终的目标识别速度能够达到最快每张图836ms

在这里插入图片描述

我们统计了优化前后卷积层的加速比,结果如下图所示,相比原始优化前的系统,我们的加速系统能够实现最高39倍加速比平均4.5倍加速比

在这里插入图片描述

参赛体会

这次比赛,给了我们一个很好的机会,提升硬软件协同开发的能力。从硬件数据流的设计到代码的调试,我们一步一个脚印,提出了很多优化的方案,并评估它们的可行性,最终实现了上面所述的加速系统。团队的成员也能够优势互补,在讨论中碰撞出了很多火花。非常感谢实验室的学长学姐和赛事指导老师曾给予我们的帮助,在我们遇到难题时帮助我们指明解决问题的方向。

在这里插入图片描述

未来展望

  1. 针对深度卷积进行层融合优化。将深度卷积与前一层的卷积融合,减少中间数据的传输。
  2. 利用DMA进行片上与片下数据的传输,提高传输效率。
  3. 探索更加有效的量化方式,能够进一步减少数据的传输量的同时保持精度。

总结

我们在官方提供的系统基础上进行优化,成功在Intel Cyclon V SoC芯片上部署了以MobileNet v1为backbone网络的SSD目标检测模型,联合优化ARM端和FPGA端,实现了硬件加速效果。
我们有针对性地设计了稀疏卷积和偏置激活计算的数据流,提高FPGA上数据的复用性,减少数据传输;偏置激活的计算与卷积采用层融合的流水线进行优化,能够在加速偏置激活计算的同时,实现更低比特的数据量化,进一步减少数据的传输;Ping Pong Buffer优化的数据传输与计算流水线,使得数据的计算和传输能够在同一时间进行,减少了计算的空闲状态;此外,我们还优化了模型的量化操作,在进行模型预测之前将量化后的权重和偏置保存,避免每次量化时对权重和偏置数据的重复量化。以上工作共同作用,大大优化了系统的整体性能,提升计算速度。
最后的实验结果表明,我们的设计分别在模型中的普通卷积层和逐点卷积层上实现了最高39×和平均4.5×的加速比。在上板测试中,我们在保证结果正确的情况下,将单张图片的识别速度从3000ms提升到了836ms,取得了超过3.5倍的速度提升。

作品内容来源于爱卡丝俱乐部,转载请标明出处。欢迎大家参加极术社区组织的有奖征集|秀出你的集创赛作品风采,免费电子产品等你拿~活动,10月1日截止~

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/123740.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【MedusaSTears】正则表达式搜索心得

文章目录 心得体会1.懒惰匹配最少字符 .?2.前瞻: 字符串后边 包括/不包括 某个单词/字母2-1.包含某单词: start(?.?hello)2-2.不包含某单词: start(?!.?hello) 心得体会 前情回顾: 【MedusaSTears】正则?不要太简单!—正则表达式个人学习心得总结: 正则说白了是对字符串…

关于pycharm中句号变成点的问题

现象 在pycharm的使用中,经常遇到一个问题:注释写着写着,突然句号“。”变成了“.” 原因 今天突然发现,造成该现象的原因是:某个瞬间按下了ctrl .,那么之后按下句号只能显示为点。 pycharm中&#xf…

STM32G030F6P6 芯片实验 (一)

STM32G030F6P6 芯片实验 (一) 淘宝搞了几片, 没试过 G系列, 试试感觉. 先搞片小系统版: 套 STM32F103C8T6小系统板格式. 原理图: (1) Ref 有点跳, 从 STM32F103C8T6 系统板改的, 没重编号. (2) Type-C 纯给电, 砍了 16pin的, 直接换 6pin的。 (3) 测试LED放 B2。 (4) 测试底…

Android 10.0 framework关于systemUI状态栏透明背景的功能实现

1.概述 在10.0的系统产品定制化开发中,在对于系统原生SystemUI的状态栏背景在沉浸式状态栏的 情况下默认是会随着背景颜色的变化而改变的,在一些特定背景下状态栏的背景也是会改变的,所以由于产品开发需要 要求需要设置状态栏背景为透明的,所以就需要在Activity创建的时候…

MongoDB安装大全

MongoDB官网:https://www.mongodb.com/zh windows下安装mongodb 下载msi安装程序 一步一步安装即可 MacOS下安装mongodb 安装流程:https://docs.mongodb.com/manual/tutorial/install-mongodb-on-os-x/ 首先安装homebrew 注意事项: 在安…

仿真翻页企业内刊制作方法

现如今很多企业都会把自身的企业文化做成电子内刊形式,不再停留于传统纸质的形式,而这种电子版的书更容易被翻阅和传播。特别是员工可以随时随地来阅读企业的文化价值和发展趋向,进而创造出更多的经济效益。不得不说,一本企业文化…

封装线程池ThreadPoolExecutor

封装代码 class MyThread(object):def __init__(self):# 线程池 根据自己需要传入最大线程数量,我只需要一个所以传1self.executor ThreadPoolExecutor(2)# 用于存储期程self.future_dict {}# 检查worker线程是否正在运行def is_running(self, tag):future self.future_dic…

Mysql数据库 4.SQL语言 DQL数据查询语言 查询

DQL数据查询语言 从数据表中提取满足特定条件的记录 1.单表查询 2.多表查询 查询基础语法 select 关键字后指定要查询到的记录的哪些列 语法:select 列名(字段名)/某几列/全部列 from 表名 [具体条件]; select colnumName…

uniapp项目APP端安卓ios权限检测教程

导语:在 APP 的日常开发过程中,权限检测与授权是不可避免的一项重要的功能,下面就简单介绍一下如何检测和授权的方法。 目录 原理方法实战原理 此授权方法主要是依托于 HTML5 产业联盟的HTML5+规范实现的。 HTML5 产业联盟官网 获取当前操作系统名称 可以使用uni.getSys…

大数据前置学习基础准备(非常详细!)

1.需要的环境 需要3台服务器,centos7 为集群,全部设置为nat模式 2.整个环境大体 1.设置三台Linux虚拟机的主机和固定ip 2.在Linux系统以及本机系统中配置了主机名映射 3.配置了三台服务器之间root用户的ssh免密互通 4.安装配置JDK环境 5.关闭防火墙和SEL…

Python基础入门例程24-NP24 淘汰排名最后的学生(列表)

最近的博文: Python基础入门例程23-NP23 删除好友(列表)-CSDN博客 Python基础入门例程22-NP22 删除简历(列表)-CSDN博客 Python基础入门例程21-NP21 增加派对名单(二)(列表&#xff…

【Linux】进程概念(下)

进程概念 一、环境变量1. 命令行参数2. 常见的环境变量(1)PATH(2)PWD(3)HOME(4)env 查看所有的环境变量 3. 获取环境变量(1)通过代码获取环境变量&#xff08…

博客摘录「 TCP/IP网络编程——习题答案」2023年10月29日

clnt_sdaccept(serv_sd, (struct sockaddr*)&clnt_adr, &clnt_adr_sz);read(clnt_sd, file_name, BUF_SIZE); fpfopen(file_name, "rb"); //尝试打开客户端请求的文件if(fp!NULL) //如果文件存在,则传送给客户端{while(…

应用开发平台集成工作流系列之17——流程建模功能前端设计与改造回顾

背景 对于流程设置不友好的问题,国内钉钉另行设计与实现了一套流程建模模式,跟bpmn规范无关,有人仿照实现了下,并做了开源(https://github.com/StavinLi/Workflow-Vue3),效果图如下&#xff1a…

HiQPdf Library for .NET - HTML to PDF Crack

HiQPdf Library for .NET - HTML 到 PDF 转换器 .NET Core,用于 .NET 的 HiQPdf HTML 到 PDF 转换器 :HiQPdf HTML to PDF Library for .NET C# 和 HTML to PDF .NET Core 为您提供了一个现代、快速、灵活且强大的工具,只需几行代码即可创建复…

CRM客户管理系统源码 带移动端APP+H5+小程序

CRM客户管理系统源码 带移动端APPH5小程序 开发环境: thinkphp mysql 功能介绍: 1、 办公管理:审批管理、工作报告、日程管理、办公审批、公告管理 2、 客户管理:我的客户、客户列表、成交客户、行业类别、预查、地区列表、客户状态、客…

ES性能优化最佳实践- 检索性能提升30倍!

Elasticsearch是被广泛使用的搜索引擎技术,它的应用领域远不止搜索引擎,还包括日志分析、实时数据监控、内容推荐、电子商务平台、企业级搜索解决方案以及许多其他领域。其强大的全文搜索、实时索引、分布式性能和丰富的插件生态系统使其成为了许多不同行…

echarts修改图例legend样式:正方形、矩形、圆形、圆角

ECharts 提供的标记类型有 ‘circle’, ‘rect’, ‘roundRect’, ‘triangle’, ‘diamond’, ‘pin’, ‘arrow’, ‘none’ legend: {icon: circle }参考文章 echarts 图例修改legend中icon的形状及大小

SpringBoot中HttpClient的使用

文章目录 1. HttpClient 介绍2. 导入坐标3. 使用 HttpClient 发送 Get 请求4. 使用 HttpClient 发送 Post 请求 1. HttpClient 介绍 HttpClient 是 Apache Jakarta Common下的子项目,用来提供高效的、最新的、功能丰富的支持 HTTP 协议的客户端编程工具包&#xff…

JavaScript组合模式

JavaScript组合模式 1 什么是组合模式2 宏命令3 示例:扫描文件夹4 引用父对象 1 什么是组合模式 组合模式是一种结构型设计模式,用于将对象组合成树形结构,并使客户端能够统一处理单个对象和组合对象。它通过使用继承和组合两个概念&#xf…