Awesome-LLMs-for-Video-Understanding - 基于大型语言模型的视频理解研究

Awesome-LLMs-for-Video-Understanding 是 基于大型语言模型的视频理解研究

  • github : https://github.com/yunlong10/Awesome-LLMs-for-Video-Understanding
  • paper:Video Understanding with Large Language Models: A Survey
    https://arxiv.org/pdf/2312.17432

视频理解的发展

image


为什么我们需要 vid-llms ?

image


😎 Vid-LLMs:模型

image


🤖基于llm的视频代理

TitleModelDateCodeVenue
Socratic Models: Composing Zero-Shot Multimodal Reasoning with LanguageSocratic Models04/2022project pagearXiv
Video ChatCaptioner: Towards Enriched Spatiotemporal Descriptions githubVideo ChatCaptioner04/2023codearXiv
VLog: Video as a Long Document githubVLog04/2023code-
ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding SystemChatVideo04/2023project pagearXiv
MM-VID: Advancing Video Understanding with GPT-4V(ision)MM-VID10/2023-arXiv
MISAR: A Multimodal Instructional System with Augmented Reality githubMISAR10/2023project pageICCV
Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long VideosGrounding-Prompter12/2023-arXiv
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language NavigationNaVid02/2024project page -RSS
VideoAgent: A Memory-augmented Multimodal Agent for Video UnderstandingVideoAgent03/2024project pagearXiv

👾 Vid-LLM 预训练

标题模型日期代码聚会地点
从大型语言模型中学习视频表示 githubLaViLa12/2022代码CVPR的
Vid2Seq:密集视频字幕 视觉语言模型 的大规模预训练Vid2Seq02/2023代码CVPR的
一个 视觉-音频-字幕-文本全模态基础模型和数据集 githubVAST05/2023代码神经IPS
Merlin : 赋予多式联运 LLM 以远见Merlin12/2023-arXiv的

👀Vid-LLM指令调优


使用连接适配器进行微调
标题模型日期代码聚会地点
Video- llama : 一个用于视频理解的教学微调视觉语言模型 githubVideo-LLaMA06/2023代码arXiv的
VALLEY : 视频助手与大语言模型增强能力 githubVALLEY06/2023代码-
视频聊天技术:通过大视觉和语言模型实现详细的视频理解 githubVideo-ChatGPT06/2023代码arXiv的
多模态语言建模与图像、音频、视频和文本集成 githubMacaw-LLM06/2023代码arXiv的
LLMVA-GEBC:用于通用事件边界字幕的带有视频适配器的大型语言模型 githubLLMVA-GEBC06/2023代码CVPR的
Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集 githubmPLUG-video06/2023代码arXiv的
MovieChat:从密集令牌到稀疏记忆的长视频理解 githubmPLUG-video07/2023代码arXiv的
大型语言模型 是视频问答的时间 和因果推理器 githubLLaMA-VQA10/2023代码EMNLP
Video-LLaVA:通过投影前的对齐学习统一的视觉表现 githubVideo-LLaVA11/2023代码arXiv的
Chat-UniVi:统一的视觉表示使大型语言模型具有图像和视频理解能力 githubChat-UniVi11/2023代码arXiv的
LLaMA-VID:在大型语言模型中,一个图像值2个符号 githubLLaMA-VID11/2023代码arXiv的
VISTA-LLAMA:可靠的视频叙述者通过相等距离的视觉标记VISTA-LLAMA12/2023-arXiv的
**视频理解视听 LLM **-12/2023-arXiv的
AutoAD:上下文中的电影描述AutoAD06/2023代码CVPR的
AutoAD II:续集-谁,什么时候,什么在电影音频描述AutoAD II10/2023-ICCV
多模态大型语言模型的细粒度视听联合表示 githubFAVOR10/2023代码arXiv的
**VideoLLaMA2:推进时空建模和音频理解视频 LLM ** githubVideoLLaMA206/2024代码arXiv的

使用插入适配器进行微调
标题模型日期代码聚会地点
Otter : 具有上下文指令调优的多模态模型 githubOtter06/2023代码arXiv的
VideoLLM : 用大语言模型建模视频序列 github视频 LLM05/2023代码arXiv的

混合适配器微调
标题模型日期代码聚会地点
VTimeLLM:授权 LLM 掌握视频时刻 githubVTimeLLM11/2023代码arXiv的
GPT4Video:用于指令跟随理解和安全意识生成的统一多模态大语言模型GPT4Video11/2023-arXiv的

🦾混合方法

标题模型日期代码聚会地点
VideoChat:以聊天为中心的视频理解 githubVideoChat05/2023代码演示arXiv的
PG-Video-LLaVA:像素接地大型视频语言模型 githubPG-Video-LLaVA11/2023代码arXiv的
TimeChat:用于长视频理解的时间敏感多模态大型语言模型 githubTimeChat12/2023代码CVPR的
Video-GroundingDINO : 走向开放词汇时空视频接地 githubVideo-GroundingDINO12/2023代码arXiv的
一个视频价值4096个代币:用语言描述视频,以零镜头理解它们Video409605/2023EMNLP

🦾免培训方法

标题模型日期代码聚会地点
SlowFast-LLaVA : 视频大型语言模型的强大无训练基线SlowFast-LLaVA07/2024-arXiv的


任务、数据集和基准


认知与预期
名字日期链接聚会地点
Charades家庭中的好莱坞:众包数据收集以了解活动2016链接ECCV
YouTube8MYouTube-8M:一个大规模视频分类基准2016链接-
ActivityNetActivityNet:人类活动理解的大规模视频基准2015链接CVPR的
Kinetics-GEBCGEB:通用事件边界标注、基础和检索的基准2022链接ECCV
**Kinetics-400动力学人类动作视频数据集2017链接-
VidChapters-7MVidChapters-7M : 视频章节的规模2023链接神经IPS

标题和描述
名字日期链接聚会地点
微软研究视频描述语料库 | Microsoft Research Video Description Corpus (MSVD)为释义评估收集高度平行的数据2011链接ACL
微软研究院视频转文本(MSR-VTT)MSR-VTT:用于桥接视频和语言的大型视频描述数据集2016链接CVPR
Tumblr GIF (GIF)TGIF:动画GIF描述的新数据集和基准2016链接CVPR
Charades家庭中的好莱坞:活动理解的众包数据收集2016链接ECCV
Charades-Ego演员和观察者:第一人称和第三人称视频的联合建模2018链接CVPR
ActivityNet Captions视频中的密集字幕事件2017链接ICCV
HowTo100mHowTo100M:通过观看1亿段视频片段来学习文本视频嵌入2019链接ICCV
Movie Audio Descriptions (MAD)一个可扩展的数据集,用于从电影音频描述的视频的语言基础2021链接CVPR的
YouCook2基于网络教学视频的程序自动学习2017链接AAAI
MovieNetMovieNet:电影理解的整体数据集2020链接ECCV
Youku-mPLUGYouku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集2023链接arXiv
Video Timeline Tags (ViTT)密集视频字幕的多模态预训练2020链接AACL-IJCNLP
TVSumTVSum:使用标题总结网络视频2015链接CVPR的
SumMe从用户视频创建摘要2014链接ECCV
VideoXumVideoXum:视频的跨模态视觉和纹理摘要2023链接IEEE Trans Multimedia
Multi-Source Video Captioning (MSVC)**VideoLLaMA2:推进时空建模和音频理解视频 LLM **2024链接arXiv

接地与回收
名字日期链接聚会地点
Epic-Kitchens-100重新调整自我中心视野2021链接IJCV
VCR (Visual Commonsense Reasoning)从识别到认知:视觉常识推理2019链接CVPR的
Ego4D-MQ 和 Ego4D-NLQEgo4D:环游世界在3000小时的自我中心视频2021链接CVPR的
Vid-STG它在哪里:多形式句子的时空视频基础2020链接CVPR的
Charades-STATALL:通过语言查询进行时间活动定位2017链接ICCV
DiDeMo用自然语言定位视频中的瞬间2017链接ICCV

问题回答
名字日期链接聚会地点
MSVD-QA通过对外观和动作的逐渐细化的注意进行视频问答2017链接ACM Multimedia
MSRVTT-QA通过对外观和动作的逐渐细化的注意进行视频问答2017链接ACM Multimedia
TGIF-QATGIF-QA:面向视觉问答的时空推理2017链接CVPR
ActivityNet-QAActivityNet-QA:一个通过问答来理解复杂网络视频的数据集2019链接AAAI
Pororo-QADeepStory:视频故事QA由深度嵌入式记忆网络2017链接IJCAI
TVQATVQA:本地化,组合视频问答2018链接EMNLP

视频教学调优

预训练 数据集
名字日期链接聚会地点
VidChapters-7分钟视频章节- 7m:视频章节的规模2023链接神经IPS
值为1米VALOR:视觉-听觉-语言全感知预训练模型和数据集2023链接arXiv的
Youku-mPLUGYouku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集2023链接arXiv的
InternVid(英语:InternVid)intervid:用于多模态理解和生成的大规模视频文本数据集2023链接arXiv的
VAST-27M一个视觉-音频-字幕-文本全模态基础模型和数据集2023链接神经IPS

微调数据集
名字日期链接聚会地点
模仿它MIMIC-IT:多模态上下文指令调谐2023链接arXiv的
VideoInstruct100K视频聊天技术:通过大视觉和语言模型实现详细的视频理解2023链接arXiv的
TimeIT公司TimeChat:用于长视频理解的时间敏感多模态大型语言模型2023链接CVPR的

基于视频的大型语言模型基准
标题日期代码聚会地点
LVBench:一个极长的视频理解基准06/2024代码-
Video-Bench:用于评估基于视频的大型语言模型的综合基准和工具包11/2023代码-
感知测试:多模态视频模型的诊断基准05/2023代码NeurIPS 2023, ICCV 2023 研讨会
Youku-mPLUG:用于预训练和基准测试的1000万大规模中文视频语言数据集 github07/2023代码-
FETV:开放域文本到视频生成的细粒度评估基准 github11/2023代码神经IPS 2023
MoVQA:理解长篇电影的通用问答基准12/2023代码-
MVBench:一个全面的多模态视频理解基准12/2023代码-
TempCompass:视频 LLM 真的懂视频吗? github03/2024代码ACL 2024
Video- mme:首个视频分析中多模态 LLM 的综合评估基准 github06/2024代码-
视频幻觉:在大型视频语言模型中评估内在和外在幻觉 github06/2024代码-

2024-08-24(六)

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/diannao/52443.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

C++20中的约束与概念

类模板、函数模板和非模板函数(通常是类模板的成员)可能与约束(constraint)相关联,该约束指定对模板参数的要求(requirements),可用于选择最合适的函数重载和模板特化。约束是使用模板时需要通过模板参数满足的条件或要求。这些要求的命名集合称为概念(c…

Hadoop 分布式集群搭建

HDFS分布式集群搭建 一、部署规划1.1 进程规划1.2 软件规划1.3 用户规划1.4 目录规划 二、 搭建HDFS 分布式集群2.1 HDFS 集群配置2.1.1 下载安装 Hadoop2.1.2 修改 hadoop-env.sh 配置文件2.1.3 修改 core-site.xml 配置文件2.1.4 修改 hdfs-site.xml 配置文件2.1.5 修改 slav…

程序员:全栈的痛你不知道

上周一个同事直接对我开喷,骂我无能,说:“你怎么一个人就搞不定所有系统呢?”,我半支烟纵横IT江湖14余年,还是第一次被人这么嫌弃。 事情缘由 某公司的业务线特别多,有个业务线前后端项目共计…

ComfyUI IPAdapter plus的模型应该怎么装-免费版-2024.8.25

🎆背景 ipadapter相关的节点大家应该都不陌生,具体是做什么的就不详细介绍了,但是还是有很多新入门的朋友不太了解这个节点相关的这一堆模型到底应该怎么安装。这里就借着官方节点的介绍来大概讲下这个话题。 涉及到的节点源地址&#xff1…

【Qt】Qt系统 | Qt事件| 鼠标事件

文章目录 鼠标事件鼠标点击事件鼠标释放事件鼠标双击事件鼠标移动事件 滚轮事件 在 Qt 中,鼠标事件是用 QMouseEvent 实现的。当在窗口中按下鼠标或者移动鼠标时,都会产生鼠标事件 鼠标事件 鼠标点击事件 鼠标按下时通过 虚函数 mousePressEvent() 来…

线程安全是什么问题?如何引起?死锁是啥?如何解决?

目录 一、什么是线程不安全? 二、如何引起的线程安全?怎么解决? 1)CPU调度执行是随机的,抢占式执行(根本原因,硬件层面咱们无法干预) 2)多个线程,对同一变…

【Hot100】LeetCode—105. 从前序与中序遍历序列构造二叉树

目录 1- 思路递归 2- 实现⭐105. 从前序与中序遍历序列构造二叉树——题解思路 3- ACM 实现 原题连接:105. 从前序与中序遍历序列构造二叉树 1- 思路 递归 前序:中左右中序:左中右 让前序的第一个元素作为中序的分割点 分割思路 1- 递归…

做个实验

做个实验 #include <bits/stdc.h> using namespace std; #define int long long #define ll __int128_t #define ar array<int, 2> #define arr array<int, 3> int n, m, k, inf 1LL << 61, mod 998244353;// 1e97; const int N 5e5 50;void sol…

使用gitee存储项目

gitee地址&#xff1a;Gitee - 基于 Git 的代码托管和研发协作平台 创建gitee远程仓库 将远程仓库内容拉取到本地仓库 复制下面这个地址 通过小乌龟便捷推送拉取代码&#xff1a;https://blog.csdn.net/m0_65520060/article/details/140091437

基于51单片机的百叶窗proteus仿真

地址&#xff1a;https://pan.baidu.com/s/19M6jeTIHJcyDBGNx4H9nTA 提取码&#xff1a;1234 仿真图&#xff1a; 芯片/模块的特点&#xff1a; AT89C52/AT89C51简介&#xff1a; AT89C52/AT89C51是一款经典的8位单片机&#xff0c;是意法半导体&#xff08;STMicroelectron…

RabbitMQ的核心概念

RabbitMQ是一个消息中间件&#xff0c;也是一个生产者消费者模型&#xff0c;负责接收&#xff0c;存储和转发消息。 核心概念 Producer 生产者&#xff0c;是RabbitMQ Server的客户端&#xff0c;向RabbitMQ发送消息。 Consumer 消费者&#xff0c;是RabbitMQ Server的客…

快手怎么免费的去掉视频水印?分享这三个工具给你

​ 我们经常会遇到想要保存的视频带有水印&#xff0c;这不仅影响美观&#xff0c;也不利于分享。为了解决这个问题&#xff0c;我将分享三个免费去除视频水印的工具&#xff0c;帮助你轻松去除水印&#xff0c;享受无干扰的视频体验。 工具一&#xff1a;奈斯水印助手(小程序…

数码管进阶设计验证

前言 随着数字电路和嵌入式系统的广泛应用&#xff0c;数码管作为一种常见的显示设备&#xff0c;在各种电子产品中扮演着重要角色。数码管以其结构简单、显示清晰和成本低廉的特点&#xff0c;广泛应用于计数器、时钟、测量仪器等领域。然而&#xff0c;传统的数码管设计通常仅…

DBeaver安装使用

文章目录 简介支持的数据库支持的系统 下载安装DBeaver使用修改Maven下载jar地址窗口->首选项连接->驱动->Maven配置仓库地址 选择需要连接的数据库进行连接 简介 DBeaver 是一个通用的数据库管理工具和 SQL 客户端&#xff0c;支持 MySQL, PostgreSQL, Oracle, DB2,…

运维学习————nginx2-配置详解及负载均衡

目录 一、配置文件详解 1.1、结构 1.2、重要配置解释 1.3、详细配置 全局配置 Events HTTP 服务器配置 server虚拟主机配置 location URL匹配配置 1.4、完整配置 二、负载均衡 2.1、概念 2.2、集群规划及实现 2.3、具体实现 2.3.1、克隆 2.3.2、修改tomcat1配…

Python | Leetcode Python题解之第372题超级次方

题目&#xff1a; 题解&#xff1a; class Solution:def superPow(self, a: int, b: List[int]) -> int:MOD 1337ans 1for e in b:ans pow(ans, 10, MOD) * pow(a, e, MOD) % MODreturn ans

go+gin+vue入门

后端框架 1、安装go、goland 2、创建空项目 3、下载要用的包&#xff1a;命令行输入go get -u github.com/xxxx 4、安装mysql数据库&#xff0c;使用navicat创建数据库。 5、按照项目框架搭建目录、文件、代码&#xff1a;如router、model… 6、运行测试&#xff0c;go run ma…

云原生之全链路分布式跟踪系统 Zipkin和SkyWalking

贪多嚼不烂 Pinpoint 就不对比了 参考 APM系统简单对比(zipkin,pinpoint和skywalking) springcloud 看云 Zipkin和SkyWalking都是流行的分布式跟踪系统&#xff0c;但它们的设计和实现有明显的不同。 以下是它们之间的一些对比&#xff1a; 数据存储&#xff1a; Zipk…

OpenCV(开源计算机视觉库)

OpenCV&#xff08;开源计算机视觉库&#xff09;是一个专注于实时计算机视觉的全面库&#xff0c;包含了丰富的工具和功能。以下是 OpenCV 中一些关键知识点的详细列表&#xff1a; 核心功能 基本结构&#xff1a;Mat、Scalar、Point、Size、Rect 等。 图像 I/O&#xff1a;读…

# 利刃出鞘_Tomcat 核心原理解析(八)-- Tomcat 集群

利刃出鞘_Tomcat 核心原理解析&#xff08;八&#xff09;-- Tomcat 集群 一、Tomcat专题 - Tomcat集群 - 介绍及准备工作 1、Tomcat集群 简介 由于单台Tomcat的承载能力是有限的&#xff0c;当我们的业务系统用户量比较大&#xff0c;请求压力比较大时&#xff0c;单台Tomc…