HPA数据库及HPAanalyze包使用

关于HPA数据库的介绍:Human Protein Atlas 数据库 – 王进的个人网站 (jingege.wang)

The Human Protein Atlas


文献

HPAanalyze: an R package that facilitates the retrieval and analysis of the Human Protein Atlas data | BMC Bioinformatics | Full Text (biomedcentral.com)

HPAanalyze 是一个 R 包,用于检索和执行来自 HPA 的数据的探索性分析。HPAanalyze提供了从HPA导入数据表和xml文件、导出和可视化数据以及下载所有感兴趣的染色图像的功能。

不同的 HPA 数据格式

HPA 项目通过两种主要机制提供数据:以可下载的压缩制表符分隔值 (TSV) 文件形式提供完整数据集,以及可扩展标记语言 (XML)、资源描述框架 (RDF) 和 TSV 格式的单个条目。完整的可下载数据集包括正常组织、病理学(癌症)、亚细胞位置、RNA 基因和 RNA 亚型数据。对于单个条目,XML 格式是最全面的:它提供有关靶蛋白、抗体和每个组织的摘要的信息。此外,还提供了每个样本的详细数据,包括临床信息、免疫组织化学 (IHC) 评分和图像下载链接。

HPAanalyze 概述

HPAanalyze 旨在完成三个主要任务:(1) 导入、子集和导出可下载数据集;(2)用于探索性分析的可下载数据集的可视化;(3)促进单个XML文件的工作(图1)。1). 该软件包旨在为编程经验不足的研究人员提供服务,同时也允许高级用户根据需要使用导入的数据。

(1) 用于可下载数据集的 hpaDownload;(2) hpaVis,用于快速和可定制的可视化;(3) hpaXml,用于从单个 XML 文件中提取信息。显示的图像是生成的示例数据或可从 HPA 下载的图像。

原文还提供了许多示例进行分析


HPAanalyze包下载病理切片数据

由于HPA在线网站上的病理切片数据下载不方便,遂采用R包进行相关数据的下载。其他数据下载在教程中有详细介绍,这里测试病理数据的下载。

Bioconductor - HPAanalyze

HPAanalyze: HPA数据库使用 (gitee.com)

rm(list = ls())
#包安装##
if (!require("BiocManager", quietly = TRUE))install.packages("BiocManager")
BiocManager::install("HPAanalyze")
BiocManager::install("BiocStyle")##还需要辅助安装#加载包 Update all/some/none? [a/s/n]: n
library(BiocStyle)
library(HPAanalyze)
library(dplyr)

例子从NCBI查找需要的基因:CCNB1

Search: ENSG00000134057 - NLM (nih.gov)

解决网络问题方案:什么鬼,你才60秒? - 知乎 (zhihu.com)

查看信息技巧:R语言将list转变为dataframe(常用)_r list 转换成 dataframe-CSDN博客


病理数据下载

## -----------------------------------------------------------------------------
?hpaXmlGet
CCNB1xml <- hpaXmlGet("ENSG00000134057")
##网络问题#
#In download.file(url = version_to_xml_url(targetEnsemblId, version),  :
#URL 'https://www.proteinatlas.org/ENSG00000134057.xml': Timeout of 60 seconds was reached
#多次尝试测试#CCNB1_ab <- hpaXmlAntibody(CCNB1xml)#提取用于特定蛋白质的抗体的信息
CCNB1_ab##查看蛋白结果信息CCNB1_expr <- hpaXmlTissueExpr(CCNB1xml)
#从hpaXmlGet()生成的导入xml文档中提取每个样本的组织表达信息和url以下载图像
str(CCNB1_expr[[1]])
data <- CCNB1_expr[[1]]
##查看该抗的样本具体信息(很重要,也可以直接通过具体信息下载需要的图片)dir.create("img")
for (i in 1:nrow(CCNB1_expr[[1]])) {download.file(CCNB1_expr[[1]]$imageUrl[i],destfile = paste0("img/", CCNB1_ab$id[1], "_",CCNB1_expr[[1]]$patientId[i], "_",CCNB1_expr[[1]]$tissueDescription2[i],## the extra i below ensures unique file namei, ".jpg"),mode = "wb")}

hpaXml 函数系列支持从 HPA 为每种蛋白质提供的单个 XML 文件中导入和提取数据。使用 XML 文件的典型工作流包括以下步骤:

  1. 使用 hpaXmlGet 下载并导入 XML 文件。

  2. 使用其他 hpaXml 函数提取所需的信息。

  3. 下载 hpaXmlTissurExpr 和 hpaXmlTissueExprSum 函数当前支持的组织学染色图像。该函数返回一个列表,其中包含一个摘要字符串,它是对蛋白质的一个非常简短的描述,还有一个由两列组成的表:组织(可用组织的名称)和imageUrl(下载透视图像的链接)

hpaXmlGet 函数采用一个 HGNC 符号或 Ensembl ID(以 ENSG 开头),并将透视 XML 文件导入到 R 中。此函数在后台调用 xml2::read_xml 函数,因此如果需要,可以使用 xml2 包中的函数进一步处理生成的对象。可以使用 hpaXmlProtClass 从导入的 XML 中提取查询蛋白质的蛋白质类。函数 hpaXmlTissueExprSum 提取目标蛋白在正常组织中的表达摘要。该函数的输出是 (1) 包含一句话摘要的字符串,以及 (2) 蛋白质阳性染色的所有组织的数据框以及这些组织的图像。

XML 文件是唯一可编程访问的 HPA 数据格式,其中包含有关项目中使用的每种抗体和每个组织样本的信息。hpaXmlAntibody 提取抗体信息,并返回一个数据框,每个抗体有一行。hpaXmlTissueExpr 提取上述每种抗体的所有样本信息,并返回数据帧列表。如果抗体尚未用于 IHC 染色,则返回的数据框将为空。每个数据框包含临床数据(患者 ID、年龄、性别)、组织信息(snomedCode、tissueDescription)、染色结果(染色、强度、位置)和每个样本的一个 imageUrl

方法一:通过代码批量下载病理数据

方法二:可以直接通过图片信息链接下载保存图片

http://images.proteinatlas.org/115/2043_B_2_8.jpg


qupath进一步半定量分析

下载一张ki67 染色IHC进行半定量分析测试:明天在写

数字病理图像分析的开源软件qupath学习 ①-CSDN博客

Projects — QuPath 0.5.1 documentation


参考文献:

1:HPAanalyze: an R package that facilitates the retrieval and analysis of the Human Protein Atlas data

2:Bioconductor - HPAanalyze

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/747455.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【PPO】近端策略优化【Clip版本,离散动作】

本博客代码参考了《动手学强化学习-PPO》 PPO算法是在Actor-Critic的基础上进行训练目标的调整。其改进的地方在于对每次参数更新进行了限制。 PPO 是 TRPO 的一种改进算法&#xff0c;它在实现上简化了 TRPO 中的复杂计算&#xff0c;并且它在实验中的性能大多数情况下会比 …

服务模块划分规范

一、PO :(persistant object )&#xff0c;持久对象 可以看成是与数据库中的表相映射的java对象。使用Hibernate来生成PO是不错的选择。 二、VO :(value object) &#xff0c;值对象 通常用于业务层之间的数据传递&#xff0c;和PO一样也是仅仅包含数据而已。但应是抽象出的…

功能问题:如何用Docker部署一个后端项目?

大家好&#xff0c;我是大澈&#xff01; 本文约1800字&#xff0c;整篇阅读大约需要3分钟。 关注微信公众号&#xff1a;“程序员大澈”&#xff0c;免费加入问答群&#xff0c;一起交流技术难题与未来&#xff01; 现在关注公众号&#xff0c;免费送你 ”前后端入行大礼包…

SwiftU的组件 - TabView

SwiftU的组件 - TabView 记录一下SwiftU的组件 - TabView的两种style分别的使用方式 import SwiftUIstruct TabViewBootCamp: View {State var selectedIndex 0var body: some View {NavigationView {TabView(selection: $selectedIndex) {HomeView(selectedIndex: $selected…

基于python的《彩图版飞机大战》程序使用说明(附源码下载)

在PyCharm中运行《彩图版飞机大战》即可进入如图1所示的游戏界面。 图1 游戏主界面 具体的操作步骤如下&#xff1a; &#xff08;1&#xff09;玩游戏。在游戏主界面中&#xff0c;从屏幕的顶部不断出现下落的敌机&#xff0c;玩家按下键盘上的↑、↓、←、→方向键移动飞机…

Android 深入Http(2)加密与编码

可以对二进制数据&#xff08;比如图片、视频&#xff09; 经典算法&#xff1a; DES&#xff08;密钥短被弃用了&#xff09; AES &#xff08;密钥很长 很顶&#xff09; 速度快&#xff0c;效率高 IDEA 3DES&#xff08;三重DES&#xff0c;听起来就很慢和重 &#xf…

VGG论文学习笔记

题目&#xff1a;VERY DEEP CONVOLUTIONAL NETWORKS FOR LARGE-SCALE IMAGE RECOGNITION 论文下载地址&#xff1a;VGG论文 摘要 目的&#xff1a;研究深度对精度的影响 方法&#xff1a;使用3*3滤波器不断增加深度&#xff0c;16和19效果显著 成绩&#xff1a;在ImageNet 20…

搭建知识管理系统并不复杂,这篇教程来帮你

许多人都有这样的体验&#xff1a;我们抓住的想法和知识总在不经意间溜走&#xff0c;我们想要的信息总是一时无法找到。因此&#xff0c;搭建一个能够系统化、分类和索引存储这些知识的“知识管理系统”是必要的。听上去很专业&#xff0c;其实并不复杂&#xff0c;让我们一步…

mysql: 如何开启慢查询日志?

1 确认慢查询日志功能已开启 执行以下sql语句&#xff0c;查看慢查询功能是否开启&#xff1a; show VARIABLES like slow_query_log;如果为ON&#xff0c;表示打开&#xff1b;如果为OFF&#xff0c;表示没有打开&#xff0c;需要开启慢查询功能。 执行以下sql语句&#xff0…

修改 MySQL update_time 默认值的坑

由于按规范需要对 update_time 字段需要对它做默认值的设置 现在有一个原始的表是这样的 CREATE TABLE test_up (id bigint(20) unsigned NOT NULL AUTO_INCREMENT COMMENT 主键id,update_time datetime default null COMMENT 操作时间,PRIMARY KEY (id) ) ENGINEInnoDB DEF…

MapStruct代替BeanUtils.copyProperties ()使用

1.为什么MapStruct代替BeanUtils.copyProperties () 第一&#xff1a;因为BeanUtils 采用反射的机制动态去进行拷贝映射&#xff0c;特别是Apache的BeanUtils的性能很差&#xff0c;而且并不支持所有数据类型的拷贝&#xff0c;虽然使用较为方便&#xff0c;但是强烈不建议使用…

鸿蒙Harmony应用开发—ArkTS声明式开发(基础手势:NavRouter)

导航组件&#xff0c;默认提供点击响应处理&#xff0c;不需要开发者自定义点击事件逻辑。 说明&#xff1a; 该组件从API Version 9开始支持。后续版本如有新增内容&#xff0c;则采用上角标单独标记该内容的起始版本。 子组件 必须包含两个子组件&#xff0c;其中第二个子组…

分析型数据库的主要使用场景有哪些?

如今数据已经成为了企业和组织的核心资产。如何有效地管理和利用这些数据&#xff0c;成为了决定竞争力的关键。分析型数据库作为数据处理领域的重要工具&#xff0c;为各行各业提供了强大的数据分析和洞察能力。基于分析型数据库&#xff08;Apache Doris &#xff09;构建的现…

当模型足够大时,Bias项不会有什么特别的作用

问题来源&#xff1a; 阅读OLMo论文时&#xff0c;发现有如下一段话&#xff1a; 加上前面研究llama和mistral结构时好奇为什么都没有偏置项了 偏置项的作用&#xff1a; 回到第一性原理来分析&#xff0c;为什么要有偏置项的存在呢&#xff1f; 在神经网络中&#xff0c;…

跨境热点!TikTok直播网络要求是什么?

TikTok直播作为一种互动性强、实时性要求高的社交媒体形式&#xff0c;对网络环境有着一系列特定的需求。了解并满足这些需求&#xff0c;对于确保用户体验、提高直播质量至关重要。本文将深入探讨TikTok直播对网络环境的要求以及如何优化网络设置以满足这些要求。 TikTok直播的…

mac启动elasticsearch

1.首先下载软件&#xff0c;然后双击解压&#xff0c;我用的是7.17.3的版本 2.然后执行如下命令 Last login: Thu Mar 14 23:14:44 on ttys001 diannao1xiejiandeMacBook-Air ~ % cd /Users/xiejian/local/software/elasticsearch/elasticsearch-7.17.3 diannao1xiejiandeMac…

鸿蒙Harmony应用开发—ArkTS声明式开发(基础手势:Menu)

以垂直列表形式显示的菜单。 说明&#xff1a; 该组件从API Version 9开始支持。后续版本如有新增内容&#xff0c;则采用上角标单独标记该内容的起始版本。 Menu组件需和bindMenu或bindContextMenu方法配合使用&#xff0c;不支持作为普通组件单独使用。 子组件 包含MenuIt…

HTML—CSS盒子模型(Box Model)

基本介绍&#xff1a; CSS处理网页时&#xff0c;HTML的每一个标签可以看作是一个盒子&#xff0c;网页布局将指定的标签放到指定的位置上摆放&#xff0c;相当于摆放盒子。 每一个标签(盒子)所包含的内容&#xff1a;从外到内 ①外边距(margin)—规定盒子与盒子之间的距离&…

LeetCode---388周赛

题目列表 3074. 重新分装苹果 3075. 幸福值最大化的选择方案 3076. 数组中的最短非公共子字符串 3077. K 个不相交子数组的最大能量值 一、重新分装苹果 注意题目中说同一个包裹中的苹果可以分装&#xff0c;那么我们只要关心苹果的总量即可&#xff0c;在根据贪心&#x…

为什么光学器件需要厚度

确定光学厚度的限值 光学元件的功能和性能在很大程度上受到可用光学材料的限制。制造和光学元件设计的最新发展现在拓宽了可以实现的目标。特别是&#xff0c;平面光学器件或超表面可以设计为具有大块光学元件的功能&#xff0c;但其厚度缩小到仅几百纳米。米勒现在提出了一项…