Linux内存管理:(十一)页面分配之慢速路径

文章说明:

  • Linux内核版本:5.0

  • 架构:ARM64

  • 参考资料及图片来源:《奔跑吧Linux内核》

  • Linux 5.0内核源码注释仓库地址:

    zhangzihengya/LinuxSourceCode_v5.0_study (github.com)

1. 水位管理和分配优先级

页面分配器是按照zone的水位来管理的,zone的水位分成3个等级,分别是高水位(WMARK_HIGH)、低水位(WMARK_LOW) 以及最低警戒水位(WMARK_MIN)。最低警戒水位下的内存是系统预留的内存,通常情况下普通优先级的分配请求是不能访问这些内存的,但是在特殊情况下是可以用来救急的。页面分配器可以通过分配掩码的不同来访问最低警戒水位以下的内存,如__GFP_HIGH__GFP_ATOMIC以及__GFP_MEMALLOC等,如下表所示:

在这里插入图片描述

页面分配器的zone水位管理流程如下图所示:

在这里插入图片描述

补充说明:

  • 页面分配器中的快速和慢速路径是以低水位线能否成功分配内存为分界线的
  • 在慢速路径上,首先唤醒kswapd内核线程,异步扫描LRU链表和回收页面
  • 随着kswapd内核线程不断地回收内存,zone中的空闲内存会越来越多,当zone水位重新返回高水位之上时,zone的水位平衡了,kswapd内核线程停止工作重新进入睡眠状态
  • “页面分配之快速路径”见:Linux内存管理:(一)伙伴系统-CSDN博客,下文将详细介绍慢速路径

2. __alloc_pages_slowpath() 函数

__alloc_pages_slowpath()函数是页面分配慢速路径中的核心函数,该函数分配页面的流程如下图所示:

在这里插入图片描述

相应的__alloc_pages_slowpath()函数注解如下所示:

// gfp_mask:表示调用页面分配器时传递的分配掩码
// order:表示需要分配页面的大小,大小为 2 的 order 次幂个连续物理页面
// ac:表示页面分配器内部使用的控制参数数据结构
static inline struct page *
__alloc_pages_slowpath(gfp_t gfp_mask, unsigned int order,struct alloc_context *ac)
{// can_direct_reclaim 表示是否允许调用直接页面回收机制// 那些隐含了 __GFP_DIRECT_RECLAIM 标志位的分配掩码都会使用直接页面回收机制bool can_direct_reclaim = gfp_mask & __GFP_DIRECT_RECLAIM;// costly_order 表示会形成一定的内存分配压力。PAGE_ALLOC_COSTLY_ORDER 定义为3,如当分配请求// order 为 4 时,即要分配 64KB 大小的连续物理内存,会给页面分配器带来一定的内存压力const bool costly_order = order > PAGE_ALLOC_COSTLY_ORDER;...// 检查是否在非中断上下文中滥用 __GFP_ATOMIC,使用 __GFP_ATOMIC 会输出一次警告// __GFP_ATOMIC 表示调用页面分配器的进程不能直接回收页面或者等待,调用者通常在中断上下文中。// 另外,__GFP_ATOMIC 是优先级比较高的分配行为,它允许访问部分的系统预留内存if (WARN_ON_ONCE((gfp_mask & (__GFP_ATOMIC|__GFP_DIRECT_RECLAIM)) ==(__GFP_ATOMIC|__GFP_DIRECT_RECLAIM)))gfp_mask &= ~__GFP_ATOMIC;retry_cpuset:...// gfp_to_alloc_flags() 重新设置分配掩码 gfp_maskalloc_flags = gfp_to_alloc_flags(gfp_mask);// 重新计算首选推荐的 zone,因为我们可能在快速路径中修改了内存节点掩码或者使用 cpuset 机制做了修改。ac->preferred_zoneref = first_zones_zonelist(ac->zonelist,ac->high_zoneidx, ac->nodemask);...if (alloc_flags & ALLOC_KSWAPD)// 唤醒 kswapd 内核线程wake_all_kswapds(order, gfp_mask, ac);// 因为在 gfp_to_alloc_flags() 函数中调整了分配掩码 alloc_flags,所以将最低警戒水位(ALLOC_WMARK_MIN)// 作为判断条件。尝试以最低警戒水位为条件,判断是否能分配内存page = get_page_from_freelist(gfp_mask, order, alloc_flags, ac);if (page)goto got_pg;// 若以最低警戒水位为条件还不能分配成功,在 3 种情况下可以考虑尝试先调用直接内存规整机制来解决// 页面分配失败的问题://  1. 允许调用直接页面回收机制//  2. 高成本的分配需求 costly_order。这时,系统可能有足够的空闲内存,但是没有满足分配需求的连续页面,//     调用内存规整机制可能能解决这个问题。或者对于请求,分配不可迁移的多个连续物理页面(即order大于0)//  3. 不允许访问系统预留内存。gfp_pfmemalloc_allowed() 表示是否允许访问系统预留的内存,若返回 ALLOC_NO_WAIERMARKS,//     表示不用考虑水位;若返回0,表示不允许访问系统保留的内存// 同时满足上述 3 种情况,才会调用 __alloc_pages_direct_compact() 函数尝试内存规划if (can_direct_reclaim &&(costly_order ||(order > 0 && ac->migratetype != MIGRATE_MOVABLE))&& !gfp_pfmemalloc_allowed(gfp_mask)) {page = __alloc_pages_direct_compact(gfp_mask, order,alloc_flags, ac,INIT_COMPACT_PRIORITY,&compact_result);...}retry:// 确保 kswapd 内核线程不会进入睡眠,因此我们又重新唤醒它if (alloc_flags & ALLOC_KSWAPD)wake_all_kswapds(order, gfp_mask, ac);// __gfp_pfmemalloc_flags() 判断是否允许访问系统预留的内存,若返回 0,表示不允许访问预留内存reserve_flags = __gfp_pfmemalloc_flags(gfp_mask);if (reserve_flags)alloc_flags = reserve_flags;// 原本的 alloc_flags 设置了 ALLOC_CPUSET,当 gfp_mask 设置了 __GFP_AaTOMIC 时会清除 ALLOC_CPUSET,// 表示调用者在中断上下文中。另外,reserve_flags 表示运行访问系统预留的内存。这两种情况下,我们重新计算// 首选推荐的 zone。if (!(alloc_flags & ALLOC_CPUSET) || reserve_flags) {ac->nodemask = NULL;ac->preferred_zoneref = first_zones_zonelist(ac->zonelist,ac->high_zoneidx, ac->nodemask);}// 重新调用 get_page_from_freelist() 尝试一次页面分配,若成功则返回退出page = get_page_from_freelist(gfp_mask, order, alloc_flags, ac);if (page)goto got_pg;// 若调用者不支持直接页面回收,那么我们没有其他可以做的了,跳转到 nopage 处if (!can_direct_reclaim)goto nopage;// 若当前进程的进程描述符设置了 PF_MEMALLOC,那么会在 __gfP_pfmemalloc_flags() 函数中返回// ALLOC_NO_WATERMARKS,表示完全忽略水位条件,可以访问系统全部的预留内存。在 get_page_from_freelist()// 不用检查 zone 的水位即可直接分配内存,既然忽略水位的情况下都不能分配出物理内存,那只能跳转到 nopage 标签处。if (current->flags & PF_MEMALLOC)goto nopage;// 调用直接页面回收机制。经过一轮的直接内存规整之后会尝试分配内存,若成功,则返回 page 数据结构page = __alloc_pages_direct_reclaim(gfp_mask, order, alloc_flags, ac,&did_some_progress);if (page)goto got_pg;// 调用直接内存规整机制。经过一轮的直接内存规整之后会尝试分配内存,若成功,则返回 page 数据结构page = __alloc_pages_direct_compact(gfp_mask, order, alloc_flags, ac,compact_priority, &compact_result);if (page)goto got_pg;...// 若要分配大块的物理内存并且分配掩码中没有设置 __GFP_RETRY_MAYFAIL,那说明分配行为中不允许我们继续重试if (costly_order && !(gfp_mask & __GFP_RETRY_MAYFAIL))goto nopage;// should_reclaim_retry() 判断是否需要重试直接页面回收机制,若返回 0 则表示需要重试// did_some_progress 表示已经成功回收的页面数量if (should_reclaim_retry(gfp_mask, order, ac, alloc_flags,did_some_progress > 0, &no_progress_loops))goto retry;// should_compact_retry() 判断是否需要重试内存规整if (did_some_progress > 0 &&should_compact_retry(ac, order, alloc_flags,compact_result, &compact_priority,&compaction_retries))goto retry;// check_retry_cpuset() 判断是否重新尝试新的 cpuset,这个需要使能 CONFIG_CPUSETS 功能if (check_retry_cpuset(cpuset_mems_cookie, ac))goto retry_cpuset;// 所有的 cpuset 都重新尝试过后,若还是没法分配出所需要的内存,那么将使用 OOM killer 机制// __alloc_pages_may_oom() 函数会调用 OOM killer 机制来终止占用内存比较多的进程,从而释放出一些内存page = __alloc_pages_may_oom(gfp_mask, order, ac, &did_some_progress);if (page)goto got_pg;// 如果被终止的进程是当前进程并且 alloc_flags 为 ALLOC_OOM 或者 gfp_mask 为 __GFP_NOMEMALLOC,那么跳转// 到 nopage 标签处if (tsk_is_oom_victim(current) &&(alloc_flags == ALLOC_OOM ||(gfp_mask & __GFP_NOMEMALLOC)))goto nopage;// did_some_progress 表示我们刚才终止进程后释放了一些内存,因此跳转到 retry 标签处重新尝试分配内存if (did_some_progress) {no_progress_loops = 0;goto retry;}nopage:...// 若 gfp_mask 设置了 __GFP_NOFAIL,表示分配不能失败,那么只能想尽办法来重试if (gfp_mask & __GFP_NOFAIL) {...// 又一次尝试分配内存page = __alloc_pages_cpuset_fallback(gfp_mask, order, ALLOC_HARDER, ac);if (page)goto got_pg;...}
// 若 gfp_mask 没有设置 __GFP_NOFAIL,只能调用 warn_alloc() 来宣告这次内存分配失败了
fail:warn_alloc(gfp_mask, ac->nodemask,"page allocation failure: order:%u", order);
got_pg:return page;
}

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/664185.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

小白水平理解面试经典题目_二维数组类LeetCode 2966 Divide Array【排序算法实现】

2966 将数组划分为具有最大差值的数组 小白渣翻译: 给定一个大小为 n 的整数数组 nums 和一个正整数 k 。 将数组分成一个或多个大小为 3 的数组,满足以下条件: nums 的每个元素都应该位于一个数组中。一个数组中任意两个元素之间的差异小…

力扣每日一题 ---- 1906. 查询差绝对值的最小值

本题中,我们的题目求的是差值的最小值,我们考虑一个因素,当前题目中给出的数组是没有排序过的,那么想要求的差值,是不是要两两配对进行判断差值最小值。这里我们就很费时间了, O(N^2)的时间复杂度&#xf…

【LeetCode】27.移除元素 (快慢指针法)

题目 图解 思路 运行代码 代码 采用 LeetCode 的格式模板 int removeElement(int* nums, int numsSize, int val) {int Left 0;int Right 0;while(Right < numsSize){if(nums[Right] ! val) {nums[Left] nums[Right];Left;}Right;}return Left;// 此时 Left 刚好是数组的…

FANUC机器人开机时无法进入系统,示教器黑屏故障处理总结

FANUC机器人开机时无法进入系统&#xff0c;示教器黑屏故障处理总结 故障描述&#xff1a; FANUC机器人开机时&#xff0c;示教器在初始化时显示&#xff1a;EMAC initial call failed&#xff08;示教器上电时会进入boot画面&#xff0c;左上角会出现一些白色的英文提示&#…

Linux系统漏洞一键检测与修复工具

支持检测及修复漏洞的列表 OpenSSL CVE-2021-3712 OpenSSH CVE-2021-41617 sudo CVE-2021-3156 glibc CVE-2018-11236 polkit CVE-2021-4034 wget CVE-2017-13090 kernel CVE-2016-5195 bash CVE-2016-7543 samba CVE-2021-…

算法基础,一维,二维前缀和差分详解

目录 1.前缀和 1.一维前缀和 例题&#xff1a;【模板】前缀和 2.二维前缀和 例题&#xff1a;【模板】二维前缀和 2.差分 1.一维差分 1.性质&#xff1a;d[i]的前缀和等于a[i] 2.性质&#xff1a;后缀区间修改 例题&#xff1a;【模板】差分 2.二维差分 例题&#x…

.net core 6 集成 elasticsearch 并 使用分词器

1、nuget包安装NEST、安装elasticsearch、kibana、ik分词器、拼音分词器 2、创建操作对象 //索引库 static string indexName "testparticper"; //es 操作对象 ElasticClient elasticClient new ElasticClient(new ConnectionSettings(new Uri("http://192.…

YOLO-World: Real-Time Open-Vocabulary Object Detection

文章目录 1. Introduction2. Experiments2.1 Implementation Details2.2 Pre-training2.3 Ablation Experiments2.3.1 预训练数据2.3.2 对RepVL-PAN的消融研究2.3.3 文本编码器 2.4 Fine-tuning YOLO-World2.5 Open-Vocabulary Instance Segmentation2.6 Visualizations Refere…

Linux系统安全:安全技术 和 防火墙

一、安全技术 入侵检测系统&#xff08;Intrusion Detection Systems&#xff09;&#xff1a;特点是不阻断任何网络访问&#xff0c;量化、定位来自内外网络的威胁情况&#xff0c;主要以提供报警和事后监督为主&#xff0c;提供有针对性的指导措施和安全决策依据,类 似于监控…

ABAP Range Table:RANGES的使用

目录 Range TableRANGERANGES RANGE的四个参数SIGNOPTIONLOWHIGH示例程序 Range Table 1、Range Table 概述 RANGE TABLE为 SAP R/3系统标准内表的一种&#xff0c;结构与 Selection Table 一致&#xff0c; 由 SIGN, OPTION, LOW 和 HIGH字段组成&#xff1b; 可以通过 TYPE…

10. BI - 决策树的使用及可视化

本文为 「茶桁的 AI 秘籍 - BI 篇 第 10 篇」 文章目录 可视化探索决策树原理决策树算法决策树可视化泰坦尼克海难数据 Hi&#xff0c;你好。我是茶桁。 上一节课&#xff0c;咱们了解了图形的具体绘制方法&#xff0c;接下来咱们还要看看除了图形绘制之外&#xff0c;还有哪些…

机器学习入门-----sklearn

机器学习基础了解 概念 机器学习是人工智能的一个实现途径 深度学习是机器学习的一个方法发展而来 定义:从数据中自动分析获得模型,并利用模型对特征数据【数据集:特征值+目标值构成】进行预测 算法 数据集的目标值是类别的话叫做分类问题;目标值是连续的数值的话叫做回…

yum命令下载出现Failed to synchronize cache for repo ‘AppStream‘, ignoring this repo.

修改下面的配置文件 问题&#xff1a; cd /etc/yum.repos.d 修改下面四个文件 vim CentOS-Base.repo vim CentOS-AppStream.repo vim CentOS-Extras.repo vim CentOS-PowerTools.repo测试yum是否正常 yum -y install wget

MATLAB知识点:矩阵的拼接和重复

​讲解视频&#xff1a;可以在bilibili搜索《MATLAB教程新手入门篇——数学建模清风主讲》。​ MATLAB教程新手入门篇&#xff08;数学建模清风主讲&#xff0c;适合零基础同学观看&#xff09;_哔哩哔哩_bilibili 节选自第3章 3.3.4 矩阵的拼接和重复 有时候我们需要对多个矩…

word调整论文格式的记录

页眉的分章显示内容 效果&#xff1a; 步骤&#xff1a; 确保“显示/隐藏的标记”符号打开点亮 前提是章节前面有“分节符&#xff08;下一页&#xff09;”&#xff0c;没有则添加&#xff0c;在菜单栏“布局”——》“下一页” 添加页眉&#xff0c;双击页眉&#xff0c;选…

Cocos XR的WebBox实现流程

1. 正常3D场景下的webview 1.1 组件角色 Cocos Creator正常3D场景下只有在UI组件才支持webview&#xff0c;即作为下图中的UI Nodes(Canvas Node)的子节点&#xff0c;和3D组件是隔离开的&#xff0c;不能显示在3D空间中&#xff0c;UI Nodes(Canvas Node)是一个平面内的矩形…

jsp 样衣申请与归还管理系统Myeclipse开发mysql数据库web结构java编程计算机网页项目

一、源码特点 JSP 样衣申请与归还管理系统是一套完善的java web信息管理系统&#xff0c;对理解JSP java编程开发语言有帮助&#xff0c;系统具有完整的源代码和数据库&#xff0c;系统主要采用B/S模式开发。开发环境 为TOMCAT7.0,Myeclipse8.5开发&#xff0c;数据库为My…

链表——C语言——day17

链表 链表是一种常见的重要的数据结构。它是动态地进行存储分配的一种结构。在用数组存放数据时&#xff0c;必须事先定义固定的长度&#xff08;即元素个数&#xff09;。链表则没有这种缺点&#xff0c;它根据需要开辟内存单元。 链表有一个“头指针“变量&#xff0c;图中…

【力扣白嫖日记】SQL

前言 练习sql语句&#xff0c;所有题目来自于力扣&#xff08;https://leetcode.cn/problemset/database/&#xff09;的免费数据库练习题。 今日题目&#xff1a; 1407.排名靠前的旅行者 表&#xff1a;Users 列名类型idintnamevarchar id 是该表中具有唯一值的列。name …

whale-quant 学习 part7:量化回测

量化回测 计算策略评估指标聚宽平台量化回测实践策略实现 参考 计算策略评估指标 使用数据为&#xff1a;贵州茅台&#xff08;600519.SH&#xff09;、工商银行&#xff08;601398.SH&#xff09;、中国平安&#xff08;601318.SH&#xff09;&#xff0c;策略基准是沪深300指…