process_madv.c 8.5 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330331332333334335336337338339340341342343344
  1. // SPDX-License-Identifier: GPL-2.0-or-later
  2. #define _GNU_SOURCE
  3. #include "kselftest_harness.h"
  4. #include <errno.h>
  5. #include <setjmp.h>
  6. #include <signal.h>
  7. #include <stdbool.h>
  8. #include <stdio.h>
  9. #include <stdlib.h>
  10. #include <string.h>
  11. #include <linux/mman.h>
  12. #include <sys/syscall.h>
  13. #include <unistd.h>
  14. #include <sched.h>
  15. #include "vm_util.h"
  16. #include "../pidfd/pidfd.h"
  17. FIXTURE(process_madvise)
  18. {
  19. unsigned long page_size;
  20. pid_t child_pid;
  21. int remote_pidfd;
  22. int pidfd;
  23. };
  24. FIXTURE_SETUP(process_madvise)
  25. {
  26. self->page_size = (unsigned long)sysconf(_SC_PAGESIZE);
  27. self->pidfd = PIDFD_SELF;
  28. self->remote_pidfd = -1;
  29. self->child_pid = -1;
  30. };
  31. FIXTURE_TEARDOWN_PARENT(process_madvise)
  32. {
  33. /* This teardown is guaranteed to run, even if tests SKIP or ASSERT */
  34. if (self->child_pid > 0) {
  35. kill(self->child_pid, SIGKILL);
  36. waitpid(self->child_pid, NULL, 0);
  37. }
  38. if (self->remote_pidfd >= 0)
  39. close(self->remote_pidfd);
  40. }
  41. static ssize_t sys_process_madvise(int pidfd, const struct iovec *iovec,
  42. size_t vlen, int advice, unsigned int flags)
  43. {
  44. return syscall(__NR_process_madvise, pidfd, iovec, vlen, advice, flags);
  45. }
  46. /*
  47. * This test uses PIDFD_SELF to target the current process. The main
  48. * goal is to verify the basic behavior of process_madvise() with
  49. * a vector of non-contiguous memory ranges, not its cross-process
  50. * capabilities.
  51. */
  52. TEST_F(process_madvise, basic)
  53. {
  54. const unsigned long pagesize = self->page_size;
  55. const int madvise_pages = 4;
  56. struct iovec vec[madvise_pages];
  57. int pidfd = self->pidfd;
  58. ssize_t ret;
  59. char *map;
  60. /*
  61. * Create a single large mapping. We will pick pages from this
  62. * mapping to advise on. This ensures we test non-contiguous iovecs.
  63. */
  64. map = mmap(NULL, pagesize * 10, PROT_READ | PROT_WRITE,
  65. MAP_PRIVATE | MAP_ANONYMOUS, -1, 0);
  66. if (map == MAP_FAILED)
  67. SKIP(return, "mmap failed, not enough memory.\n");
  68. /* Fill the entire region with a known pattern. */
  69. memset(map, 'A', pagesize * 10);
  70. /*
  71. * Setup the iovec to point to 4 non-contiguous pages
  72. * within the mapping.
  73. */
  74. vec[0].iov_base = &map[0 * pagesize];
  75. vec[0].iov_len = pagesize;
  76. vec[1].iov_base = &map[3 * pagesize];
  77. vec[1].iov_len = pagesize;
  78. vec[2].iov_base = &map[5 * pagesize];
  79. vec[2].iov_len = pagesize;
  80. vec[3].iov_base = &map[8 * pagesize];
  81. vec[3].iov_len = pagesize;
  82. ret = sys_process_madvise(pidfd, vec, madvise_pages, MADV_DONTNEED, 0);
  83. if (ret == -1 && errno == EPERM)
  84. SKIP(return,
  85. "process_madvise() unsupported or permission denied, try running as root.\n");
  86. else if (errno == EINVAL)
  87. SKIP(return,
  88. "process_madvise() unsupported or parameter invalid, please check arguments.\n");
  89. /* The call should succeed and report the total bytes processed. */
  90. ASSERT_EQ(ret, madvise_pages * pagesize);
  91. /* Check that advised pages are now zero. */
  92. for (int i = 0; i < madvise_pages; i++) {
  93. char *advised_page = (char *)vec[i].iov_base;
  94. /* Content must be 0, not 'A'. */
  95. ASSERT_EQ(*advised_page, '\0');
  96. }
  97. /* Check that an un-advised page in between is still 'A'. */
  98. char *unadvised_page = &map[1 * pagesize];
  99. for (int i = 0; i < pagesize; i++)
  100. ASSERT_EQ(unadvised_page[i], 'A');
  101. /* Cleanup. */
  102. ASSERT_EQ(munmap(map, pagesize * 10), 0);
  103. }
  104. /*
  105. * This test deterministically validates process_madvise() with MADV_COLLAPSE
  106. * on a remote process, other advices are difficult to verify reliably.
  107. *
  108. * The test verifies that a memory region in a child process,
  109. * focus on process_madv remote result, only check addresses and lengths.
  110. * The correctness of the MADV_COLLAPSE can be found in the relevant test examples in khugepaged.
  111. */
  112. TEST_F(process_madvise, remote_collapse)
  113. {
  114. const unsigned long pagesize = self->page_size;
  115. long huge_page_size;
  116. int pipe_info[2];
  117. ssize_t ret;
  118. struct iovec vec;
  119. struct child_info {
  120. pid_t pid;
  121. void *map_addr;
  122. } info;
  123. huge_page_size = read_pmd_pagesize();
  124. if (huge_page_size <= 0)
  125. SKIP(return, "Could not determine a valid huge page size.\n");
  126. ASSERT_EQ(pipe(pipe_info), 0);
  127. self->child_pid = fork();
  128. ASSERT_NE(self->child_pid, -1);
  129. if (self->child_pid == 0) {
  130. char *map;
  131. size_t map_size = 2 * huge_page_size;
  132. close(pipe_info[0]);
  133. map = mmap(NULL, map_size, PROT_READ | PROT_WRITE,
  134. MAP_PRIVATE | MAP_ANONYMOUS, -1, 0);
  135. ASSERT_NE(map, MAP_FAILED);
  136. /* Fault in as small pages */
  137. for (size_t i = 0; i < map_size; i += pagesize)
  138. map[i] = 'A';
  139. /* Send info and pause */
  140. info.pid = getpid();
  141. info.map_addr = map;
  142. ret = write(pipe_info[1], &info, sizeof(info));
  143. ASSERT_EQ(ret, sizeof(info));
  144. close(pipe_info[1]);
  145. pause();
  146. exit(0);
  147. }
  148. close(pipe_info[1]);
  149. /* Receive child info */
  150. ret = read(pipe_info[0], &info, sizeof(info));
  151. if (ret <= 0) {
  152. waitpid(self->child_pid, NULL, 0);
  153. SKIP(return, "Failed to read child info from pipe.\n");
  154. }
  155. ASSERT_EQ(ret, sizeof(info));
  156. close(pipe_info[0]);
  157. self->child_pid = info.pid;
  158. self->remote_pidfd = syscall(__NR_pidfd_open, self->child_pid, 0);
  159. ASSERT_GE(self->remote_pidfd, 0);
  160. vec.iov_base = info.map_addr;
  161. vec.iov_len = huge_page_size;
  162. ret = sys_process_madvise(self->remote_pidfd, &vec, 1, MADV_COLLAPSE,
  163. 0);
  164. if (ret == -1) {
  165. if (errno == EINVAL)
  166. SKIP(return, "PROCESS_MADV_ADVISE is not supported.\n");
  167. else if (errno == EPERM)
  168. SKIP(return,
  169. "No process_madvise() permissions, try running as root.\n");
  170. return;
  171. }
  172. ASSERT_EQ(ret, huge_page_size);
  173. }
  174. /*
  175. * Test process_madvise() with a pidfd for a process that has already
  176. * exited to ensure correct error handling.
  177. */
  178. TEST_F(process_madvise, exited_process_pidfd)
  179. {
  180. const unsigned long pagesize = self->page_size;
  181. struct iovec vec;
  182. char *map;
  183. ssize_t ret;
  184. map = mmap(NULL, pagesize, PROT_READ, MAP_PRIVATE | MAP_ANONYMOUS, -1,
  185. 0);
  186. if (map == MAP_FAILED)
  187. SKIP(return, "mmap failed, not enough memory.\n");
  188. vec.iov_base = map;
  189. vec.iov_len = pagesize;
  190. /*
  191. * Using a pidfd for a process that has already exited should fail
  192. * with ESRCH.
  193. */
  194. self->child_pid = fork();
  195. ASSERT_NE(self->child_pid, -1);
  196. if (self->child_pid == 0)
  197. exit(0);
  198. self->remote_pidfd = syscall(__NR_pidfd_open, self->child_pid, 0);
  199. ASSERT_GE(self->remote_pidfd, 0);
  200. /* Wait for the child to ensure it has terminated. */
  201. waitpid(self->child_pid, NULL, 0);
  202. ret = sys_process_madvise(self->remote_pidfd, &vec, 1, MADV_DONTNEED,
  203. 0);
  204. ASSERT_EQ(ret, -1);
  205. ASSERT_EQ(errno, ESRCH);
  206. }
  207. /*
  208. * Test process_madvise() with bad pidfds to ensure correct error
  209. * handling.
  210. */
  211. TEST_F(process_madvise, bad_pidfd)
  212. {
  213. const unsigned long pagesize = self->page_size;
  214. struct iovec vec;
  215. char *map;
  216. ssize_t ret;
  217. map = mmap(NULL, pagesize, PROT_READ, MAP_PRIVATE | MAP_ANONYMOUS, -1,
  218. 0);
  219. if (map == MAP_FAILED)
  220. SKIP(return, "mmap failed, not enough memory.\n");
  221. vec.iov_base = map;
  222. vec.iov_len = pagesize;
  223. /* Using an invalid fd number (-1) should fail with EBADF. */
  224. ret = sys_process_madvise(-1, &vec, 1, MADV_DONTNEED, 0);
  225. ASSERT_EQ(ret, -1);
  226. ASSERT_EQ(errno, EBADF);
  227. /*
  228. * Using a valid fd that is not a pidfd (e.g. stdin) should fail
  229. * with EBADF.
  230. */
  231. ret = sys_process_madvise(STDIN_FILENO, &vec, 1, MADV_DONTNEED, 0);
  232. ASSERT_EQ(ret, -1);
  233. ASSERT_EQ(errno, EBADF);
  234. }
  235. /*
  236. * Test that process_madvise() rejects vlen > UIO_MAXIOV.
  237. * The kernel should return -EINVAL when the number of iovecs exceeds 1024.
  238. */
  239. TEST_F(process_madvise, invalid_vlen)
  240. {
  241. const unsigned long pagesize = self->page_size;
  242. int pidfd = self->pidfd;
  243. struct iovec vec;
  244. char *map;
  245. ssize_t ret;
  246. map = mmap(NULL, pagesize, PROT_READ, MAP_PRIVATE | MAP_ANONYMOUS, -1,
  247. 0);
  248. if (map == MAP_FAILED)
  249. SKIP(return, "mmap failed, not enough memory.\n");
  250. vec.iov_base = map;
  251. vec.iov_len = pagesize;
  252. ret = sys_process_madvise(pidfd, &vec, 1025, MADV_DONTNEED, 0);
  253. ASSERT_EQ(ret, -1);
  254. ASSERT_EQ(errno, EINVAL);
  255. /* Cleanup. */
  256. ASSERT_EQ(munmap(map, pagesize), 0);
  257. }
  258. /*
  259. * Test process_madvise() with an invalid flag value. Currently, only a flag
  260. * value of 0 is supported. This test is reserved for the future, e.g., if
  261. * synchronous flags are added.
  262. */
  263. TEST_F(process_madvise, flag)
  264. {
  265. const unsigned long pagesize = self->page_size;
  266. unsigned int invalid_flag;
  267. int pidfd = self->pidfd;
  268. struct iovec vec;
  269. char *map;
  270. ssize_t ret;
  271. map = mmap(NULL, pagesize, PROT_READ, MAP_PRIVATE | MAP_ANONYMOUS, -1,
  272. 0);
  273. if (map == MAP_FAILED)
  274. SKIP(return, "mmap failed, not enough memory.\n");
  275. vec.iov_base = map;
  276. vec.iov_len = pagesize;
  277. invalid_flag = 0x80000000;
  278. ret = sys_process_madvise(pidfd, &vec, 1, MADV_DONTNEED, invalid_flag);
  279. ASSERT_EQ(ret, -1);
  280. ASSERT_EQ(errno, EINVAL);
  281. /* Cleanup. */
  282. ASSERT_EQ(munmap(map, pagesize), 0);
  283. }
  284. TEST_HARNESS_MAIN