link_watch.c 7.5 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295296297298299300301302303304305306307308309310311312313314315316317318319320321322323324325326327328329330
  1. // SPDX-License-Identifier: GPL-2.0-or-later
  2. /*
  3. * Linux network device link state notification
  4. *
  5. * Author:
  6. * Stefan Rompf <sux@loplof.de>
  7. */
  8. #include <linux/module.h>
  9. #include <linux/netdevice.h>
  10. #include <linux/if.h>
  11. #include <net/sock.h>
  12. #include <net/pkt_sched.h>
  13. #include <linux/rtnetlink.h>
  14. #include <linux/jiffies.h>
  15. #include <linux/spinlock.h>
  16. #include <linux/workqueue.h>
  17. #include <linux/bitops.h>
  18. #include <linux/types.h>
  19. #include "dev.h"
  20. enum lw_bits {
  21. LW_URGENT = 0,
  22. };
  23. static unsigned long linkwatch_flags;
  24. static unsigned long linkwatch_nextevent;
  25. static void linkwatch_event(struct work_struct *dummy);
  26. static DECLARE_DELAYED_WORK(linkwatch_work, linkwatch_event);
  27. static LIST_HEAD(lweventlist);
  28. static DEFINE_SPINLOCK(lweventlist_lock);
  29. static unsigned int default_operstate(const struct net_device *dev)
  30. {
  31. if (netif_testing(dev))
  32. return IF_OPER_TESTING;
  33. /* Some uppers (DSA) have additional sources for being down, so
  34. * first check whether lower is indeed the source of its down state.
  35. */
  36. if (!netif_carrier_ok(dev)) {
  37. struct net_device *peer;
  38. int iflink;
  39. /* If called from netdev_run_todo()/linkwatch_sync_dev(),
  40. * dev_net(dev) can be already freed, and RTNL is not held.
  41. */
  42. if (dev->reg_state <= NETREG_REGISTERED)
  43. iflink = dev_get_iflink(dev);
  44. else
  45. iflink = dev->ifindex;
  46. if (iflink == dev->ifindex)
  47. return IF_OPER_DOWN;
  48. ASSERT_RTNL();
  49. peer = __dev_get_by_index(dev_net(dev), iflink);
  50. if (!peer)
  51. return IF_OPER_DOWN;
  52. return netif_carrier_ok(peer) ? IF_OPER_DOWN :
  53. IF_OPER_LOWERLAYERDOWN;
  54. }
  55. if (netif_dormant(dev))
  56. return IF_OPER_DORMANT;
  57. return IF_OPER_UP;
  58. }
  59. static void rfc2863_policy(struct net_device *dev)
  60. {
  61. unsigned int operstate = default_operstate(dev);
  62. if (operstate == READ_ONCE(dev->operstate))
  63. return;
  64. switch(dev->link_mode) {
  65. case IF_LINK_MODE_TESTING:
  66. if (operstate == IF_OPER_UP)
  67. operstate = IF_OPER_TESTING;
  68. break;
  69. case IF_LINK_MODE_DORMANT:
  70. if (operstate == IF_OPER_UP)
  71. operstate = IF_OPER_DORMANT;
  72. break;
  73. case IF_LINK_MODE_DEFAULT:
  74. default:
  75. break;
  76. }
  77. WRITE_ONCE(dev->operstate, operstate);
  78. }
  79. void linkwatch_init_dev(struct net_device *dev)
  80. {
  81. /* Handle pre-registration link state changes */
  82. if (!netif_carrier_ok(dev) || netif_dormant(dev) ||
  83. netif_testing(dev))
  84. rfc2863_policy(dev);
  85. }
  86. static bool linkwatch_urgent_event(struct net_device *dev)
  87. {
  88. if (!netif_running(dev))
  89. return false;
  90. if (dev->ifindex != dev_get_iflink(dev))
  91. return true;
  92. if (netif_is_lag_port(dev) || netif_is_lag_master(dev))
  93. return true;
  94. return netif_carrier_ok(dev) && qdisc_tx_changing(dev);
  95. }
  96. static void linkwatch_add_event(struct net_device *dev)
  97. {
  98. unsigned long flags;
  99. spin_lock_irqsave(&lweventlist_lock, flags);
  100. if (list_empty(&dev->link_watch_list)) {
  101. list_add_tail(&dev->link_watch_list, &lweventlist);
  102. netdev_hold(dev, &dev->linkwatch_dev_tracker, GFP_ATOMIC);
  103. }
  104. spin_unlock_irqrestore(&lweventlist_lock, flags);
  105. }
  106. static void linkwatch_schedule_work(int urgent)
  107. {
  108. unsigned long delay = linkwatch_nextevent - jiffies;
  109. if (test_bit(LW_URGENT, &linkwatch_flags))
  110. return;
  111. /* Minimise down-time: drop delay for up event. */
  112. if (urgent) {
  113. if (test_and_set_bit(LW_URGENT, &linkwatch_flags))
  114. return;
  115. delay = 0;
  116. }
  117. /* If we wrap around we'll delay it by at most HZ. */
  118. if (delay > HZ)
  119. delay = 0;
  120. /*
  121. * If urgent, schedule immediate execution; otherwise, don't
  122. * override the existing timer.
  123. */
  124. if (test_bit(LW_URGENT, &linkwatch_flags))
  125. mod_delayed_work(system_dfl_wq, &linkwatch_work, 0);
  126. else
  127. queue_delayed_work(system_dfl_wq, &linkwatch_work, delay);
  128. }
  129. static void linkwatch_do_dev(struct net_device *dev)
  130. {
  131. /*
  132. * Make sure the above read is complete since it can be
  133. * rewritten as soon as we clear the bit below.
  134. */
  135. smp_mb__before_atomic();
  136. /* We are about to handle this device,
  137. * so new events can be accepted
  138. */
  139. clear_bit(__LINK_STATE_LINKWATCH_PENDING, &dev->state);
  140. rfc2863_policy(dev);
  141. if (dev->flags & IFF_UP) {
  142. if (netif_carrier_ok(dev))
  143. dev_activate(dev);
  144. else
  145. dev_deactivate(dev);
  146. netif_state_change(dev);
  147. }
  148. }
  149. static void __linkwatch_run_queue(int urgent_only)
  150. {
  151. #define MAX_DO_DEV_PER_LOOP 100
  152. int do_dev = MAX_DO_DEV_PER_LOOP;
  153. /* Use a local list here since we add non-urgent
  154. * events back to the global one when called with
  155. * urgent_only=1.
  156. */
  157. LIST_HEAD(wrk);
  158. /* Give urgent case more budget */
  159. if (urgent_only)
  160. do_dev += MAX_DO_DEV_PER_LOOP;
  161. /*
  162. * Limit the number of linkwatch events to one
  163. * per second so that a runaway driver does not
  164. * cause a storm of messages on the netlink
  165. * socket. This limit does not apply to up events
  166. * while the device qdisc is down.
  167. */
  168. if (!urgent_only)
  169. linkwatch_nextevent = jiffies + HZ;
  170. /* Limit wrap-around effect on delay. */
  171. else if (time_after(linkwatch_nextevent, jiffies + HZ))
  172. linkwatch_nextevent = jiffies;
  173. clear_bit(LW_URGENT, &linkwatch_flags);
  174. spin_lock_irq(&lweventlist_lock);
  175. list_splice_init(&lweventlist, &wrk);
  176. while (!list_empty(&wrk) && do_dev > 0) {
  177. struct net_device *dev;
  178. dev = list_first_entry(&wrk, struct net_device, link_watch_list);
  179. list_del_init(&dev->link_watch_list);
  180. if (!netif_device_present(dev) ||
  181. (urgent_only && !linkwatch_urgent_event(dev))) {
  182. list_add_tail(&dev->link_watch_list, &lweventlist);
  183. continue;
  184. }
  185. /* We must free netdev tracker under
  186. * the spinlock protection.
  187. */
  188. netdev_tracker_free(dev, &dev->linkwatch_dev_tracker);
  189. spin_unlock_irq(&lweventlist_lock);
  190. netdev_lock_ops(dev);
  191. linkwatch_do_dev(dev);
  192. netdev_unlock_ops(dev);
  193. /* Use __dev_put() because netdev_tracker_free() was already
  194. * called above. Must be after netdev_unlock_ops() to prevent
  195. * netdev_run_todo() from freeing the device while still in use.
  196. */
  197. __dev_put(dev);
  198. do_dev--;
  199. spin_lock_irq(&lweventlist_lock);
  200. }
  201. /* Add the remaining work back to lweventlist */
  202. list_splice_init(&wrk, &lweventlist);
  203. if (!list_empty(&lweventlist))
  204. linkwatch_schedule_work(0);
  205. spin_unlock_irq(&lweventlist_lock);
  206. }
  207. static bool linkwatch_clean_dev(struct net_device *dev)
  208. {
  209. unsigned long flags;
  210. bool clean = false;
  211. spin_lock_irqsave(&lweventlist_lock, flags);
  212. if (!list_empty(&dev->link_watch_list)) {
  213. list_del_init(&dev->link_watch_list);
  214. clean = true;
  215. /* We must release netdev tracker under
  216. * the spinlock protection.
  217. */
  218. netdev_tracker_free(dev, &dev->linkwatch_dev_tracker);
  219. }
  220. spin_unlock_irqrestore(&lweventlist_lock, flags);
  221. return clean;
  222. }
  223. void __linkwatch_sync_dev(struct net_device *dev)
  224. {
  225. netdev_ops_assert_locked(dev);
  226. if (linkwatch_clean_dev(dev)) {
  227. linkwatch_do_dev(dev);
  228. /* Use __dev_put() because netdev_tracker_free() was already
  229. * called inside linkwatch_clean_dev().
  230. */
  231. __dev_put(dev);
  232. }
  233. }
  234. void linkwatch_sync_dev(struct net_device *dev)
  235. {
  236. if (linkwatch_clean_dev(dev)) {
  237. netdev_lock_ops(dev);
  238. linkwatch_do_dev(dev);
  239. netdev_unlock_ops(dev);
  240. /* Use __dev_put() because netdev_tracker_free() was already
  241. * called inside linkwatch_clean_dev().
  242. */
  243. __dev_put(dev);
  244. }
  245. }
  246. /* Must be called with the rtnl semaphore held */
  247. void linkwatch_run_queue(void)
  248. {
  249. __linkwatch_run_queue(0);
  250. }
  251. static void linkwatch_event(struct work_struct *dummy)
  252. {
  253. rtnl_lock();
  254. __linkwatch_run_queue(time_after(linkwatch_nextevent, jiffies));
  255. rtnl_unlock();
  256. }
  257. void linkwatch_fire_event(struct net_device *dev)
  258. {
  259. bool urgent = linkwatch_urgent_event(dev);
  260. if (!test_and_set_bit(__LINK_STATE_LINKWATCH_PENDING, &dev->state)) {
  261. linkwatch_add_event(dev);
  262. } else if (!urgent)
  263. return;
  264. linkwatch_schedule_work(urgent);
  265. }
  266. EXPORT_SYMBOL(linkwatch_fire_event);