从 Linux 源码看 Socket 的阻塞和非阻塞


从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
笔者一直觉得如果能知道从应用到框架再到操作系统的每一处代码,是一件Exciting的事情 。
大部分高性能网络框架采用的是非阻塞模式 。笔者这次就从linux源码的角度来阐述socket阻塞(block)和非阻塞(non_block)的区别 。本文源码均来自采用Linux-2.6.24内核版本 。
TCP 非阻塞 client 端的例子如果我们要产生一个非阻塞的socket,在C语言中如下代码所示:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
由于网络协议非常复杂,内核里面用到了大量的面向对象的技巧,所以我们从创建连接开始,一步一步追述到最后代码的调用点 。
socket 的创建
很明显,内核的第一步应该是通过AF_INET、SOCK_STREAM以及最后一个参数0定位到需要创建一个TCP的socket,如下图绿线所示:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
我们跟踪源码调用
 
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
进一步分析__sock_create的代码判断:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
由于family是AF_INET协议,注意在操作系统里面定义了PF_INET等于AF_INET, 内核通过函数指针实现了对pf(net_proto_family)的重载 。如下图所示:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
则通过源码可知,由于是AF_INET(PF_INET),所以net_families[PF_INET].create=inet_create(以后我们都用PF_INET表示),即
pf->create = inet_create; 进一步追溯调用:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
上面的代码就是在INET中寻找SOCK_STREAM的过程了 我们再看一下inetsw[SOCK_STREAM]的具体配置:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
这边也用了重载,AF_INET有TCP、UDP以及Raw三种:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
从上述代码,我们可以清楚的发现sock->ops=&inet_stream_ops;
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
即sock->ops->recvmsg = sock_common_recvmsg;
同时sock->sk->sk_prot = tcp_prot;
我们再看下tcp_prot中的各个函数重载的定义:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
fcntl控制socket的阻塞非阻塞状态我们用fcntl修改socket的阻塞非阻塞状态 。事实上: fcntl的作用就是将O_NONBLOCK标志位存储在sock_fd对应的filp结构的f_lags里,如下图所示 。
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 

从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
追踪setfl代码:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
上图中,由sock_fd在task_struct(进程结构体)->files_struct->fd_array中找到对应的socket的file描述符,再修改file->flags
在调用socket.recv的时候我们跟踪源码调用:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
由上文可知: sock->ops->recvmsg = sock_common_recvmsg;
  • sock
值得注意的是,在sock_recmsg中,有对标识O_NONBLOCK的处理
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
上述代码中sock关联的file中获取其f_flags,如果flags有O_NONBLOCK标识,那么就设置msg_flags为MSG_DONTWAIT(不等待) 。
fcntl与socket就是通过其共同操作File结构关联起来的 。
  • 继续跟踪调用
sock_common_recvmsg
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图
 
由上文可知: sk->sk_prot->recvmsg 其中sk_prot=tcp_prot,即最终调用的是tcp_prot->tcp_recvmsg,上面的代码可以看出,如果fcntl(O_NONBLOCK)=>MSG_DONTWAIT置位=>(flags & MSG_DONTWAIT)>0, 再结合tcp_recvmsg的函数签名,即如果设置了O_NONBLOCK的话,设置给tcp_recvmsg的nonblock参数>0,关系如下图所示:
从 Linux 源码看 Socket 的阻塞和非阻塞

文章插图