线程束(warp)
一个GPU由多个SM组成,一个SM上可以放多个线程块,不同线程块之间并行或顺序执行。一个线程块分为多个线程束,一个线程束由32个线程(有连续的线程号)组成。从更细粒度来看,一个SM以一个线程束为单位产生、管理、调度、执行线程。
![在这里插入图片描述](https://img-blog.csdnimg.cn/395a00cdaa6744d18b21415f47d00ab0.png?x-oss-process=image/watermark,type_d3F5LXplbmhlaQ,shadow_50,text_Q1NETiBAemt4aGxidA==,size_20,color_FFFFFF,t_70,g_se,x_16)
福特架构之前,每个warp只有一个程序计数器,需要注意分支发散问题。一些严重的分支发散会极大降低性能。
从福特架构开始,引入了独立线程调度机制。书里关于这个感觉没有讲的特别明白,没有太搞清楚和分支发散的逻辑关系。
https://baijiahao.baidu.com/s?id=1567082220106634&wfr=spider&for=pc
https://blog.csdn.net/javastart/article/details/117371228
读完大概明白了,加入了独立线程调度机制后,可以允许线程的同步和通信,粒度更细,操作更灵活。会牺牲一点寄存器。并没有使分支分散变快或怎么样。
福特架构之前:__synthreads()可以使线程块同步
福特架构及之后:__synwarp()线程束内同步。原型为void __synwarp(unsigned mask=oxffffffff),全1表示所有线程同步。这个比__synthreads更快。