文章目录
- 一、不同核函数前缀
- 二、指定kernel要执行的线程数量
- 三、线程需要两个内置坐标变量来唯一标识线程
- 四、不是blocksize越大越好,上限一般是1024个blocksize
一、不同核函数前缀
二、指定kernel要执行的线程数量
总共需要线程数是:
1 * N = N个线程
三、线程需要两个内置坐标变量来唯一标识线程
①都是dim3类型变量
②blockIdx
指明线程在grid中的位置,threadIdx
指明线程所在block中的位置
- 若使用的向量大小为1<<20,假设block大小为256,而grid的大小就是4096
③而线程的ID值为:
二维:对于2-dim的block(Dx,Dy),线程(x,y)的ID值为(x+ yDx)
三维:如果是3-dim的block(Dx,Dy,Dz),线程(x,y,z)的ID值为(x+ yDx +zDxDy)
④矩阵加法