nms_kernel 코드실제 병렬 비교 kernel함수 정의template __global__ void nms_kernel( const int64_t n_boxes, const scalar_t nms_overlap_thresh, const scalar_t *dev_boxes, const int64_t *idx, int64_t *dev_mask) {template은 boxes 관련 dtype을 대응하기 위한 것__global__은 CUDA 커널(CPU 코드에서 호출되지만 실제 계산은 GPU에서 실행되는 함수) 임을 정의할 때 붙이는 표시n_boxes 차선 후보 개수 Nnms_overlap_thresh 차선이 비슷한지 판단하는 thresholddev_boxes GPU 메모리에 있는..