/usr/local/lib64/python3.6/site-packages/torch/include/torch/csrc/cuda
NameSizeModeActions
comm.h15250644editdlrm
device_set.h1520644editdlrm
Event.h4870644editdlrm
Module.h5030644editdlrm
nccl.h50370644editdlrm
override_macros.h18870644editdlrm
python_comm.h1140644editdlrm
python_nccl.h6160644editdlrm
restore_macros.h8200644editdlrm
serialization.h5240644editdlrm
Storage.h25850644editdlrm
Stream.h5240644editdlrm
THCP.h4210644editdlrm
undef_macros.h9320644editdlrm
utils.h8710644editdlrm
Edit: /usr/local/lib64/python3.6/site-packages/torch/include/torch/csrc/cuda/comm.h (1525B)
#pragma once #include #include #include #include #include #include #include namespace torch { namespace cuda { using tensor_list2d = std::vector>; TORCH_CUDA_CU_API std::vector& broadcast_out( const at::Tensor& tensor, std::vector& out_tensors); TORCH_CUDA_CU_API std::vector broadcast( const at::Tensor& tensor, at::IntArrayRef devices); TORCH_CUDA_CU_API tensor_list2d broadcast_coalesced( at::TensorList tensors, at::IntArrayRef devices, size_t buffer_size); TORCH_CUDA_CU_API std::vector& scatter_out( const at::Tensor& tensor, std::vector& out_tensors, int64_t dim = 0, const c10::optional>>& streams = c10::nullopt); TORCH_CUDA_CU_API std::vector scatter( const at::Tensor& tensor, at::IntArrayRef devices, const c10::optional>& chunk_sizes = c10::nullopt, int64_t dim = 0, const c10::optional>>& streams = c10::nullopt); TORCH_CUDA_CU_API at::Tensor& gather_out( at::TensorList tensors, at::Tensor& out_tensor, int64_t dim); TORCH_CUDA_CU_API at::Tensor gather( at::TensorList tensors, int64_t dim, c10::optional destination_index); }}