/usr/local/lib64/python3.6/site-packages/caffe2/python
NameSizeModeActions
docs/-0755rm
examples/-0755rm
fakelowp/-0755rm
helpers/-0755rm
ideep/-0755rm
layers/-0755rm
mint/-0755rm
mkl/-0755rm
modeling/-0755rm
models/-0755rm
onnx/-0755rm
operator_test/-0755rm
predictor/-0755rm
rnn/-0755rm
serialized_test/-0755rm
test/-0755rm
trt/-0755rm
__pycache__/-0755rm
allcompare_test.py22550644editdlrm
attention.py123590644editdlrm
benchmark_generator.py49120644editdlrm
binarysize.py55210644editdlrm
brew.py47620644editdlrm
brew_test.py117390644editdlrm
build.py1530644editdlrm
cached_reader.py43940644editdlrm
caffe2_pybind11_state.cpython-36m-x86_64-linux-gnu.so482997120755editdlrm
caffe2_pybind11_state_gpu.cpython-36m-x86_64-linux-gnu.so490481440755editdlrm
caffe_translator.py352270644editdlrm
caffe_translator_test.py35530644editdlrm
checkpoint.py321010644editdlrm
checkpoint_test.py134050644editdlrm
cnn.py76260644editdlrm
context.py28410644editdlrm
context_test.py17920644editdlrm
control.py193090644editdlrm
control_ops_grad.py288930644editdlrm
control_ops_grad_test.py17520644editdlrm
control_ops_util.py108630644editdlrm
control_test.py122760644editdlrm
convert.py550644editdlrm
convert_test.py2010644editdlrm
convnet_benchmarks.py205330644editdlrm
convnet_benchmarks_test.py8390644editdlrm
core.py1194000644editdlrm
core_gradients_test.py380220644editdlrm
core_test.py476830644editdlrm
crf.py132500644editdlrm
crf_predict.py11590644editdlrm
crf_viterbi_test.py16630644editdlrm
dataio.py235320644editdlrm
dataio_test.py175750644editdlrm
dataset.py128860644editdlrm
data_parallel_model.py831000644editdlrm
data_parallel_model_test.py561450644editdlrm
data_workers.py159410644editdlrm
data_workers_test.py65610644editdlrm
db_file_reader.py66080644editdlrm
db_test.py11100644editdlrm
device_checker.py51570644editdlrm
dyndep.py15330644editdlrm
embedding_generation_benchmark.py52560644editdlrm
experiment_util.py36250644editdlrm
extension_loader.py7440644editdlrm
fakefp16_transform_lib.py3220644editdlrm
filler_test.py7480644editdlrm
functional.py44150644editdlrm
functional_test.py42040644editdlrm
fused_8bit_rowwise_conversion_ops_test.py39450644editdlrm
gradient_checker.py153770644editdlrm
gradient_check_test.py207290644editdlrm
gru_cell.py51290644editdlrm
hip_test_util.py4050644editdlrm
hsm_util.py22590644editdlrm
hypothesis_test.py1057620644editdlrm
hypothesis_test_util.py268530644editdlrm
ideep_test_util.py9980644editdlrm
layers_test.py929310644editdlrm
layer_model_helper.py293400644editdlrm
layer_model_instantiator.py39350644editdlrm
layer_parameter_sharing_test.py91480644editdlrm
layer_test_util.py48750644editdlrm
lazy.py2770644editdlrm
lazy_dyndep.py25620644editdlrm
lazy_dyndep_test.py39140644editdlrm
lengths_reducer_fused_8bit_rowwise_ops_test.py75750644editdlrm
lengths_reducer_rowwise_8bit_ops_test.py57100644editdlrm
lstm_benchmark.py106490644editdlrm
memonger.py340410644editdlrm
memonger_test.py369100644editdlrm
mkl_test_util.py11420644editdlrm
model_device_test.py47770644editdlrm
model_helper.py234920644editdlrm
model_helper_test.py23360644editdlrm
modifier_context.py17720644editdlrm
muji.py81310644editdlrm
muji_test.py30580644editdlrm
net_builder.py276790644editdlrm
net_builder_test.py113820644editdlrm
net_drawer.py142640644editdlrm
net_printer.py127040644editdlrm
net_printer_test.py31900644editdlrm
nomnigraph.py42160644editdlrm
nomnigraph_test.py154270644editdlrm
nomnigraph_transformations.py37870644editdlrm
nomnigraph_transformations_test.py57670644editdlrm
normalizer.py14110644editdlrm
normalizer_context.py10070644editdlrm
normalizer_test.py4870644editdlrm
numa_benchmark.py22300644editdlrm
numa_test.py16630644editdlrm
observer_test.py53160644editdlrm
operator_fp_exceptions_test.py12480644editdlrm
optimizer.py788130644editdlrm
optimizer_context.py14620644editdlrm
optimizer_test.py307050644editdlrm
optimizer_test_util.py91870644editdlrm
parallelize_bmuf_distributed_test.py99080644editdlrm
parallel_workers.py76820644editdlrm
parallel_workers_test.py35010644editdlrm
pipeline.py172830644editdlrm
pipeline_test.py25420644editdlrm
predictor_constants.py1980644editdlrm
python_op_test.py91690644editdlrm
queue_util.py44590644editdlrm
record_queue.py44530644editdlrm
recurrent.py132970644editdlrm
regularizer.py211200644editdlrm
regularizer_context.py10130644editdlrm
regularizer_test.py102660644editdlrm
rnn_cell.py682330644editdlrm
schema.py456210644editdlrm
schema_test.py157540644editdlrm
scope.py36230644editdlrm
scope_test.py52490644editdlrm
session.py76420644editdlrm
session_test.py20780644editdlrm
sparse_to_dense_mask_test.py65650644editdlrm
sparse_to_dense_test.py35560644editdlrm
task.py242740644editdlrm
task_test.py8700644editdlrm
test_util.py35240644editdlrm
text_file_reader.py19900644editdlrm
timeout_guard.py40540644editdlrm
toy_regression_test.py28220644editdlrm
transformations.py18320644editdlrm
transformations_test.py119600644editdlrm
tt_core.py93490644editdlrm
tt_core_test.py25180644editdlrm
utils.py141810644editdlrm
utils_test.py13990644editdlrm
visualize.py63150644editdlrm
workspace.py252630644editdlrm
workspace_test.py348440644editdlrm
_import_c_extension.py22500644editdlrm
__init__.py39250644editdlrm
Edit: /usr/local/lib64/python3.6/site-packages/caffe2/python/muji.py (8131B)
## @package muji # Module caffe2.python.muji """muji.py does multi-gpu training for caffe2 with no need to change the c++ side code. Everything is defined on the computation graph level. We support the following use cases: - 2 gpus, where peer access is enabled between them. - 4 gpus, where peer access are enabled between all of them. - 4 gpus, where peer access are enabled in two groups, between {1, 2} and {3, 4} - 8 gpus, where peer access are enabled in two groups, between {1, 2, 3, 4} and {5, 6, 7, 8}. If above cases are not satisfied, a fallback function which does not rely on peer access will be called. """ import numpy as np from caffe2.proto import caffe2_pb2 from caffe2.python import workspace def OnGPU(gpu_id): """A utility function that returns a device option protobuf of the specified gpu id. """ device_option = caffe2_pb2.DeviceOption() device_option.device_type = workspace.GpuDeviceType device_option.device_id = gpu_id return device_option def OnCPU(): device_option = caffe2_pb2.DeviceOption() device_option.device_type = caffe2_pb2.CPU return device_option def Allreduce(net, blobs, reduced_affix="_reduced", gpu_indices=None): """The general Allreduce interface that reroutes the function calls. CPUs and AMD GPUs are not supported because GetGpuPeerAccessPattern is called to get gpu peer access pattern. """ if gpu_indices is None: gpu_indices = list(range(len(blobs))) if len(gpu_indices) != len(blobs): raise RuntimeError( "gpu_indices length and blobs length mismatch: %d vs %d" % (len(gpu_indices), len(blobs)) ) pattern = workspace.GetGpuPeerAccessPattern() if len(blobs) == 2 and pattern.shape[0] >= 2 and np.all(pattern[:2, :2]): return Allreduce2(net, blobs, reduced_affix, gpu_indices) elif len(blobs) == 4 and pattern.shape[0] >= 4 and np.all(pattern[:4, :4]): return Allreduce4(net, blobs, reduced_affix, gpu_indices) elif len(blobs) == 4 and pattern.shape[0] >= 4 and np.all(pattern[:2, :2]) and np.all(pattern[2:4, 2:4]): return Allreduce4Group2(net, blobs, reduced_affix, gpu_indices) elif len(blobs) == 8 and pattern.shape[0] >= 8 and np.all(pattern[:8, :8]): return Allreduce8(net, blobs, reduced_affix, gpu_indices) else: return AllreduceFallback(net, blobs, reduced_affix, gpu_indices) def Allreduce2(net, blobs, reduced_affix, gpu_indices): """Allreduce for 2 gpus. Algorithm: 0r <- 0 + 1, 1r <- 0r, where r means "reduced" """ a, b = blobs gpu_a, gpu_b = gpu_indices a_reduced = net.Add([a, b], a + reduced_affix, device_option=OnGPU(gpu_a)) b_reduced = a_reduced.Copy( [], b + reduced_affix, device_option=OnGPU(gpu_b) ) return a_reduced, b_reduced def Allreduce4(net, blobs, reduced_affix, gpu_indices): """Allreduce for 4 gpus. Algorithm: 2 level reduction. 0r <- 0 + 1, 2r <- 2 + 3 0r <- 0r + 2r 2r <- 0r, 1r <- 0r, 3r <- 2r """ a, b, c, d = blobs gpu_a, gpu_b, gpu_c, gpu_d = gpu_indices # a_reduced <- a+b, c_reduced <- c + d a_reduced = net.Add( [a, b], str(a) + reduced_affix, device_option=OnGPU(gpu_a) ) c_reduced = net.Add( [c, d], str(c) + reduced_affix, device_option=OnGPU(gpu_c) ) # a_reduced <- a_reduced + c_reduced a_reduced = a_reduced.Add(c_reduced, a_reduced, device_option=OnGPU(gpu_a)) # broadcast a_reduced to c_reduced c_reduced = a_reduced.Copy([], c_reduced, device_option=OnGPU(gpu_c)) # broadcast to b and d b_reduced = a_reduced.Copy( [], str(b) + reduced_affix, device_option=OnGPU(gpu_b) ) d_reduced = c_reduced.Copy( [], str(d) + reduced_affix, device_option=OnGPU(gpu_d) ) return a_reduced, b_reduced, c_reduced, d_reduced def Allreduce4Group2(net, blobs, reduced_affix, gpu_indices): """Allreduce for 4 gpus where peer access are enabled in {0,1} and {2,3} Algorithm: 2 level reduction. 0r <- 0 + 1, 2r <- 2 + 3 0r <- 0r + 2r 2r <- 0r, 1r <- 0r, 3r <- 2r """ a, b, c, d = blobs gpu_a, gpu_b, gpu_c, gpu_d = gpu_indices # a_reduced <- a+b, c_reduced <- c + d a_reduced = net.Add( [a, b], str(a) + reduced_affix, device_option=OnGPU(gpu_a) ) c_reduced = net.Add( [c, d], str(c) + reduced_affix, device_option=OnGPU(gpu_c) ) # copy from c_reduce(gpu_c) to c_reduce_copy(gpu_a) c_reduced_copy = c_reduced.Copy( [], str(c_reduced) + '_copy', device_option=OnGPU(gpu_a) ) # a_reduced <- a_reduced + c_reduced_copy a_reduced = a_reduced.Add(c_reduced_copy, a_reduced, device_option=OnGPU(gpu_a)) # broadcast a_reduced to c_reduced c_reduced = a_reduced.Copy([], c_reduced, device_option=OnGPU(gpu_c)) # broadcast to b and d b_reduced = a_reduced.Copy( [], str(b) + reduced_affix, device_option=OnGPU(gpu_b) ) d_reduced = c_reduced.Copy( [], str(d) + reduced_affix, device_option=OnGPU(gpu_d) ) return a_reduced, b_reduced, c_reduced, d_reduced def Allreduce8(net, blobs, reduced_affix, gpu_indices): """Allreduce for 8 gpus. Algorithm: 3 level reduction. 0r <- 0 + 1, 2r <- 2 + 3, 4r <- 4 + 5, 6r <- 6 + 7 0r <- 0r + 2r, 4r <- 4r + 6r 0r <- 0r + 4r 4r <- 0r 2r <- 0r, 6r <- 4r 1r <- 0r, 3r <- 2r, 5r <- 4r, 7r <- 6r """ reduced = [None] * 8 # Reduction level 1 for i in [0, 2, 4, 6]: reduced[i] = net.Add( [blobs[i], blobs[i + 1]], blobs[i] + reduced_affix, device_option=OnGPU(gpu_indices[i]) ) # Reduction level 2 for i in [0, 4]: reduced[i] = net.Add( [reduced[i], reduced[i + 2]], str(blobs[i]) + reduced_affix, device_option=OnGPU(gpu_indices[i]) ) # Reduction level 3: this involves a copy. reduced_4_copy = reduced[4].Copy( [], str(reduced[4]) + '_copy', device_option=OnGPU(gpu_indices[0]) ) reduced[0] = reduced[0].Add( reduced_4_copy, reduced[0], device_option=OnGPU(gpu_indices[0]) ) # Broadcast level 1 reduced[4] = reduced[0].Copy( [], reduced[4], device_option=OnGPU(gpu_indices[4]) ) # Broadcast level 2 for i in [2, 6]: reduced[i] = reduced[i - 2].Copy( [], reduced[i], device_option=OnGPU(gpu_indices[i]) ) # Broadcast level 3 for i in [1, 3, 5, 7]: reduced[i] = reduced[i - 1].Copy( [], blobs[i] + reduced_affix, device_option=OnGPU(gpu_indices[i]) ) return reduced def AllreduceFallback(net, blobs, reduced_affix, gpu_indices): """A fallback option for Allreduce with no assumption on p2p. Algorithm: a flat operation on gpu 0 0r <- 0 0r <- 0r + i for i in gpu_indices[1:] ir <- 0r for i in gpu_indices[1:] """ reduced = [None] * len(gpu_indices) if reduced_affix != '': # copy first reduced[0] = net.Copy( blobs[0], blobs[0] + reduced_affix, device_option=OnGPU(gpu_indices[0]) ) else: reduced[0] = blobs[0] # do temp copy and add temp_name = reduced[0] + '_temp_copy' for i in range(1, len(gpu_indices)): temp = net.Copy( blobs[i], temp_name, device_option=OnGPU(gpu_indices[0]) ) reduced[0] = net.Add( [temp, reduced[0]], reduced[0], device_option=OnGPU(gpu_indices[0]) ) # Broadcast to everyone else for i in range(1, len(gpu_indices)): reduced[i] = net.Copy( reduced[0], blobs[i] + reduced_affix, device_option=OnGPU(gpu_indices[i]) ) return reduced