/usr/local/lib64/python3.6/site-packages/caffe2/python/operator_test
NameSizeModeActions
__pycache__/-0755rm
activation_ops_test.py96910644editdlrm
adadelta_test.py79320644editdlrm
adagrad_test.py75860644editdlrm
adagrad_test_helper.py51810644editdlrm
adam_test.py215590644editdlrm
affine_channel_op_test.py37840644editdlrm
alias_with_name_test.py9380644editdlrm
apmeter_test.py27380644editdlrm
arg_ops_test.py19170644editdlrm
assert_test.py7970644editdlrm
async_net_barrier_test.py9460644editdlrm
atomic_ops_test.py41040644editdlrm
basic_rnn_test.py47200644editdlrm
batch_box_cox_test.py50800644editdlrm
batch_bucketize_op_test.py37300644editdlrm
batch_moments_op_test.py27950644editdlrm
batch_sparse_to_dense_op_test.py41990644editdlrm
bbox_transform_test.py122580644editdlrm
bisect_percentile_op_test.py62270644editdlrm
blobs_queue_db_test.py32400644editdlrm
boolean_mask_test.py163890644editdlrm
boolean_unmask_test.py17110644editdlrm
box_with_nms_limit_op_test.py87500644editdlrm
bucketize_op_test.py9300644editdlrm
cast_op_test.py16000644editdlrm
ceil_op_test.py8880644editdlrm
channel_backprop_stats_op_test.py21310644editdlrm
channel_shuffle_test.py17940644editdlrm
channel_stats_op_test.py26390644editdlrm
checkpoint_test.py15000644editdlrm
clip_op_test.py19840644editdlrm
clip_tensor_op_test.py20760644editdlrm
collect_and_distribute_fpn_rpn_proposals_op_test.py112690644editdlrm
concat_op_cost_test.py28580644editdlrm
concat_split_op_test.py72660644editdlrm
conditional_test.py9950644editdlrm
conftest.py14460644editdlrm
conv_test.py324730644editdlrm
conv_transpose_test.py159450644editdlrm
copy_ops_test.py73740644editdlrm
copy_rows_to_tensor_op_test.py25260644editdlrm
cosine_embedding_criterion_op_test.py19530644editdlrm
counter_ops_test.py33480644editdlrm
crf_test.py53150644editdlrm
cross_entropy_ops_test.py100850644editdlrm
ctc_beam_search_decoder_op_test.py51970644editdlrm
ctc_greedy_decoder_op_test.py47430644editdlrm
cudnn_recurrent_test.py58170644editdlrm
dataset_ops_test.py238470644editdlrm
data_couple_op_test.py8580644editdlrm
decay_adagrad_test.py26940644editdlrm
deform_conv_test.py192760644editdlrm
dense_vector_to_id_list_op_test.py20440644editdlrm
depthwise_3x3_conv_test.py18630644editdlrm
detectron_keypoints.py79730644editdlrm
distance_op_test.py43510644editdlrm
dropout_op_test.py29710644editdlrm
duplicate_operands_test.py7340644editdlrm
elementwise_linear_op_test.py13820644editdlrm
elementwise_logical_ops_test.py46170644editdlrm
elementwise_ops_test.py333540644editdlrm
elementwise_op_broadcast_test.py174660644editdlrm
emptysample_ops_test.py19770644editdlrm
enforce_finite_op_test.py12860644editdlrm
ensure_clipped_test.py15050644editdlrm
ensure_cpu_output_op_test.py12440644editdlrm
erf_op_test.py7490644editdlrm
expand_op_test.py21090644editdlrm
fc_operator_test.py37200644editdlrm
feature_maps_ops_test.py214920644editdlrm
filler_ops_test.py84760644editdlrm
find_op_test.py13160644editdlrm
flatten_op_test.py9220644editdlrm
flexible_top_k_test.py26090644editdlrm
floor_op_test.py8940644editdlrm
fused_nbit_rowwise_conversion_ops_test.py140770644editdlrm
fused_nbit_rowwise_test_helper.py26930644editdlrm
gather_ops_test.py92160644editdlrm
gather_ranges_op_test.py91250644editdlrm
given_tensor_byte_string_to_uint8_fill_op_test.py13920644editdlrm
given_tensor_fill_op_test.py15030644editdlrm
glu_op_test.py12120644editdlrm
group_conv_test.py28700644editdlrm
group_norm_op_test.py52520644editdlrm
gru_test.py129320644editdlrm
heatmap_max_keypoint_op_test.py47700644editdlrm
histogram_test.py30970644editdlrm
hsm_test.py94560644editdlrm
hyperbolic_ops_test.py14720644editdlrm
im2col_col2im_test.py43110644editdlrm
image_input_op_test.py173450644editdlrm
index_hash_ops_test.py28850644editdlrm
index_ops_test.py45970644editdlrm
instance_norm_test.py99170644editdlrm
integral_image_ops_test.py34190644editdlrm
jsd_ops_test.py10440644editdlrm
key_split_ops_test.py12890644editdlrm
lars_test.py13540644editdlrm
layer_norm_op_test.py149830644editdlrm
leaky_relu_test.py56390644editdlrm
learning_rate_adaption_op_test.py28370644editdlrm
learning_rate_op_test.py86520644editdlrm
lengths_pad_op_test.py16250644editdlrm
lengths_reducer_fused_nbit_rowwise_ops_test.py154950644editdlrm
lengths_tile_op_test.py13320644editdlrm
lengths_top_k_ops_test.py23710644editdlrm
length_split_op_test.py48680644editdlrm
listwise_l2r_operator_test.py87400644editdlrm
load_save_test.py332410644editdlrm
locally_connected_op_test.py77610644editdlrm
loss_ops_test.py9020644editdlrm
lpnorm_op_test.py27250644editdlrm
map_ops_test.py22490644editdlrm
margin_ranking_criterion_op_test.py18160644editdlrm
math_ops_test.py16030644editdlrm
matmul_op_test.py100960644editdlrm
mean_op_test.py14690644editdlrm
merge_id_lists_op_test.py29890644editdlrm
mkl_conv_op_test.py15470644editdlrm
mkl_packed_fc_op_test.py26470644editdlrm
mod_op_test.py14590644editdlrm
moments_op_test.py17220644editdlrm
momentum_sgd_test.py64800644editdlrm
mpi_test.py81540644editdlrm
mul_gradient_benchmark.py15090644editdlrm
negate_gradient_op_test.py15180644editdlrm
ngram_ops_test.py23270644editdlrm
normalize_op_test.py16790644editdlrm
numpy_tile_op_test.py19240644editdlrm
one_hot_ops_test.py74780644editdlrm
onnx_while_test.py30700644editdlrm
order_switch_test.py13060644editdlrm
pack_ops_test.py126340644editdlrm
pack_rnn_sequence_op_test.py28910644editdlrm
pad_test.py13770644editdlrm
partition_ops_test.py68380644editdlrm
percentile_op_test.py44270644editdlrm
piecewise_linear_transform_test.py61870644editdlrm
pooling_test.py165080644editdlrm
prepend_dim_test.py15050644editdlrm
python_op_test.py13120644editdlrm
quantile_test.py32760644editdlrm
rand_quantization_op_speed_test.py31280644editdlrm
rank_loss_operator_test.py57520644editdlrm
rebatching_queue_test.py90470644editdlrm
record_queue_test.py31250644editdlrm
recurrent_network_test.py140480644editdlrm
recurrent_net_executor_test.py109220644editdlrm
reduce_ops_test.py173410644editdlrm
reduction_ops_test.py46640644editdlrm
reshape_ops_test.py82110644editdlrm
resize_op_test.py94170644editdlrm
rmac_regions_op_test.py31780644editdlrm
rms_norm_op_test.py13250644editdlrm
rnn_cell_test.py597070644editdlrm
roi_align_rotated_op_test.py75670644editdlrm
rowwise_counter_test.py22050644editdlrm
scale_op_test.py21770644editdlrm
segment_ops_test.py257450644editdlrm
self_binning_histogram_test.py129150644editdlrm
selu_op_test.py32320644editdlrm
sequence_ops_test.py160000644editdlrm
shape_inference_test.py257080644editdlrm
sinusoid_position_encoding_op_test.py23080644editdlrm
softmax_ops_test.py236850644editdlrm
softplus_op_test.py5160644editdlrm
sparse_dropout_with_replacement_op_test.py28850644editdlrm
sparse_gradient_checker_test.py12940644editdlrm
sparse_itemwise_dropout_with_replacement_op_test.py29130644editdlrm
sparse_lengths_sum_benchmark.py41590644editdlrm
sparse_lp_regularizer_test.py25530644editdlrm
sparse_normalize_test.py31360644editdlrm
sparse_ops_test.py34690644editdlrm
sparse_to_dense_mask_op_test.py36930644editdlrm
spatial_bn_op_test.py201820644editdlrm
specialized_segment_ops_test.py117750644editdlrm
split_op_cost_test.py86450644editdlrm
square_root_divide_op_test.py21790644editdlrm
stats_ops_test.py17890644editdlrm
stats_put_ops_test.py65960644editdlrm
storm_test.py65070644editdlrm
string_ops_test.py41540644editdlrm
text_file_reader_test.py25170644editdlrm
thresholded_relu_op_test.py23230644editdlrm
tile_op_test.py38870644editdlrm
top_k_test.py91130644editdlrm
torch_integration_test.py399410644editdlrm
transpose_op_test.py27220644editdlrm
trigonometric_op_test.py17150644editdlrm
unique_ops_test.py22550644editdlrm
unique_uniform_fill_op_test.py13350644editdlrm
unsafe_coalesce_test.py29400644editdlrm
upsample_op_test.py73080644editdlrm
utility_ops_test.py150540644editdlrm
video_input_op_test.py105030644editdlrm
weighted_multi_sample_test.py19970644editdlrm
weighted_sample_test.py27390644editdlrm
weighted_sum_test.py30520644editdlrm
weight_scale_test.py20570644editdlrm
wngrad_test.py82790644editdlrm
__init__.py00644editdlrm
Edit: /usr/local/lib64/python3.6/site-packages/caffe2/python/operator_test/adam_test.py (21559B)
import functools import hypothesis from hypothesis import given import hypothesis.strategies as st import numpy as np from caffe2.python import core import caffe2.python.hypothesis_test_util as hu class TestAdam(hu.HypothesisTestCase): @staticmethod def ref_adam(param, mom1, mom2, grad, LR, ITER, beta1, beta2, epsilon, output_grad=False): t = ITER + 1 corrected_local_rate = np.sqrt(1 - np.power(beta2, t)) / \ (1 - np.power(beta1, t)) mom1_out = (beta1 * mom1) + (1 - beta1) * grad mom2_out = (beta2 * mom2) + (1 - beta2) * np.square(grad) grad_out = corrected_local_rate * mom1_out / \ (np.sqrt(mom2_out) + epsilon) param_out = param + LR * grad_out if output_grad: return param_out, mom1_out, mom2_out, grad_out else: return param_out, mom1_out, mom2_out @staticmethod def ref_smart_decay_adam(param, mom1, mom2, last_seen, grad, LR, ITER, beta1, beta2, epsilon): for name in ('param', 'mom1', 'mom2', 'last_seen', 'grad', 'LR', 'ITER', 'beta1', 'beta2', 'epsilon'): print("{} {} {}".format(name, locals()['name'], type(locals()['name']))) t = ITER + 1 k = t - last_seen k = k.flatten()[0] last_seen_out = t * np.ones_like(last_seen) # Make up for lost minibatches. mom2_out = (beta2**k * mom2) + (1 - beta2) * np.square(grad) param_out = param mom1_out = mom1 # For catchup assert k >= 1 for i in range(k): mom1_out *= beta1 if i == k - 1: mom1_out += grad * (1 - beta1) param_out += LR * mom1_out / (np.sqrt(mom2_out) + epsilon) grad_out = mom1_out / (np.sqrt(mom2_out) + epsilon) return param_out, mom1_out, mom2_out, last_seen_out @staticmethod def ref_row_wise_adam(param, mom1, mom2, grad, LR, ITER, beta1, beta2, epsilon, output_grad=False): t = ITER + 1 corrected_local_rate = np.sqrt(1 - np.power(beta2, t)) / \ (1 - np.power(beta1, t)) mom1_out = (beta1 * mom1) + (1 - beta1) * grad mom2_out = (beta2 * mom2) + (1 - beta2) * np.mean(np.square(grad)) grad_out = corrected_local_rate * mom1_out / (np.sqrt(mom2_out) + epsilon) param_out = param + LR * grad_out if output_grad: return param_out, mom1_out, mom2_out, grad_out else: return param_out, mom1_out, mom2_out @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), **hu.gcs) def test_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.abs(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) op = core.CreateOperator( "Adam", ["param", "mom1", "mom2", "grad", "lr", "iter"], ["output_param", "output_mom1", "output_mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, grad, LR, ITER], functools.partial( self.ref_adam, beta1=beta1, beta2=beta2, epsilon=epsilon), input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), **hu.gcs_cpu_only) def test_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.abs(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) op = core.CreateOperator( "Adam", ["param", "mom1", "mom2", "grad", "lr", "iter"], ["output_param", "output_mom1", "output_mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, grad, LR, ITER], functools.partial( self.ref_adam, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse(param, mom1, mom2, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index] = \ self.ref_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], ref_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10), LR=st.floats(min_value=0.000001, max_value=0.1, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.0, max_value=0.99999, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.9, max_value=0.999999, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.00001, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_smart_decay_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) _iter, _lr = ITER, LR # Keep the scalar types for reference ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Here we will define the last_seen tensor as being randomly from 0 to ITER # (the value of t to be tested will be ITER+1) last_seen = data_strategy.draw( hypothesis.extra.numpy.arrays( dtype=np.int64, shape=(param.shape[0],), elements=st.integers(min_value=0, max_value=_iter), unique=False, ) ) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SmartDecaySparseAdam", ["param", "mom1", "mom2", "last_seen", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "last_seen"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse(param, mom1, mom2, last_seen, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) last_seen_out = np.copy(last_seen) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], last_seen_out[index] = \ self.ref_smart_decay_adam(param[index], mom1[index], mom2[index], last_seen[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out, last_seen_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, last_seen, indices, grad, LR, ITER], ref_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_sparse_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse_output_grad(param, mom1, mom2, indices, grad, LR, ITER, beta1, beta2, epsilon, output_grad): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) grad_out = np.copy(grad) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], grad_out[i] = \ self.ref_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon, output_grad) return (param_out, mom1_out, mom2_out, grad_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], functools.partial( ref_sparse_output_grad, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) @given(inputs=hu.tensors(n=3), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_row_wise_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, grad = inputs ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create a 1D row-wise average 2nd moment tensor. mom2 = data_strategy.draw( hu.tensor1d(min_len=param.shape[0], max_len=param.shape[0], elements=hu.elements_of_type(dtype=np.float32)) ) mom2 = np.absolute(mom2) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Note that unlike SparseAdam, RowWiseSparseAdam uses a moment # tensor that is strictly 1-dimensional and equal in length to the # first dimension of the parameters, so indices must also be # 1-dimensional. indices = indices.flatten() hypothesis.note('indices.shape: %s' % str(indices.shape)) # Verify that the generated indices are unique hypothesis.assume(np.array_equal(np.unique(indices), np.sort(indices))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "RowWiseSparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_row_wise_sparse(param, mom1, mom2, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index] = \ self.ref_row_wise_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertDeviceChecks( dc, op, [param, mom1, mom2, indices, grad, LR, ITER], [0, 1, 2], input_device_options=input_device_options) self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], ref_row_wise_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=3), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_row_wise_sparse_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, grad = inputs ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create a 1D row-wise average 2nd moment tensor. mom2 = data_strategy.draw( hu.tensor1d(min_len=param.shape[0], max_len=param.shape[0], elements=hu.elements_of_type(dtype=np.float32)) ) mom2 = np.absolute(mom2) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Note that unlike SparseAdam, RowWiseSparseAdam uses a moment # tensor that is strictly 1-dimensional and equal in length to the # first dimension of the parameters, so indices must also be # 1-dimensional. indices = indices.flatten() hypothesis.note('indices.shape: %s' % str(indices.shape)) # Verify that the generated indices are unique hypothesis.assume(np.array_equal(np.unique(indices), np.sort(indices))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "RowWiseSparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_row_wise_sparse_output_grad(param, mom1, mom2, indices, grad, LR, ITER, beta1, beta2, epsilon, output_grad): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) grad_out = np.copy(grad) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], grad_out[i] = \ self.ref_row_wise_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon, output_grad) return (param_out, mom1_out, mom2_out, grad_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertDeviceChecks( dc, op, [param, mom1, mom2, indices, grad, LR, ITER], [0, 1, 2, 3], input_device_options=input_device_options) self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], functools.partial( ref_row_wise_sparse_output_grad, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) if __name__ == "__main__": import unittest unittest.main()