/
usr
/
local
/
lib64
/
python3.6
/
site-packages
/
caffe2
/
python
/
operator_test
/
/usr/local/lib64/python3.6/site-packages/caffe2/python/operator_test
mkdir
upload
Name
Size
Mode
Actions
__pycache__/
-
0755
rm
activation_ops_test.py
9691
0644
edit
dl
rm
adadelta_test.py
7932
0644
edit
dl
rm
adagrad_test.py
7586
0644
edit
dl
rm
adagrad_test_helper.py
5181
0644
edit
dl
rm
adam_test.py
21559
0644
edit
dl
rm
affine_channel_op_test.py
3784
0644
edit
dl
rm
alias_with_name_test.py
938
0644
edit
dl
rm
apmeter_test.py
2738
0644
edit
dl
rm
arg_ops_test.py
1917
0644
edit
dl
rm
assert_test.py
797
0644
edit
dl
rm
async_net_barrier_test.py
946
0644
edit
dl
rm
atomic_ops_test.py
4104
0644
edit
dl
rm
basic_rnn_test.py
4720
0644
edit
dl
rm
batch_box_cox_test.py
5080
0644
edit
dl
rm
batch_bucketize_op_test.py
3730
0644
edit
dl
rm
batch_moments_op_test.py
2795
0644
edit
dl
rm
batch_sparse_to_dense_op_test.py
4199
0644
edit
dl
rm
bbox_transform_test.py
12258
0644
edit
dl
rm
bisect_percentile_op_test.py
6227
0644
edit
dl
rm
blobs_queue_db_test.py
3240
0644
edit
dl
rm
boolean_mask_test.py
16389
0644
edit
dl
rm
boolean_unmask_test.py
1711
0644
edit
dl
rm
box_with_nms_limit_op_test.py
8750
0644
edit
dl
rm
bucketize_op_test.py
930
0644
edit
dl
rm
cast_op_test.py
1600
0644
edit
dl
rm
ceil_op_test.py
888
0644
edit
dl
rm
channel_backprop_stats_op_test.py
2131
0644
edit
dl
rm
channel_shuffle_test.py
1794
0644
edit
dl
rm
channel_stats_op_test.py
2639
0644
edit
dl
rm
checkpoint_test.py
1500
0644
edit
dl
rm
clip_op_test.py
1984
0644
edit
dl
rm
clip_tensor_op_test.py
2076
0644
edit
dl
rm
collect_and_distribute_fpn_rpn_proposals_op_test.py
11269
0644
edit
dl
rm
concat_op_cost_test.py
2858
0644
edit
dl
rm
concat_split_op_test.py
7266
0644
edit
dl
rm
conditional_test.py
995
0644
edit
dl
rm
conftest.py
1446
0644
edit
dl
rm
conv_test.py
32473
0644
edit
dl
rm
conv_transpose_test.py
15945
0644
edit
dl
rm
copy_ops_test.py
7374
0644
edit
dl
rm
copy_rows_to_tensor_op_test.py
2526
0644
edit
dl
rm
cosine_embedding_criterion_op_test.py
1953
0644
edit
dl
rm
counter_ops_test.py
3348
0644
edit
dl
rm
crf_test.py
5315
0644
edit
dl
rm
cross_entropy_ops_test.py
10085
0644
edit
dl
rm
ctc_beam_search_decoder_op_test.py
5197
0644
edit
dl
rm
ctc_greedy_decoder_op_test.py
4743
0644
edit
dl
rm
cudnn_recurrent_test.py
5817
0644
edit
dl
rm
dataset_ops_test.py
23847
0644
edit
dl
rm
data_couple_op_test.py
858
0644
edit
dl
rm
decay_adagrad_test.py
2694
0644
edit
dl
rm
deform_conv_test.py
19276
0644
edit
dl
rm
dense_vector_to_id_list_op_test.py
2044
0644
edit
dl
rm
depthwise_3x3_conv_test.py
1863
0644
edit
dl
rm
detectron_keypoints.py
7973
0644
edit
dl
rm
distance_op_test.py
4351
0644
edit
dl
rm
dropout_op_test.py
2971
0644
edit
dl
rm
duplicate_operands_test.py
734
0644
edit
dl
rm
elementwise_linear_op_test.py
1382
0644
edit
dl
rm
elementwise_logical_ops_test.py
4617
0644
edit
dl
rm
elementwise_ops_test.py
33354
0644
edit
dl
rm
elementwise_op_broadcast_test.py
17466
0644
edit
dl
rm
emptysample_ops_test.py
1977
0644
edit
dl
rm
enforce_finite_op_test.py
1286
0644
edit
dl
rm
ensure_clipped_test.py
1505
0644
edit
dl
rm
ensure_cpu_output_op_test.py
1244
0644
edit
dl
rm
erf_op_test.py
749
0644
edit
dl
rm
expand_op_test.py
2109
0644
edit
dl
rm
fc_operator_test.py
3720
0644
edit
dl
rm
feature_maps_ops_test.py
21492
0644
edit
dl
rm
filler_ops_test.py
8476
0644
edit
dl
rm
find_op_test.py
1316
0644
edit
dl
rm
flatten_op_test.py
922
0644
edit
dl
rm
flexible_top_k_test.py
2609
0644
edit
dl
rm
floor_op_test.py
894
0644
edit
dl
rm
fused_nbit_rowwise_conversion_ops_test.py
14077
0644
edit
dl
rm
fused_nbit_rowwise_test_helper.py
2693
0644
edit
dl
rm
gather_ops_test.py
9216
0644
edit
dl
rm
gather_ranges_op_test.py
9125
0644
edit
dl
rm
given_tensor_byte_string_to_uint8_fill_op_test.py
1392
0644
edit
dl
rm
given_tensor_fill_op_test.py
1503
0644
edit
dl
rm
glu_op_test.py
1212
0644
edit
dl
rm
group_conv_test.py
2870
0644
edit
dl
rm
group_norm_op_test.py
5252
0644
edit
dl
rm
gru_test.py
12932
0644
edit
dl
rm
heatmap_max_keypoint_op_test.py
4770
0644
edit
dl
rm
histogram_test.py
3097
0644
edit
dl
rm
hsm_test.py
9456
0644
edit
dl
rm
hyperbolic_ops_test.py
1472
0644
edit
dl
rm
im2col_col2im_test.py
4311
0644
edit
dl
rm
image_input_op_test.py
17345
0644
edit
dl
rm
index_hash_ops_test.py
2885
0644
edit
dl
rm
index_ops_test.py
4597
0644
edit
dl
rm
instance_norm_test.py
9917
0644
edit
dl
rm
integral_image_ops_test.py
3419
0644
edit
dl
rm
jsd_ops_test.py
1044
0644
edit
dl
rm
key_split_ops_test.py
1289
0644
edit
dl
rm
lars_test.py
1354
0644
edit
dl
rm
layer_norm_op_test.py
14983
0644
edit
dl
rm
leaky_relu_test.py
5639
0644
edit
dl
rm
learning_rate_adaption_op_test.py
2837
0644
edit
dl
rm
learning_rate_op_test.py
8652
0644
edit
dl
rm
lengths_pad_op_test.py
1625
0644
edit
dl
rm
lengths_reducer_fused_nbit_rowwise_ops_test.py
15495
0644
edit
dl
rm
lengths_tile_op_test.py
1332
0644
edit
dl
rm
lengths_top_k_ops_test.py
2371
0644
edit
dl
rm
length_split_op_test.py
4868
0644
edit
dl
rm
listwise_l2r_operator_test.py
8740
0644
edit
dl
rm
load_save_test.py
33241
0644
edit
dl
rm
locally_connected_op_test.py
7761
0644
edit
dl
rm
loss_ops_test.py
902
0644
edit
dl
rm
lpnorm_op_test.py
2725
0644
edit
dl
rm
map_ops_test.py
2249
0644
edit
dl
rm
margin_ranking_criterion_op_test.py
1816
0644
edit
dl
rm
math_ops_test.py
1603
0644
edit
dl
rm
matmul_op_test.py
10096
0644
edit
dl
rm
mean_op_test.py
1469
0644
edit
dl
rm
merge_id_lists_op_test.py
2989
0644
edit
dl
rm
mkl_conv_op_test.py
1547
0644
edit
dl
rm
mkl_packed_fc_op_test.py
2647
0644
edit
dl
rm
mod_op_test.py
1459
0644
edit
dl
rm
moments_op_test.py
1722
0644
edit
dl
rm
momentum_sgd_test.py
6480
0644
edit
dl
rm
mpi_test.py
8154
0644
edit
dl
rm
mul_gradient_benchmark.py
1509
0644
edit
dl
rm
negate_gradient_op_test.py
1518
0644
edit
dl
rm
ngram_ops_test.py
2327
0644
edit
dl
rm
normalize_op_test.py
1679
0644
edit
dl
rm
numpy_tile_op_test.py
1924
0644
edit
dl
rm
one_hot_ops_test.py
7478
0644
edit
dl
rm
onnx_while_test.py
3070
0644
edit
dl
rm
order_switch_test.py
1306
0644
edit
dl
rm
pack_ops_test.py
12634
0644
edit
dl
rm
pack_rnn_sequence_op_test.py
2891
0644
edit
dl
rm
pad_test.py
1377
0644
edit
dl
rm
partition_ops_test.py
6838
0644
edit
dl
rm
percentile_op_test.py
4427
0644
edit
dl
rm
piecewise_linear_transform_test.py
6187
0644
edit
dl
rm
pooling_test.py
16508
0644
edit
dl
rm
prepend_dim_test.py
1505
0644
edit
dl
rm
python_op_test.py
1312
0644
edit
dl
rm
quantile_test.py
3276
0644
edit
dl
rm
rand_quantization_op_speed_test.py
3128
0644
edit
dl
rm
rank_loss_operator_test.py
5752
0644
edit
dl
rm
rebatching_queue_test.py
9047
0644
edit
dl
rm
record_queue_test.py
3125
0644
edit
dl
rm
recurrent_network_test.py
14048
0644
edit
dl
rm
recurrent_net_executor_test.py
10922
0644
edit
dl
rm
reduce_ops_test.py
17341
0644
edit
dl
rm
reduction_ops_test.py
4664
0644
edit
dl
rm
reshape_ops_test.py
8211
0644
edit
dl
rm
resize_op_test.py
9417
0644
edit
dl
rm
rmac_regions_op_test.py
3178
0644
edit
dl
rm
rms_norm_op_test.py
1325
0644
edit
dl
rm
rnn_cell_test.py
59707
0644
edit
dl
rm
roi_align_rotated_op_test.py
7567
0644
edit
dl
rm
rowwise_counter_test.py
2205
0644
edit
dl
rm
scale_op_test.py
2177
0644
edit
dl
rm
segment_ops_test.py
25745
0644
edit
dl
rm
self_binning_histogram_test.py
12915
0644
edit
dl
rm
selu_op_test.py
3232
0644
edit
dl
rm
sequence_ops_test.py
16000
0644
edit
dl
rm
shape_inference_test.py
25708
0644
edit
dl
rm
sinusoid_position_encoding_op_test.py
2308
0644
edit
dl
rm
softmax_ops_test.py
23685
0644
edit
dl
rm
softplus_op_test.py
516
0644
edit
dl
rm
sparse_dropout_with_replacement_op_test.py
2885
0644
edit
dl
rm
sparse_gradient_checker_test.py
1294
0644
edit
dl
rm
sparse_itemwise_dropout_with_replacement_op_test.py
2913
0644
edit
dl
rm
sparse_lengths_sum_benchmark.py
4159
0644
edit
dl
rm
sparse_lp_regularizer_test.py
2553
0644
edit
dl
rm
sparse_normalize_test.py
3136
0644
edit
dl
rm
sparse_ops_test.py
3469
0644
edit
dl
rm
sparse_to_dense_mask_op_test.py
3693
0644
edit
dl
rm
spatial_bn_op_test.py
20182
0644
edit
dl
rm
specialized_segment_ops_test.py
11775
0644
edit
dl
rm
split_op_cost_test.py
8645
0644
edit
dl
rm
square_root_divide_op_test.py
2179
0644
edit
dl
rm
stats_ops_test.py
1789
0644
edit
dl
rm
stats_put_ops_test.py
6596
0644
edit
dl
rm
storm_test.py
6507
0644
edit
dl
rm
string_ops_test.py
4154
0644
edit
dl
rm
text_file_reader_test.py
2517
0644
edit
dl
rm
thresholded_relu_op_test.py
2323
0644
edit
dl
rm
tile_op_test.py
3887
0644
edit
dl
rm
top_k_test.py
9113
0644
edit
dl
rm
torch_integration_test.py
39941
0644
edit
dl
rm
transpose_op_test.py
2722
0644
edit
dl
rm
trigonometric_op_test.py
1715
0644
edit
dl
rm
unique_ops_test.py
2255
0644
edit
dl
rm
unique_uniform_fill_op_test.py
1335
0644
edit
dl
rm
unsafe_coalesce_test.py
2940
0644
edit
dl
rm
upsample_op_test.py
7308
0644
edit
dl
rm
utility_ops_test.py
15054
0644
edit
dl
rm
video_input_op_test.py
10503
0644
edit
dl
rm
weighted_multi_sample_test.py
1997
0644
edit
dl
rm
weighted_sample_test.py
2739
0644
edit
dl
rm
weighted_sum_test.py
3052
0644
edit
dl
rm
weight_scale_test.py
2057
0644
edit
dl
rm
wngrad_test.py
8279
0644
edit
dl
rm
__init__.py
0
0644
edit
dl
rm
Edit:
/usr/local/lib64/python3.6/site-packages/caffe2/python/operator_test/adam_test.py
(21559B)
import functools import hypothesis from hypothesis import given import hypothesis.strategies as st import numpy as np from caffe2.python import core import caffe2.python.hypothesis_test_util as hu class TestAdam(hu.HypothesisTestCase): @staticmethod def ref_adam(param, mom1, mom2, grad, LR, ITER, beta1, beta2, epsilon, output_grad=False): t = ITER + 1 corrected_local_rate = np.sqrt(1 - np.power(beta2, t)) / \ (1 - np.power(beta1, t)) mom1_out = (beta1 * mom1) + (1 - beta1) * grad mom2_out = (beta2 * mom2) + (1 - beta2) * np.square(grad) grad_out = corrected_local_rate * mom1_out / \ (np.sqrt(mom2_out) + epsilon) param_out = param + LR * grad_out if output_grad: return param_out, mom1_out, mom2_out, grad_out else: return param_out, mom1_out, mom2_out @staticmethod def ref_smart_decay_adam(param, mom1, mom2, last_seen, grad, LR, ITER, beta1, beta2, epsilon): for name in ('param', 'mom1', 'mom2', 'last_seen', 'grad', 'LR', 'ITER', 'beta1', 'beta2', 'epsilon'): print("{} {} {}".format(name, locals()['name'], type(locals()['name']))) t = ITER + 1 k = t - last_seen k = k.flatten()[0] last_seen_out = t * np.ones_like(last_seen) # Make up for lost minibatches. mom2_out = (beta2**k * mom2) + (1 - beta2) * np.square(grad) param_out = param mom1_out = mom1 # For catchup assert k >= 1 for i in range(k): mom1_out *= beta1 if i == k - 1: mom1_out += grad * (1 - beta1) param_out += LR * mom1_out / (np.sqrt(mom2_out) + epsilon) grad_out = mom1_out / (np.sqrt(mom2_out) + epsilon) return param_out, mom1_out, mom2_out, last_seen_out @staticmethod def ref_row_wise_adam(param, mom1, mom2, grad, LR, ITER, beta1, beta2, epsilon, output_grad=False): t = ITER + 1 corrected_local_rate = np.sqrt(1 - np.power(beta2, t)) / \ (1 - np.power(beta1, t)) mom1_out = (beta1 * mom1) + (1 - beta1) * grad mom2_out = (beta2 * mom2) + (1 - beta2) * np.mean(np.square(grad)) grad_out = corrected_local_rate * mom1_out / (np.sqrt(mom2_out) + epsilon) param_out = param + LR * grad_out if output_grad: return param_out, mom1_out, mom2_out, grad_out else: return param_out, mom1_out, mom2_out @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), **hu.gcs) def test_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.abs(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) op = core.CreateOperator( "Adam", ["param", "mom1", "mom2", "grad", "lr", "iter"], ["output_param", "output_mom1", "output_mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, grad, LR, ITER], functools.partial( self.ref_adam, beta1=beta1, beta2=beta2, epsilon=epsilon), input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), **hu.gcs_cpu_only) def test_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.abs(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) op = core.CreateOperator( "Adam", ["param", "mom1", "mom2", "grad", "lr", "iter"], ["output_param", "output_mom1", "output_mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, grad, LR, ITER], functools.partial( self.ref_adam, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse(param, mom1, mom2, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index] = \ self.ref_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], ref_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10), LR=st.floats(min_value=0.000001, max_value=0.1, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.0, max_value=0.99999, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.9, max_value=0.999999, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.00001, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_smart_decay_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) _iter, _lr = ITER, LR # Keep the scalar types for reference ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Here we will define the last_seen tensor as being randomly from 0 to ITER # (the value of t to be tested will be ITER+1) last_seen = data_strategy.draw( hypothesis.extra.numpy.arrays( dtype=np.int64, shape=(param.shape[0],), elements=st.integers(min_value=0, max_value=_iter), unique=False, ) ) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SmartDecaySparseAdam", ["param", "mom1", "mom2", "last_seen", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "last_seen"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse(param, mom1, mom2, last_seen, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) last_seen_out = np.copy(last_seen) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], last_seen_out[index] = \ self.ref_smart_decay_adam(param[index], mom1[index], mom2[index], last_seen[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out, last_seen_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, last_seen, indices, grad, LR, ITER], ref_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=4), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_sparse_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, mom2, grad = inputs mom2 = np.absolute(mom2) ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Verify that the generated indices are unique hypothesis.assume( np.array_equal( np.unique(indices.flatten()), np.sort(indices.flatten()))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "SparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_sparse_output_grad(param, mom1, mom2, indices, grad, LR, ITER, beta1, beta2, epsilon, output_grad): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) grad_out = np.copy(grad) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], grad_out[i] = \ self.ref_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon, output_grad) return (param_out, mom1_out, mom2_out, grad_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], functools.partial( ref_sparse_output_grad, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) @given(inputs=hu.tensors(n=3), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_row_wise_sparse_adam(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, grad = inputs ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create a 1D row-wise average 2nd moment tensor. mom2 = data_strategy.draw( hu.tensor1d(min_len=param.shape[0], max_len=param.shape[0], elements=hu.elements_of_type(dtype=np.float32)) ) mom2 = np.absolute(mom2) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Note that unlike SparseAdam, RowWiseSparseAdam uses a moment # tensor that is strictly 1-dimensional and equal in length to the # first dimension of the parameters, so indices must also be # 1-dimensional. indices = indices.flatten() hypothesis.note('indices.shape: %s' % str(indices.shape)) # Verify that the generated indices are unique hypothesis.assume(np.array_equal(np.unique(indices), np.sort(indices))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "RowWiseSparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_row_wise_sparse(param, mom1, mom2, indices, grad, LR, ITER): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index] = \ self.ref_row_wise_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon) return (param_out, mom1_out, mom2_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertDeviceChecks( dc, op, [param, mom1, mom2, indices, grad, LR, ITER], [0, 1, 2], input_device_options=input_device_options) self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], ref_row_wise_sparse, input_device_options=input_device_options) @given(inputs=hu.tensors(n=3), ITER=st.integers(min_value=0, max_value=10000), LR=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta1=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), beta2=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), epsilon=st.floats(min_value=0.01, max_value=0.99, allow_nan=False, allow_infinity=False), data_strategy=st.data(), **hu.gcs) def test_row_wise_sparse_adam_output_grad(self, inputs, ITER, LR, beta1, beta2, epsilon, data_strategy, gc, dc): param, mom1, grad = inputs ITER = np.array([ITER], dtype=np.int64) LR = np.array([LR], dtype=np.float32) # Create a 1D row-wise average 2nd moment tensor. mom2 = data_strategy.draw( hu.tensor1d(min_len=param.shape[0], max_len=param.shape[0], elements=hu.elements_of_type(dtype=np.float32)) ) mom2 = np.absolute(mom2) # Create an indexing array containing values which index into grad indices = data_strategy.draw( hu.tensor( max_dim=1, min_value=1, max_value=grad.shape[0], dtype=np.int64, elements=st.sampled_from(np.arange(grad.shape[0])), ), ) # Note that unlike SparseAdam, RowWiseSparseAdam uses a moment # tensor that is strictly 1-dimensional and equal in length to the # first dimension of the parameters, so indices must also be # 1-dimensional. indices = indices.flatten() hypothesis.note('indices.shape: %s' % str(indices.shape)) # Verify that the generated indices are unique hypothesis.assume(np.array_equal(np.unique(indices), np.sort(indices))) # Sparsify grad grad = grad[indices] op = core.CreateOperator( "RowWiseSparseAdam", ["param", "mom1", "mom2", "indices", "grad", "lr", "iter"], ["param", "mom1", "mom2", "output_grad"], beta1=beta1, beta2=beta2, epsilon=epsilon) def ref_row_wise_sparse_output_grad(param, mom1, mom2, indices, grad, LR, ITER, beta1, beta2, epsilon, output_grad): param_out = np.copy(param) mom1_out = np.copy(mom1) mom2_out = np.copy(mom2) grad_out = np.copy(grad) for i, index in enumerate(indices): param_out[index], mom1_out[index], mom2_out[index], grad_out[i] = \ self.ref_row_wise_adam(param[index], mom1[index], mom2[index], grad[i], LR, ITER, beta1, beta2, epsilon, output_grad) return (param_out, mom1_out, mom2_out, grad_out) # Iter lives on the CPU input_device_options = {'iter': hu.cpu_do} self.assertDeviceChecks( dc, op, [param, mom1, mom2, indices, grad, LR, ITER], [0, 1, 2, 3], input_device_options=input_device_options) self.assertReferenceChecks( gc, op, [param, mom1, mom2, indices, grad, LR, ITER], functools.partial( ref_row_wise_sparse_output_grad, beta1=beta1, beta2=beta2, epsilon=epsilon, output_grad=True), input_device_options=input_device_options) if __name__ == "__main__": import unittest unittest.main()
Save
cmd:
run