/usr/local/lib64/python3.6/site-packages/torch/include/caffe2/sgd
NameSizeModeActions
adadelta_op.h58520644editdlrm
adagrad_fused.h166320644editdlrm
adagrad_op.h179930644editdlrm
adam_op.h261650644editdlrm
clip_tensor_op.h18530644editdlrm
decay_adagrad_op.h32150644editdlrm
fp16_momentum_sgd_op.h22920644editdlrm
fp32_momentum_sgd_op.h20150644editdlrm
ftrl_op.h22190644editdlrm
gftrl_op.h10280644editdlrm
iter_op.h33790644editdlrm
lars_op.h24790644editdlrm
learning_rate_adaption_op.h19740644editdlrm
learning_rate_functors.h151350644editdlrm
learning_rate_op.h126960644editdlrm
math_lp.h6550644editdlrm
momentum_sgd_op.h60350644editdlrm
rmsprop_op.h19800644editdlrm
rowwise_adagrad_fused.h295950644editdlrm
rowwise_counter.h20830644editdlrm
storm_op.h59150644editdlrm
weight_scale_op.h25520644editdlrm
wngrad_op.h72720644editdlrm
yellowfin_op.h102840644editdlrm
Edit: /usr/local/lib64/python3.6/site-packages/torch/include/caffe2/sgd/decay_adagrad_op.h (3215B)
#pragma once #include "caffe2/core/operator.h" #include "caffe2/utils/eigen_utils.h" namespace caffe2 { template void decay_adagrad_compute( int N, const float* w, const float* g, const float* m, const float* v, float* nw, float* nm, float* nv, float beta1, float beta2, float eps_hat, float weight_decay, float c, const float* lr, Context* /*context*/) { ConstEigenVectorArrayMap w_arr(w, N); ConstEigenVectorArrayMap g_arr(g, N); ConstEigenVectorArrayMap m_arr(m, N); ConstEigenVectorArrayMap v_arr(v, N); EigenVectorArrayMap nw_arr(nw, N); EigenVectorArrayMap nm_arr(nm, N); EigenVectorArrayMap nv_arr(nv, N); nm_arr = m_arr * beta1 + g_arr * (1.0f - beta1); nv_arr = v_arr + g_arr.square(); nw_arr = w_arr + *lr * (nm_arr / c / (nv_arr.sqrt() + eps_hat) + weight_decay * w_arr); } template class DecayAdagradOp final : public Operator { public: USE_OPERATOR_CONTEXT_FUNCTIONS; DecayAdagradOp(const OperatorDef& operator_def, Workspace* ws) : Operator(operator_def, ws), beta1_(this->template GetSingleArgument("beta1", 0.9f)), beta2_(this->template GetSingleArgument("beta2", 0.999f)), epsilon_(this->template GetSingleArgument("epsilon", 1e-5f)), weight_decay_(this->template GetSingleArgument("weight_decay", 0.0f)), bias_correction_first_(this->template GetSingleArgument("bias_correction_first", true)) {} bool RunOnDevice() override { // Iter live on the CPU CAFFE_ENFORCE(OperatorBase::InputIsTensorType(ITER, CPU)); CAFFE_ENFORCE(Input(LR).numel() == 1); CAFFE_ENFORCE(Input(GRAD).numel() == Input(PARAM).numel()); CAFFE_ENFORCE(Input(GRAD).numel() == Input(MOMENT_1).numel()); CAFFE_ENFORCE(Input(GRAD).numel() == Input(MOMENT_2).numel()); Output(OUTPUT_PARAM)->ResizeLike(Input(PARAM)); Output(OUTPUT_MOMENT_1)->ResizeLike(Input(MOMENT_1)); Output(OUTPUT_MOMENT_2)->ResizeLike(Input(MOMENT_2)); const auto iter = OperatorBase::Input(ITER, CPU).template data()[0]; const auto t = iter + 1; const auto c = (bias_correction_first_)? (T(1.) - std::pow(beta1_, t)) : 1.0; decay_adagrad_compute( Input(GRAD).numel(), Input(PARAM).template data(), Input(GRAD).template data(), Input(MOMENT_1).template data(), Input(MOMENT_2).template data(), Output(OUTPUT_PARAM)->template mutable_data(), Output(OUTPUT_MOMENT_1)->template mutable_data(), Output(OUTPUT_MOMENT_2)->template mutable_data(), beta1_, beta2_, epsilon_, weight_decay_, c, Input(LR).template data(), &context_); return true; } protected: T beta1_{0.9}; T beta2_{0.999}; T epsilon_{1e-8}; T weight_decay_{0.0}; bool bias_correction_first_{true}; INPUT_TAGS(PARAM, MOMENT_1, MOMENT_2, GRAD, LR, ITER); OUTPUT_TAGS(OUTPUT_PARAM, OUTPUT_MOMENT_1, OUTPUT_MOMENT_2); }; } // namespace caffe2