Feb, 2016

修正饱和激活函数

TL;DR本文在深度神经网络中研究常用的饱和函数:logistic sigmoid 和双曲正切 (tanh),发现使用 logistic sigmoid 函数训练困难的原因不仅在于其非零中心属性,还在于其在原点附近的斜率过大。通过适当的重新调整,logistic sigmoid 和 tanh 函数的性能相当。接着,通过在负部分加罚项可以改进 tanh 函数,形成了 “带惩罚的 tanh” 函数,其性能甚至优于 ReLu 和 Leaky ReLU 等饱和函数。本文的结果与之前的研究结论产生冲突,表明有必要进一步研究深度架构中的激活函数。