Gradient descent optimizes over-parameterized deep ReLU networks

Gradient descent optimizes over-parameterized deep ReLU networks | Litlas