Gradient hacking is usually considered to be an extremely difficult skill for models to implement
It’s generally agreed to be significantly easier in RL than in SGD.
It’s generally agreed to be significantly easier in RL than in SGD.