You might want to look at Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization, which studies self-inoculation.
You might want to look at Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization, which studies self-inoculation.