作者,您好,我在训练的过程中发现diffusion-opsd训练效率很高,同时也容易发生reward-hacking,请问有没有什么好的方法来控制这种由于reward增长过快造成的hacking
作者,您好,我在训练的过程中发现diffusion-opsd训练效率很高,同时也容易发生reward-hacking,请问有没有什么好的方法来控制这种由于reward增长过快造成的hacking