Debate Training Reduces Reward Hacking in RLAIF
New paper from Google DeepMind:
"We demonstrate that RL finetuning an LLM using debate, a two-player adversarial game between a generator and a critic adjudicated by a weaker LLM judge, reduces reward hacking compared to a reinforcement learning from AI feedback (RLAIF) baseline."
paper link: