It's time to rethink RL.
Translating real world use into model improvements requires redesigning post-training algorithms for non-verifiable, per token rewards.
At
@aiDotEngineer 's World Fair, we share our insights into scaling algorithms like SDPO for continual learning.