注册并分享邀请链接,可获得视频播放与邀请奖励。

Rosinality
@rosinality
ML Engineer @poolsideai
加入 October 2008
1K 正在关注    7.5K 粉丝
Improving exploration for rubric RL using OPSD to generate guidance for underexplored or penalized criteria. As combining criteria to construct rewards is common maybe it could be useful beyond rubric RL.
显示更多
0
1
106
15
转发到社区