Rlaif: Scaling Reinforcement Learning from Human Feedback with AI Feedback (arxiv.org) 1 points by maccaw 3y ago ↗ HN
0 comments
[ 3.1 ms ] story [ 16.7 ms ] threadNo comments yet.