Scalable agent alignment via reward modeling - DeepMind Safety Research (medium.com) 16 points by seriousssam 7y ago ↗ HN
0 comments
[ 6.3 ms ] story [ 44.1 ms ] threadNo comments yet.