Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf] (github.com) 6 points by virde 1y ago ↗ HN
1 comment
[ 4.0 ms ] story [ 20.4 ms ] thread