RL for LLM Reasoning Is Sparse Policy Selection, Not Capability Learning (arxiv.org) 3 points by BlackGlory 1mo ago ↗ HN
0 comments
[ 0.26 ms ] story [ 5.2 ms ] threadNo comments yet.