[–] kp1197 1y ago ↗ Does performing gradient descent on token input embeddings lead to interpretable results? And if not, why?
1 comment
[ 2.6 ms ] story [ 14.4 ms ] thread