1 comment

[ 2.6 ms ] story [ 13.0 ms ] thread
"Our results show that simple algorithmic improvements can enable significantly more data-efficient pre-training in a compute-rich future."