1 comment

[ 3.1 ms ] story [ 14.2 ms ] thread
one of a kind single-transformer block layer, high throughput. The new generation of transformer-based lightweight models for common NLP tasks?