Cascade Inference: Memory Bandwidth Efficient Shared Prefix Batch Decoding (flashinfer.ai) 2 points by zhye 2y ago ↗ HN
0 comments
[ 2.8 ms ] story [ 12.2 ms ] threadNo comments yet.