Real-time LLM Inference on Standard GPUs (3k tokens/s per request) (blog.kog.ai) 7 points by morgangiraud 3mo ago ↗ HN
0 comments
[ 8.7 ms ] story [ 48.2 ms ] threadNo comments yet.