Question 14
What is the primary trade-off made by utilizing KV Cache during autoregressive decoding?
It reduces inference latency but utilizes smaller batch size
It increases generation speed but reduces model accuracy
It reduces computational overhead but increases memory usage
It reduces training time by storing intermediate token representations