Question 9
Why does full fine-tuning of large language models often require more memory than inference using the same model?
Inference uses larger batch sizes.
Inference stores optimizer states.
Training requires storing gradients and optimizer states.
Training uses longer input sequences.