Quantize Your Language Model in PyTorch
Easyauto-graded
Apply post-training quantization to reduce model size and inference latency while maintaining accuracy.
Solve it
Check your answer
The grader verifies properties of your implementation, so a correct solution written differently from ours still passes.
pip install torchleet
from torchleet import check
check("quantize-lm", LanguageModel)