Capstone 04 — Production Quantization Suite
Phase: 11 — Capstone | Difficulty: ⭐⭐⭐⭐⭐ | Time: 5–6 hours
A complete quantization decision engine: PTQ → sensitivity analysis → mixed-precision assignment → QAT fine-tuning → report.
What you build
ptq_quantize_linear— symmetric per-tensor INT4/INT8 PTQapply_ptq— quantize all Linear layers in modelLayerSensitivity+measure_layer_sensitivity— per-layer isolation (freeze all others)PrecisionAssignment+assign_mixed_precision— drop>2%→FP16, 0.5-2%→INT8, <0.5%→INT4apply_mixed_precision— assign different bit widths per layerFakeQuantize(STE) +run_qat— fine-tune with fake quantization noiseQuantizationSuiteReport+run_quantization_suite— orchestrates all stages
Integrates
Phase 03 PTQ + Phase 03 QAT + Phase 06 sensitivity analysis + Phase 09 evaluation
Run
pip install -r requirements.txt
python lab.py
pytest test_lab.py -v