Capstone 04 — Production Quantization Suite

Phase: 11 — Capstone | Difficulty: ⭐⭐⭐⭐⭐ | Time: 5–6 hours

A complete quantization decision engine: PTQ → sensitivity analysis → mixed-precision assignment → QAT fine-tuning → report.

What you build

  • ptq_quantize_linear — symmetric per-tensor INT4/INT8 PTQ
  • apply_ptq — quantize all Linear layers in model
  • LayerSensitivity + measure_layer_sensitivity — per-layer isolation (freeze all others)
  • PrecisionAssignment + assign_mixed_precision — drop>2%→FP16, 0.5-2%→INT8, <0.5%→INT4
  • apply_mixed_precision — assign different bit widths per layer
  • FakeQuantize (STE) + run_qat — fine-tune with fake quantization noise
  • QuantizationSuiteReport + run_quantization_suite — orchestrates all stages

Integrates

Phase 03 PTQ + Phase 03 QAT + Phase 06 sensitivity analysis + Phase 09 evaluation

Run

pip install -r requirements.txt
python lab.py
pytest test_lab.py -v