Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
Presents breakthrough compression technique that inverts traditional quality-loss relationship in model quantization
AI Summary
Researchers introduce -Aware Healing, producing a 4-bit compressed model that outperforms its original full-precision version on most benchmarks.
