Ngày 25/8/2026, Multiverse Computing công bố kỹ thuật mang tên Quantization-Aware Healing trên Hugging Face Blog, giới thiệu phương pháp nén mô hình AI xuống định dạng 4-bit nhưng vẫn đạt hiệu năng vượt qua phiên bản gốc độ chính xác đầy đủ (full-precision).
Theo bài đăng từ nhóm tác giả MultiverseComputingCAI, kỹ thuật Quantization-Aware Healing tập trung xử lý tổn thất độ chính xác trong quá trình lượng tử hóa mô hình. Thay vì chấp nhận sự suy giảm chất lượng thường thấy khi đưa trọng số về 4-bit, phương pháp này tối ưu và hồi phục các trọng số bị nén, giúp phiên bản 4-bit không chỉ thu nhỏ kích thước bộ nhớ mà còn đạt kết quả benchmark cao hơn bản gốc.
Thông báo trên Hugging Face Blog chưa đi sâu vào chi tiết các bài kiểm thử cụ thể, mã nguồn hay danh sách các kiến trúc mô hình đã được áp dụng kỹ thuật này.