Động Sát Beating AI tin nhanh, Hy4 preview vừa mã nguồn mở, Tencent Hỗn Nguyên lại tung ra một phiên bản lượng tử hóa cực hạn. Trọng số mô hình gốc gần 1,5TB, phiên bản GGUF mới chỉ khoảng 214GB, giảm đáng kể rào cản triển khai cục bộ của mô hình MoE 770B này.
Nó không nén toàn bộ mô hình xuống 1,25-bit. Tencent lượng tử hóa theo độ nhạy cảm của từng lớp khác nhau, phần chịu được nén tối thiểu xuống khoảng 1,31-bit, phần nhạy cảm giữ 2-bit hoặc thậm chí độ chính xác cao hơn. Cuối cùng, toàn bộ tệp trung bình khoảng 2,38 bpw. Trong bốn bài đánh giá mà Tencent đưa ra, so với bản gốc BF16 chỉ giảm từ 0,2 đến 1,6 điểm.
Sau khi nén nhỏ, Tencent còn thử nghiệm suy luận liên hợp trên thiết bị không đồng nhất với prima.cpp. Một laptop RTX 4090 cộng một máy chủ bốn thẻ A4000, tổng cộng chỉ có 80GB VRAM và 64GB RAM, cuối cùng chạy mô hình ở tốc độ 1,02 token/s, nhanh hơn khoảng 6 lần so với offload trên laptop đơn. Nhiều thiết bị có cấu hình khác nhau cũng có thể cùng nhau chia sẻ suy luận mô hình.
