动察 Beating AI tin nhanh, Shanghai AI Lab và Đại học Giao thông Thượng Hải đã công bố mô hình 8,9 tỷ tham số NCP-ArchPreview. Các mô hình lớn thông thường chủ yếu huấn luyện "đoán token tiếp theo", còn NCP còn dự đoán một đoạn tín hiệu khái niệm nội bộ tương ứng phía sau, rồi dùng nó để hỗ trợ sinh token. Cuối cùng vẫn xuất từng token một, nhưng bên trong mô hình đã biết đoán trước nội dung phía sau.
Bộ tín hiệu này còn có thể dùng để tăng tốc giải mã suy đoán. Các phương án như DFlash, DSpark sẽ để một mô hình nhỏ đoán trước nội dung phía sau, rồi giao cho mô hình lớn kiểm tra thống nhất. Nhóm NCP đưa cả tín hiệu khái niệm nội bộ cho mô hình nhỏ này, tương đương với việc cho nó một chút gợi ý "phía sau đại khái viết thế nào", rồi để nó song song đoán 16 token một lần.
Như vậy, mô hình nhỏ đoán trúng nhiều nội dung hơn. Trong bốn bài kiểm tra, mỗi lần mô hình lớn xác minh, trung bình số token vượt qua tăng từ 5,933 lên 6,180, tăng 4,17%; trên HumanEval tăng 7,59%. Việc tích hợp bộ tín hiệu này chỉ thêm khoảng 40.000 tham số cho mô hình nháp.
Cũng với 8,9 tỷ tham số, NCP chỉ dùng khoảng 85% lượng tính toán huấn luyện của Transformer thông thường là có thể giảm sai số huấn luyện xuống mức tương đương.
