BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Mô hình lớn bắt đầu tự "nháp": NCP nhét việc đoán văn bản tiếp theo vào bên trong mô hình

动察 Beating AI tin nhanh, Shanghai AI Lab và Đại học Giao thông Thượng Hải đã công bố mô hình 8,9 tỷ tham số NCP-ArchPreview. Các mô hình lớn thông thường chủ yếu huấn luyện "đoán token tiếp theo", còn NCP còn dự đoán một đoạn tín hiệu khái niệm nội bộ tương ứng phía sau, rồi dùng nó để hỗ trợ sinh token. Cuối cùng vẫn xuất từng token một, nhưng bên trong mô hình đã biết đoán trước nội dung phía sau.


Bộ tín hiệu này còn có thể dùng để tăng tốc giải mã suy đoán. Các phương án như DFlash, DSpark sẽ để một mô hình nhỏ đoán trước nội dung phía sau, rồi giao cho mô hình lớn kiểm tra thống nhất. Nhóm NCP đưa cả tín hiệu khái niệm nội bộ cho mô hình nhỏ này, tương đương với việc cho nó một chút gợi ý "phía sau đại khái viết thế nào", rồi để nó song song đoán 16 token một lần.


Như vậy, mô hình nhỏ đoán trúng nhiều nội dung hơn. Trong bốn bài kiểm tra, mỗi lần mô hình lớn xác minh, trung bình số token vượt qua tăng từ 5,933 lên 6,180, tăng 4,17%; trên HumanEval tăng 7,59%. Việc tích hợp bộ tín hiệu này chỉ thêm khoảng 40.000 tham số cho mô hình nháp.


Cũng với 8,9 tỷ tham số, NCP chỉ dùng khoảng 85% lượng tính toán huấn luyện của Transformer thông thường là có thể giảm sai số huấn luyện xuống mức tương đương.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành