BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Từ GPT-2 đến Kimi K3: Bảy năm tiến hóa kiến trúc mô hình lớn, bản chất là một cuộc chiến giành bộ nhớ.

Theo Động Sát Beating giám sát, kỹ sư của Baseten là Ali đã đăng một bài viết dài, phân tích từ GPT-2 đến Kimi K3. Tính theo số lượng tham số, một K3 tương đương khoảng 22.580 GPT-2. Nhưng ông cho rằng, sự thay đổi thực sự trong bảy năm qua không chỉ đơn giản là mở rộng mô hình, mà là liên tục cải tiến cách mô hình lưu trữ, cập nhật và truy xuất thông tin.

GPT-2 sử dụng cơ chế chú ý toàn phần. Mỗi Token đều để lại Key và Value riêng, có thể xem lại bất cứ lúc nào. Thông tin được lưu trữ đầy đủ nhất, nhưng ngữ cảnh càng dài, chi phí KV Cache và tính toán càng cao.

Cơ chế chú ý tuyến tính nén toàn bộ lịch sử vào một trạng thái có kích thước cố định. Chi phí không còn tăng liên tục theo ngữ cảnh, nhưng cái giá phải trả là các thông tin khác nhau bị dồn vào cùng một không gian. Khi nội dung ngày càng nhiều, các ký ức cũ bắt đầu can thiệp lẫn nhau.

Các cải tiến kiến trúc sau đó đều nhằm thêm các quy tắc quản lý cho bộ nhớ hạn chế này. DeltaNet cho phép mô hình đọc nội dung cũ trước, sau đó ghi đè bằng sự khác biệt giữa cũ và mới. Gated DeltaNet thêm cơ chế quên tổng thể, cho phép thông tin cũ suy giảm theo sự thay đổi của bối cảnh.

KDA tiếp tục tinh chỉnh khả năng kiểm soát quên xuống từng kênh. Các thông tin khác nhau có thể có thời gian lưu trữ khác nhau: các sự kiện dài hạn được giữ lâu hơn, các lệnh tạm thời và biến cục bộ suy giảm nhanh hơn. Ali cho rằng, đây mới là bước tiến quan trọng nhất của Kimi Linear.

Nhưng trạng thái cố định không thể giữ lại tất cả chi tiết. Vì vậy, K3 không chỉ sử dụng KDA, mà sắp xếp 23 nhóm cấu trúc bốn lớp thành "ba lớp KDA cộng một lớp MLA", và cuối cùng thêm một lớp MLA. KDA chịu trách nhiệm duy trì bộ nhớ dài hạn với chi phí thấp, MLA định kỳ xem lại toàn bộ ngữ cảnh để truy xuất thông tin chính xác như số, mã và lệnh ban đầu.

K3 còn giới thiệu Attention Residuals. Các mô hình thông thường cộng dồn kết quả của mỗi lớp, thông tin được trích xuất sớm dễ bị pha loãng bởi kết quả sau đó trong 93 lớp tính toán. K3 chia mạng thành các khối 12 lớp, cho phép các lớp sau gọi các biểu diễn trung gian được hình thành ở giai đoạn đầu khi cần, không cần phải suy luận lại từ văn bản gốc mỗi lần.

Do đó, điểm mấu chốt của K3 không phải là một công nghệ đen đột nhiên xuất hiện. Điều thực sự đặc biệt của nó là kết hợp bộ nhớ tuần hoàn, truy xuất toàn cục, xem lại giữa các lớp và định tuyến chuyên gia thành một hệ thống thông tin phân cấp.

Sự tiến hóa kiến trúc mô hình trong bảy năm qua, về bản chất là dạy mô hình cách chọn những gì đáng giữ lại, những gì nên ghi đè, và khi nào phải quay lại văn bản gốc.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành