BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Xiaomi công bố trước kiến trúc mới MiMo-V3: khối lượng tính toán tiền nạp trước hàng triệu Token giảm 80%

动察 Beating AI tin nhanh, nhóm MiMo của Xiaomi công bố kiến trúc HySparse2 sẽ được sử dụng cho thế hệ MiMo-V3 tiếp theo. Nó chủ yếu giải quyết vấn đề Agent càng chạy càng đắt. Mỗi lần Agent chỉ đưa ra chỉ thị rất ngắn, nhưng có thể nhận về lượng lớn nội dung từ trang web, terminal và công cụ. Mô hình phải đọc hết những nội dung mới này trước; ngữ cảnh càng dài, bước này càng tốn tính toán, KV Cache cũng càng chiếm nhiều VRAM.


HySparse2 trước tiên chia mô hình thành hai đoạn trước và sau. Nửa trước chịu trách nhiệm xử lý đầu vào, nửa sau tiếp tục suy luận và sinh nội dung. Thông tin ngữ cảnh mà nửa sau cần có thể được tạo trực tiếp từ kết quả đã tính xong ở nửa trước, do đó prefill không cần chạy lại toàn bộ nửa sau. Ý tưởng này đến từ YOCO do Microsoft Research đề xuất năm 2024, tên gọi chính là "You Only Cache Once", cốt lõi là để nửa sau chia sẻ thông tin đã tính sẵn ở phía trước, lưu cache ít hơn và cũng giảm tính toán lặp lại.


Đồng thời nó làm lại sparse attention. Full attention thông thường mỗi lần đều phải nhìn toàn bộ ngữ cảnh, HySparse2 chỉ để một số ít lớp làm như vậy. Chúng trước tiên chọn ra 1024 token liên quan nhất từ ngữ cảnh dài, các lớp phía sau trực tiếp dùng lại kết quả này, đồng thời cố định giữ lại 128 token gần nhất. HySparse thế hệ trước là gom mỗi 64 token thành một nhóm rồi chọn, chỉ cần trong một nhóm có thông tin quan trọng thì cả nhóm đều phải giữ lại. Bây giờ đổi thành chọn từng token một, cùng lượng tính toán có thể dành cho nhiều nội dung thực sự liên quan hơn. Sau khi kiểm thử riêng thay đổi này, hai kết quả truy xuất văn bản dài lần lượt tăng 6.57 điểm và 8.14 điểm.


Bài báo dùng một mô hình có tổng tham số 80 tỷ, mỗi lần kích hoạt khoảng 3 tỷ tham số để đối chiếu. Mô hình 49 lớp ở giai đoạn prefill chỉ cần chạy 25 lớp đầu. Khi đầu vào đạt 1 triệu token, so với attention cửa sổ trượt hỗn hợp được dùng trong dòng MiMo-V2, lượng tính toán prefill giảm xuống còn khoảng 1/5, KV Cache từ 12.09GB giảm xuống 2.69GB.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành