动察 Beating AI tin nhanh, nhóm MiMo của Xiaomi công bố kiến trúc HySparse2 sẽ được sử dụng cho thế hệ MiMo-V3 tiếp theo. Nó chủ yếu giải quyết vấn đề Agent càng chạy càng đắt. Mỗi lần Agent chỉ đưa ra chỉ thị rất ngắn, nhưng có thể nhận về lượng lớn nội dung từ trang web, terminal và công cụ. Mô hình phải đọc hết những nội dung mới này trước; ngữ cảnh càng dài, bước này càng tốn tính toán, KV Cache cũng càng chiếm nhiều VRAM.
HySparse2 trước tiên chia mô hình thành hai đoạn trước và sau. Nửa trước chịu trách nhiệm xử lý đầu vào, nửa sau tiếp tục suy luận và sinh nội dung. Thông tin ngữ cảnh mà nửa sau cần có thể được tạo trực tiếp từ kết quả đã tính xong ở nửa trước, do đó prefill không cần chạy lại toàn bộ nửa sau. Ý tưởng này đến từ YOCO do Microsoft Research đề xuất năm 2024, tên gọi chính là "You Only Cache Once", cốt lõi là để nửa sau chia sẻ thông tin đã tính sẵn ở phía trước, lưu cache ít hơn và cũng giảm tính toán lặp lại.
Đồng thời nó làm lại sparse attention. Full attention thông thường mỗi lần đều phải nhìn toàn bộ ngữ cảnh, HySparse2 chỉ để một số ít lớp làm như vậy. Chúng trước tiên chọn ra 1024 token liên quan nhất từ ngữ cảnh dài, các lớp phía sau trực tiếp dùng lại kết quả này, đồng thời cố định giữ lại 128 token gần nhất. HySparse thế hệ trước là gom mỗi 64 token thành một nhóm rồi chọn, chỉ cần trong một nhóm có thông tin quan trọng thì cả nhóm đều phải giữ lại. Bây giờ đổi thành chọn từng token một, cùng lượng tính toán có thể dành cho nhiều nội dung thực sự liên quan hơn. Sau khi kiểm thử riêng thay đổi này, hai kết quả truy xuất văn bản dài lần lượt tăng 6.57 điểm và 8.14 điểm.
Bài báo dùng một mô hình có tổng tham số 80 tỷ, mỗi lần kích hoạt khoảng 3 tỷ tham số để đối chiếu. Mô hình 49 lớp ở giai đoạn prefill chỉ cần chạy 25 lớp đầu. Khi đầu vào đạt 1 triệu token, so với attention cửa sổ trượt hỗn hợp được dùng trong dòng MiMo-V2, lượng tính toán prefill giảm xuống còn khoảng 1/5, KV Cache từ 12.09GB giảm xuống 2.69GB.
