BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Apple mã nguồn mở LensVLM-9B: nén 100 trang tài liệu thành ảnh trước, tiết kiệm 84% bộ nhớ đệm KV

动察 Beating AI tin nhanh, Apple đã mã nguồn mở mô hình ngôn ngữ thị giác LensVLM-9B chuyên xử lý tài liệu dài, mô hình được huấn luyện dựa trên Qwen3.5-9B-Base. Khi xử lý tài liệu dài, nó sẽ nén toàn bộ tài liệu thành các trang có độ phân giải thấp để quét nhanh một lượt, sau khi định vị được trang liên quan, mới đọc văn bản gốc hoặc hình ảnh độ nét cao trong đó.


Như vậy không cần nhồi toàn bộ văn bản vào ngữ cảnh của mô hình. Khi thử nghiệm với một tài liệu 100 trang trong bài báo, đọc trực tiếp toàn văn cần 51.273 tokens, LensVLM chỉ dùng 8.090. Bộ nhớ đệm KV tương ứng giảm từ khoảng 1,6GB xuống 253MB, giảm 84,2%.


Độ chính xác sau khi nén cũng không giảm rõ rệt. Trong 7 bài kiểm tra hỏi đáp tài liệu, độ chính xác trung bình khi đọc trực tiếp toàn văn là 72,4%, LensVLM vẫn đạt 68,9% khi nén khoảng 4,3 lần. So với việc trực tiếp thu nhỏ văn bản thành hình ảnh để mô hình nhận diện, khi nén khoảng 5 lần tương tự, độ chính xác tăng từ 31,3% lên 68,9%.


Tuy nhiên, hiện tại nó sẽ chậm hơn. Sau khi LensVLM tìm thấy trang liên quan, còn phải gọi thêm một lần công cụ để đọc văn bản gốc, do đó cần chạy liên tiếp hai vòng suy luận. Trong thử nghiệm của bài báo, một lần trả lời cần khoảng 17 giây; nếu không dùng phương án nén này, trực tiếp đưa toàn bộ tài liệu làm văn bản đầu vào cho Qwen3.5-9B, một lần tạo câu trả lời cần khoảng 8 giây.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành