动察 Beating AI tin nhanh, Apple đã mã nguồn mở mô hình ngôn ngữ thị giác LensVLM-9B chuyên xử lý tài liệu dài, mô hình được huấn luyện dựa trên Qwen3.5-9B-Base. Khi xử lý tài liệu dài, nó sẽ nén toàn bộ tài liệu thành các trang có độ phân giải thấp để quét nhanh một lượt, sau khi định vị được trang liên quan, mới đọc văn bản gốc hoặc hình ảnh độ nét cao trong đó.
Như vậy không cần nhồi toàn bộ văn bản vào ngữ cảnh của mô hình. Khi thử nghiệm với một tài liệu 100 trang trong bài báo, đọc trực tiếp toàn văn cần 51.273 tokens, LensVLM chỉ dùng 8.090. Bộ nhớ đệm KV tương ứng giảm từ khoảng 1,6GB xuống 253MB, giảm 84,2%.
Độ chính xác sau khi nén cũng không giảm rõ rệt. Trong 7 bài kiểm tra hỏi đáp tài liệu, độ chính xác trung bình khi đọc trực tiếp toàn văn là 72,4%, LensVLM vẫn đạt 68,9% khi nén khoảng 4,3 lần. So với việc trực tiếp thu nhỏ văn bản thành hình ảnh để mô hình nhận diện, khi nén khoảng 5 lần tương tự, độ chính xác tăng từ 31,3% lên 68,9%.
Tuy nhiên, hiện tại nó sẽ chậm hơn. Sau khi LensVLM tìm thấy trang liên quan, còn phải gọi thêm một lần công cụ để đọc văn bản gốc, do đó cần chạy liên tiếp hai vòng suy luận. Trong thử nghiệm của bài báo, một lần trả lời cần khoảng 17 giây; nếu không dùng phương án nén này, trực tiếp đưa toàn bộ tài liệu làm văn bản đầu vào cho Qwen3.5-9B, một lần tạo câu trả lời cần khoảng 8 giây.
