动察 Beating AI tin nhanh, Jina AI ra mắt mô hình phân tích tài liệu jina-ocr-v1, có thể chuyển trực tiếp PDF, bản scan, bảng biểu và biểu đồ thành Markdown. Nó được hậu huấn luyện dựa trên DeepSeek-OCR, kế thừa kiến trúc MoE với tổng cộng khoảng 3,4 tỷ tham số, kích hoạt khoảng 570 triệu tham số cho mỗi Token khi giải mã, và bổ sung giải mã suy đoán FastMTP.
Trong tự kiểm tra của Jina, jina-ocr-v1 đạt 91,14 trên OmniDocBench v1.6, cao hơn DeepSeek-OCR-2 0,89 điểm; đạt 83,4 trên olmOCR-Bench, cao hơn mô hình nền DeepSeek-OCR mà nó thực sự dựa trên 7,4 điểm.
Thông lượng là một trong những điểm bán chính của Jina. Trên một A100, với 32 luồng đồng thời, nó đạt 2,57 trang/giây, cao nhất trong 14 hệ thống mà Jina thử nghiệm, cao hơn khoảng 22% so với 2,10 trang/giây của DeepSeek-OCR.
Trọng số mô hình đã được đưa lên Hugging Face, sử dụng CC BY-NC 4.0, sử dụng thương mại cần liên hệ với Jina.
