Theo Động Sát Beating giám sát, nhóm Baidu PaddlePaddle đã phát hành hệ thống OCR thế hệ mới PP-OCRv6, cung cấp ba phiên bản Tiny 1.5M, Small 7.7M và Medium 34.5M, bao phủ các kịch bản triển khai trên thiết bị biên, trình duyệt và đám mây. So với thế hệ trước PP-OCRv5, độ chính xác phát hiện tăng 4,6%, độ chính xác nhận dạng tăng 5,1%, đồng thời tích hợp tiếng Trung, tiếng Anh, tiếng Nhật và 46 ngôn ngữ hệ Latinh vào cùng một mô hình thống nhất.
PP-OCRv6 đã thiết kế lại mạng phát hiện và nhận dạng, giới thiệu cấu trúc mô-đun thống nhất và công nghệ tái tham số hóa cấu trúc (Structural Reparameterization), giúp nâng cao độ chính xác đồng thời giảm chi phí tính toán. Dưới sự tối ưu hóa của OpenVINO, tốc độ suy luận CPU đầu cuối của phiên bản Medium có thể tăng lên đến 5,2 lần.
Kết quả thử nghiệm chính thức công bố cho thấy, PP-OCRv6 với quy mô tham số hàng chục triệu đạt được hiệu suất gần bằng hoặc thậm chí vượt qua một số mô hình ngôn ngữ thị giác VLM quy mô hàng tỷ trên nhiều chuẩn OCR. Nhóm nghiên cứu cũng thực hiện tối ưu hóa chuyên biệt cho các kịch bản như chữ viết tay, nhãn hiệu linh kiện công nghiệp, màn hình số, in lụa PCB và bản vẽ CAD. Hiện tại, mã nguồn liên quan đã được tích hợp vào dự án PaddleOCR và mã nguồn mở.
