Theo giám sát của Động Sát Beating, đội ngũ Weibo gần đây đã mã nguồn mở mô hình suy luận VibeThinker-3B với 30 tỷ tham số.
Mô hình đạt trình độ tiên tiến trong các tác vụ như toán học và lập trình, một số chỉ số gần hoặc vượt qua các mô hình quy mô lớn hàng đầu như DeepSeek V3.2, GLM-5 và Gemini 3 Pro.
VibeThinker-3B được cải tiến dựa trên Qwen2.5-Coder-3B, sử dụng quy trình Spectrum-to-Signal để huấn luyện thứ cấp: mô hình trước tiên giải bài tập từ dễ đến khó để tích lũy phổ giải pháp, sau đó khuếch đại tín hiệu giải pháp đúng thông qua học tăng cường, toàn bộ quá trình huấn luyện sử dụng không gian suy nghĩ lớn 64K để ngăn chặn gián đoạn các bước suy luận.
Đối với toán học và lập trình, mô hình một mặt thu thập các bước xuất sắc mà nó đã giải đúng để tự chưng cất và bắt chước, mặt khác đưa ra đánh giá cấp bước để tự kiểm tra khi trả lời. Cơ chế tự kiểm tra cuối cùng đã nâng điểm kiểm tra toán AIME26 từ 94,3 lên 97,1.
Đội ngũ nghiên cứu đã đề xuất "giả thuyết nén tham số - bao phủ" trong báo cáo, cho rằng suy luận logic là khả năng có thể nén cao, chủ yếu dựa vào quy tắc và sửa lỗi, có thể đạt hiệu quả hàng đầu chỉ với mô hình nhỏ 3B; trong khi kiến thức lĩnh vực mở cần lượng tham số khổng lồ để ghi nhớ cứng nhắc. Do hạn chế về quy mô tham số, khả năng bao phủ kiến thức mở thông thường của VibeThinker-3B vẫn yếu hơn so với các mô hình lớn.
Đội ngũ nhấn mạnh rằng mục đích nghiên cứu không phải là thay thế mô hình lớn bằng mô hình nhỏ, mà là khám phá ranh giới khả năng của mô hình nhỏ gọn dưới cơ chế xác minh rõ ràng.
