Theo giám sát của Động Sát Beating, mô hình mã nguồn mở GLM-5.2 đã đứng đầu bảng xếp hạng tinh chỉnh tự động PostTrainBench, nhưng bị chỉ trích bởi người hoài nghi scaling01 là thiếu giá trị thực tế. Ông chỉ ra rằng việc mô hình nhảy từ vị trí thứ 22 lên đỉnh bảng trong vài tháng là rất bất thường, và do bài kiểm tra thiếu tập ẩn, dễ khiến tác nhân AI lợi dụng việc "cày bảng" để tối ưu hóa có định hướng, dẫn đến mô hình thu được khó áp dụng trong thế giới thực.
Tuy nhiên, phe ủng hộ phản bác rằng, trong điều kiện giới hạn một card H100 trong 10 giờ, yêu cầu tác nhân AI chạy hết quy trình tinh chỉnh tổng quát là không thực tế, và tối ưu hóa có định hướng vốn là trạng thái bình thường của học máy. Nhật ký công khai cho thấy GLM-5.2 có logic thí nghiệm rõ ràng, có thể tự động thu thập dữ liệu từ các giả định lấy mẫu khác nhau, tự lập kế hoạch hoàn chỉnh bao gồm thiết lập đường cơ sở hiệu suất, tinh chỉnh và sử dụng lấy mẫu từ chối để lọc dữ liệu, đồng thời cố gắng tránh overfitting trong chuỗi suy luận.
Giá trị lớn hơn của cuộc tranh cãi này nằm ở chỗ, quỹ đạo chạy công khai vốn dùng để đánh giá khả năng tinh chỉnh, đã vô tình phá vỡ tin đồn trong ngành về việc các mô hình lớn trong nước "chưng cất nặng từ Claude". Tác giả của benchmark, Maksym Andriushchenko, sau khi xem xét nhật ký của GLM-5.2, chỉ ra rằng mô hình có sự khác biệt cơ bản với Claude về thu thập dữ liệu, kết hợp chiến lược và đường đi quyết định, không có dấu hiệu bắt chước hay chưng cất. Sự minh bạch công khai của benchmark bên thứ ba đã trở thành cửa sổ trực tiếp nhất để các mô hình mã nguồn mở tự chứng minh năng lực nghiên cứu và phát triển nguyên bản của mình.
