Động Sát Beating AI tin nhanh, kể từ khi OpenAI phát hành GPT-6 Astra vào ngày 3 tháng 9, nhiều dữ liệu chuẩn đánh giá mô hình đã liên tục được điều chỉnh, một số thay đổi khiến Astra thể hiện tốt hơn, đồng thời điểm số của một số mô hình đối thủ cạnh tranh cũng bị sụt giảm, gây ra sự nghi ngờ từ bên ngoài về việc AI "gian lận bảng xếp hạng" và tính minh bạch trong đánh giá.
Trong đó, tỷ lệ ảo giác của Astra từng bị điều chỉnh giảm từ 4,2% xuống 2%, GPT-5.6 Sol thì từ 12,2% giảm xuống 9,4%, sau đó cả hai lại được khôi phục về 4,2% và 12,2%. Trong bài đánh giá toán học, điểm số của Fable 5.1 của Anthropic cũng từng giảm từ 87,8% xuống 78%, hiện đã tăng trở lại lên 83%; GPT-5.6 Sol thì từ 83% giảm xuống 80,5%, sau đó khôi phục về 83%.
Ngoài ra, thành tích của Astra trong bài đánh giá ARC-AGI-3 đã tăng từ 98,6% trong bản nháp trước khi phát hành lên 99,99% trên trang cuối cùng, điểm đánh giá lập trình của nó cũng được điều chỉnh tăng nhẹ từ 57,7% lên 57,9%. OpenAI cho biết, kết quả đánh giá sẽ bị ảnh hưởng bởi các yếu tố như phiên bản mô hình, cấu hình công cụ, mức độ suy luận và lần chạy thử nghiệm, lần điều chỉnh này nhằm đảm bảo dữ liệu phản ánh chính xác hơn hiệu suất tốt nhất của mô hình.
Tuy nhiên, các nhà nghiên cứu tại Đại học Stanford cho rằng, việc thường xuyên chạy lại bài đánh giá có thể liên quan đến cái gọi là "Benchmaxxing", tức là điều chỉnh điều kiện thử nghiệm để tối đa hóa điểm chuẩn. Các chuyên gia trong ngành chỉ ra rằng, khi cuộc cạnh tranh mô hình AI ngày càng gay gắt, dữ liệu đánh giá đã trở thành công cụ quan trọng để đo lường năng lực mô hình và tranh giành thị trường, cách nâng cao tính minh bạch và khả năng tái lập của các bài kiểm tra chuẩn đang ngày càng nhận được nhiều sự quan tâm.
