BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

OpenAI bị cáo buộc âm thầm điều chỉnh dữ liệu đánh giá GPT-6 Astra, một số chỉ số khiến đối thủ cạnh tranh trở nên "kém hơn".

Động Sát Beating AI tin nhanh, kể từ khi OpenAI phát hành GPT-6 Astra vào ngày 3 tháng 9, nhiều dữ liệu chuẩn đánh giá mô hình đã liên tục được điều chỉnh, một số thay đổi khiến Astra thể hiện tốt hơn, đồng thời điểm số của một số mô hình đối thủ cạnh tranh cũng bị sụt giảm, gây ra sự nghi ngờ từ bên ngoài về việc AI "gian lận bảng xếp hạng" và tính minh bạch trong đánh giá.


Trong đó, tỷ lệ ảo giác của Astra từng bị điều chỉnh giảm từ 4,2% xuống 2%, GPT-5.6 Sol thì từ 12,2% giảm xuống 9,4%, sau đó cả hai lại được khôi phục về 4,2% và 12,2%. Trong bài đánh giá toán học, điểm số của Fable 5.1 của Anthropic cũng từng giảm từ 87,8% xuống 78%, hiện đã tăng trở lại lên 83%; GPT-5.6 Sol thì từ 83% giảm xuống 80,5%, sau đó khôi phục về 83%.


Ngoài ra, thành tích của Astra trong bài đánh giá ARC-AGI-3 đã tăng từ 98,6% trong bản nháp trước khi phát hành lên 99,99% trên trang cuối cùng, điểm đánh giá lập trình của nó cũng được điều chỉnh tăng nhẹ từ 57,7% lên 57,9%. OpenAI cho biết, kết quả đánh giá sẽ bị ảnh hưởng bởi các yếu tố như phiên bản mô hình, cấu hình công cụ, mức độ suy luận và lần chạy thử nghiệm, lần điều chỉnh này nhằm đảm bảo dữ liệu phản ánh chính xác hơn hiệu suất tốt nhất của mô hình.


Tuy nhiên, các nhà nghiên cứu tại Đại học Stanford cho rằng, việc thường xuyên chạy lại bài đánh giá có thể liên quan đến cái gọi là "Benchmaxxing", tức là điều chỉnh điều kiện thử nghiệm để tối đa hóa điểm chuẩn. Các chuyên gia trong ngành chỉ ra rằng, khi cuộc cạnh tranh mô hình AI ngày càng gay gắt, dữ liệu đánh giá đã trở thành công cụ quan trọng để đo lường năng lực mô hình và tranh giành thị trường, cách nâng cao tính minh bạch và khả năng tái lập của các bài kiểm tra chuẩn đang ngày càng nhận được nhiều sự quan tâm.

举报 Báo lỗi/Báo cáo
Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành