BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

OpenAI cho biết khung đánh giá đã kéo giảm hiệu suất của GPT-5.6, nhưng Opus 5 sử dụng cùng khung đó lại đạt điểm cao gấp 2,3 lần.

Theo giám sát của Động Sát Beating, OpenAI cho biết khung đánh giá tổng quát ARC-AGI-3 không lưu lại suy luận trước đó của GPT-5.6 Sol, và còn xóa các bản ghi cũ khi ngữ cảnh quá dài. Do đó, mô hình thường xuyên quên các quy tắc trò chơi đã khám phá, mỗi bước thực hiện đều phải suy nghĩ lại từ đầu.

Sau đó, OpenAI đã dùng Responses API của riêng mình để xây dựng lại khung đánh giá, giữ lại lịch sử suy luận và nén ngữ cảnh quá dài. Kết quả, điểm số của GPT-5.6 Sol tăng từ 13,3% lên 38,3%, và lượng Token đầu ra giảm xuống còn khoảng một phần sáu.

Tuy nhiên, vấn đề nằm ở chỗ Opus 5 cũng sử dụng khung tổng quát này. Với chế độ suy luận High, nó đạt 30,2%, trong khi GPT-5.6 Sol dùng chế độ Max cao hơn cũng chỉ đạt 13,3%. Khung đánh giá thực sự đã kéo tụt GPT-5.6, nhưng lại không ảnh hưởng tương tự đến Opus 5.

Dù OpenAI có biện minh thế nào, Opus 5 vẫn rõ ràng mạnh hơn GPT-5.6 trong bài kiểm tra AI khó nhất toàn cầu này.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành