Theo giám sát của Động Sát Beating, OpenAI cho biết khung đánh giá tổng quát ARC-AGI-3 không lưu lại suy luận trước đó của GPT-5.6 Sol, và còn xóa các bản ghi cũ khi ngữ cảnh quá dài. Do đó, mô hình thường xuyên quên các quy tắc trò chơi đã khám phá, mỗi bước thực hiện đều phải suy nghĩ lại từ đầu.
Sau đó, OpenAI đã dùng Responses API của riêng mình để xây dựng lại khung đánh giá, giữ lại lịch sử suy luận và nén ngữ cảnh quá dài. Kết quả, điểm số của GPT-5.6 Sol tăng từ 13,3% lên 38,3%, và lượng Token đầu ra giảm xuống còn khoảng một phần sáu.
Tuy nhiên, vấn đề nằm ở chỗ Opus 5 cũng sử dụng khung tổng quát này. Với chế độ suy luận High, nó đạt 30,2%, trong khi GPT-5.6 Sol dùng chế độ Max cao hơn cũng chỉ đạt 13,3%. Khung đánh giá thực sự đã kéo tụt GPT-5.6, nhưng lại không ảnh hưởng tương tự đến Opus 5.
Dù OpenAI có biện minh thế nào, Opus 5 vẫn rõ ràng mạnh hơn GPT-5.6 trong bài kiểm tra AI khó nhất toàn cầu này.
