Động Sát Beating AI tin nhanh, nhóm Tencent Hunyuan và các nhóm khác đã công bố EvolveScaler, chuyên kiểm tra xem mô hình lớn có thể theo kịp thông tin liên tục thay đổi hay không. Nó sẽ liên tục thêm vào các thông tin sửa đổi, rút lại, bổ sung và vô hiệu hóa trong văn bản dài, rồi để mô hình trả lời câu hỏi dựa trên trạng thái mới nhất.
Ví dụ, trước tiên cho mô hình xem bản ghi trò chơi 40 ngày, rồi hỏi: "Nếu ngày thứ 7 không đánh con Boss nhỏ đó, cuối cùng còn có thể thắng không?" Điều này sẽ kéo theo thay đổi về trang bị, lượng máu và kết quả chiến đấu sau đó. Mô hình phải bắt đầu từ ngày thứ 7, suy luận lại hàng chục ngày sau đó, trong văn bản gốc không có đáp án sẵn.
Nhóm đã thiết kế 117 loại nhiệm vụ, 159 loại câu hỏi, dài nhất khoảng 1200 sự kiện. 14 cấu hình mô hình bao gồm GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 và Qwen3.5 Plus. Ở mức khó nhất, điểm trung vị chỉ có 11,3%; GPT-5.5-xhigh thể hiện tốt nhất cũng chỉ đạt 59,3%.
Bộ dữ liệu này cũng có thể dùng để huấn luyện mô hình. Một mô hình A3B nội bộ sau khi thêm 6000 mẫu dữ liệu loại này, đã cải thiện trên cả 8 bài kiểm tra bên ngoài, trung bình tăng 5,25 điểm.
