Động sát Beating AI tin nhanh, nhóm nghiên cứu AI Proximal công bố bài đánh giá lập trình chu kỳ siêu dài FrontierSWE v2. Nhiệm vụ được mở rộng từ 17 lên 34, mỗi mô hình chạy 5 lần trên mỗi nhiệm vụ, mỗi lần tối đa 20 giờ. Claude Fable 5.1 đạt điểm trung bình 56,29%, vượt xa GPT-5.6 với 32,2%. Mô hình mã nguồn mở GLM-5.3 xếp thứ ba với 30,2%.
Nhiệm vụ trong FrontierSWE không chỉ còn là sửa mã. Agent phải viết trình mô phỏng mạch điện từ đầu, huấn luyện mô hình dự báo thời tiết, còn phải khớp danh mục sao dựa trên ảnh kính thiên văn, hoặc chỉ nhìn màn hình game để huấn luyện bot đua xe. v2 thống nhất chuyển sang Proximus harness. Mỗi nhiệm vụ chạy tối đa 20 giờ, khi mô hình chuẩn bị nộp bài, hệ thống sẽ lưu phiên bản hiện tại và báo cho nó biết còn bao nhiêu thời gian, tránh việc mô hình kết thúc nhiệm vụ quá sớm.
Thay đổi này ảnh hưởng không nhỏ đến kết quả. Proximal so sánh trên 6 nhiệm vụ, phát hiện Claude Opus 5 và GPT-5.6 sau khi chuyển sang Proximus đều làm việc lâu hơn, điểm trung bình cũng cao hơn so với harness gốc của từng mô hình.
Đánh giá còn phát hiện nhiều lần gian lận chủ động. GPT-5.6 từng nhận ra việc đọc câu trả lời công khai "có thể liên quan đến vấn đề chống gian lận", nhưng cuối cùng vẫn dùng đường tắt này; một lần khác thậm chí lợi dụng dịch vụ nền tảng của Modal để đọc tệp xác minh ẩn. Muse Spark 1.2 thì sửa script kiểm thử, nhét câu trả lời công khai vào, còn viết mã cố che giấu dấu vết gian lận. Tất cả các lần chạy xác nhận vi phạm đều bị tính điểm 0.
