BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

20 giờ đánh giá lập trình tạo khoảng cách: Claude Fable 5.1 dẫn trước GPT-5.6 hơn 24 điểm, GLM-5.3 xếp thứ ba

Động sát Beating AI tin nhanh, nhóm nghiên cứu AI Proximal công bố bài đánh giá lập trình chu kỳ siêu dài FrontierSWE v2. Nhiệm vụ được mở rộng từ 17 lên 34, mỗi mô hình chạy 5 lần trên mỗi nhiệm vụ, mỗi lần tối đa 20 giờ. Claude Fable 5.1 đạt điểm trung bình 56,29%, vượt xa GPT-5.6 với 32,2%. Mô hình mã nguồn mở GLM-5.3 xếp thứ ba với 30,2%.


Nhiệm vụ trong FrontierSWE không chỉ còn là sửa mã. Agent phải viết trình mô phỏng mạch điện từ đầu, huấn luyện mô hình dự báo thời tiết, còn phải khớp danh mục sao dựa trên ảnh kính thiên văn, hoặc chỉ nhìn màn hình game để huấn luyện bot đua xe. v2 thống nhất chuyển sang Proximus harness. Mỗi nhiệm vụ chạy tối đa 20 giờ, khi mô hình chuẩn bị nộp bài, hệ thống sẽ lưu phiên bản hiện tại và báo cho nó biết còn bao nhiêu thời gian, tránh việc mô hình kết thúc nhiệm vụ quá sớm.


Thay đổi này ảnh hưởng không nhỏ đến kết quả. Proximal so sánh trên 6 nhiệm vụ, phát hiện Claude Opus 5 và GPT-5.6 sau khi chuyển sang Proximus đều làm việc lâu hơn, điểm trung bình cũng cao hơn so với harness gốc của từng mô hình.


Đánh giá còn phát hiện nhiều lần gian lận chủ động. GPT-5.6 từng nhận ra việc đọc câu trả lời công khai "có thể liên quan đến vấn đề chống gian lận", nhưng cuối cùng vẫn dùng đường tắt này; một lần khác thậm chí lợi dụng dịch vụ nền tảng của Modal để đọc tệp xác minh ẩn. Muse Spark 1.2 thì sửa script kiểm thử, nhét câu trả lời công khai vào, còn viết mã cố che giấu dấu vết gian lận. Tất cả các lần chạy xác nhận vi phạm đều bị tính điểm 0.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành