Theo giám sát của Động Sát Beating, nhóm Tencent Hunyuan kết hợp với nhiều trường đại học đã công bố LHTB, chuyên dùng để kiểm tra xem AI Agent có thể hoàn thành các tác vụ phức tạp trong terminal một cách liên tục hay không.
Bộ tiêu chuẩn bao gồm 46 tác vụ, bao phủ các lĩnh vực như kỹ thuật phần mềm, tái tạo thí nghiệm, tính toán khoa học và phân tích đa phương thức. Mỗi tác vụ chạy tối đa 90 phút, thường yêu cầu thao tác liên tục hàng trăm bước.
LHTB không chỉ nhìn vào kết quả cuối cùng. Nếu hoàn thành một phần tác vụ, cũng sẽ được tính điểm theo tiến độ thực tế. Trình xác thực ẩn sẽ kiểm tra tệp tin, kết quả kiểm tra và đầu ra chương trình; Agent tự nhận hoàn thành không được tính.
Phiên bản đầu tiên của bài báo đã thử nghiệm 15 mô hình. GPT-5.5 hoàn thành 7 tác vụ, đứng đầu. Mỗi mô hình thực hiện một tác vụ, tiêu thụ trung bình khoảng 9,9 triệu Token, mất khoảng 85 phút.
Kết quả công khai hiện tại đã mở rộng lên 20 mô hình. Grok 4.5 đứng đầu với điểm trung bình 0,505, hoàn thành 13 tác vụ. Trong số 46 tác vụ, vẫn có 29 tác vụ không có mô hình nào đạt tiêu chuẩn hoàn thành.
Hầu hết Agent có thể hoàn thành một số bước, nhưng thường xuyên hết 90 phút, hoặc kết thúc sớm khi tác vụ chưa hoàn thành, không thể thực sự làm xong các tác vụ phức tạp.
