BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Grok 4.5 đã đứng đầu bảng xếp hạng sức bền Agent của Tencent Hunyuan, với hơn 60% nhiệm vụ được hoàn thành mà không cần mô hình.

Theo giám sát của Động Sát Beating, nhóm Tencent Hunyuan kết hợp với nhiều trường đại học đã công bố LHTB, chuyên dùng để kiểm tra xem AI Agent có thể hoàn thành các tác vụ phức tạp trong terminal một cách liên tục hay không.

Bộ tiêu chuẩn bao gồm 46 tác vụ, bao phủ các lĩnh vực như kỹ thuật phần mềm, tái tạo thí nghiệm, tính toán khoa học và phân tích đa phương thức. Mỗi tác vụ chạy tối đa 90 phút, thường yêu cầu thao tác liên tục hàng trăm bước.

LHTB không chỉ nhìn vào kết quả cuối cùng. Nếu hoàn thành một phần tác vụ, cũng sẽ được tính điểm theo tiến độ thực tế. Trình xác thực ẩn sẽ kiểm tra tệp tin, kết quả kiểm tra và đầu ra chương trình; Agent tự nhận hoàn thành không được tính.

Phiên bản đầu tiên của bài báo đã thử nghiệm 15 mô hình. GPT-5.5 hoàn thành 7 tác vụ, đứng đầu. Mỗi mô hình thực hiện một tác vụ, tiêu thụ trung bình khoảng 9,9 triệu Token, mất khoảng 85 phút.

Kết quả công khai hiện tại đã mở rộng lên 20 mô hình. Grok 4.5 đứng đầu với điểm trung bình 0,505, hoàn thành 13 tác vụ. Trong số 46 tác vụ, vẫn có 29 tác vụ không có mô hình nào đạt tiêu chuẩn hoàn thành.

Hầu hết Agent có thể hoàn thành một số bước, nhưng thường xuyên hết 90 phút, hoặc kết thúc sớm khi tác vụ chưa hoàn thành, không thể thực sự làm xong các tác vụ phức tạp.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành