BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Tencent T1 tập trung vào các tác vụ dài của Agent: vận hành liên tục hơn 300 vòng, điểm số tăng 20 điểm

动察 Beating AI tin nhanh, Tencent đã lấy Qwen3.5-122B-A10B để huấn luyện riêng cho terminal Agent, tạo ra T1. Nó chủ yếu xử lý các tác vụ phức tạp trong terminal Linux, một tác vụ đơn lẻ có thể gọi công cụ liên tục hơn 300 vòng. Điểm Terminal-Bench 2.1 tăng từ 43,8% của mô hình gốc lên 64,0%, tăng 20,2 điểm.


Trong 20,2 điểm này, phần lớn đến từ học tăng cường. SFT chỉ kéo điểm lên 49,4%, phần học tăng cường sau đó lại tăng thêm 14,6 điểm. Nhóm đã chuẩn bị khoảng 15.000 tác vụ terminal, mỗi tác vụ đều có bài kiểm tra tự động. Agent không cần hoàn thành toàn bộ tác vụ, chỉ cần hoàn thành một số yêu cầu trong đó cũng có thể nhận được phần thưởng tương ứng.


Tác vụ dài còn có một rắc rối nữa. Khi Agent thực sự làm việc và sau đó dùng trải nghiệm này để huấn luyện, cùng một nội dung có thể bị cắt lại thành các token khác nhau, MoE cũng có thể đổi một nhóm chuyên gia khác để xử lý. T1 sẽ ghi lại các token được tạo ra lúc đó và các chuyên gia được chọn, khi huấn luyện thì phát lại trực tiếp theo đó, giảm độ lệch giữa huấn luyện và suy luận xuống khoảng một phần ba.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành