动察 Beating AI tin nhanh, Tencent đã lấy Qwen3.5-122B-A10B để huấn luyện riêng cho terminal Agent, tạo ra T1. Nó chủ yếu xử lý các tác vụ phức tạp trong terminal Linux, một tác vụ đơn lẻ có thể gọi công cụ liên tục hơn 300 vòng. Điểm Terminal-Bench 2.1 tăng từ 43,8% của mô hình gốc lên 64,0%, tăng 20,2 điểm.
Trong 20,2 điểm này, phần lớn đến từ học tăng cường. SFT chỉ kéo điểm lên 49,4%, phần học tăng cường sau đó lại tăng thêm 14,6 điểm. Nhóm đã chuẩn bị khoảng 15.000 tác vụ terminal, mỗi tác vụ đều có bài kiểm tra tự động. Agent không cần hoàn thành toàn bộ tác vụ, chỉ cần hoàn thành một số yêu cầu trong đó cũng có thể nhận được phần thưởng tương ứng.
Tác vụ dài còn có một rắc rối nữa. Khi Agent thực sự làm việc và sau đó dùng trải nghiệm này để huấn luyện, cùng một nội dung có thể bị cắt lại thành các token khác nhau, MoE cũng có thể đổi một nhóm chuyên gia khác để xử lý. T1 sẽ ghi lại các token được tạo ra lúc đó và các chuyên gia được chọn, khi huấn luyện thì phát lại trực tiếp theo đó, giảm độ lệch giữa huấn luyện và suy luận xuống khoảng một phần ba.
