BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Thông tin cứ thay đổi liên tục, mô hình lớn sẽ rối loạn: ngay cả GPT-5.5 có hiệu suất tốt nhất cũng chỉ trả lời đúng 59,3%

Động Sát Beating AI tin nhanh, nhóm Tencent Hunyuan và các nhóm khác đã công bố EvolveScaler, chuyên kiểm tra xem mô hình lớn có thể theo kịp thông tin liên tục thay đổi hay không. Nó sẽ liên tục thêm vào các thông tin sửa đổi, rút lại, bổ sung và vô hiệu hóa trong văn bản dài, rồi để mô hình trả lời câu hỏi dựa trên trạng thái mới nhất.


Ví dụ, trước tiên cho mô hình xem bản ghi trò chơi 40 ngày, rồi hỏi: "Nếu ngày thứ 7 không đánh con Boss nhỏ đó, cuối cùng còn có thể thắng không?" Điều này sẽ kéo theo thay đổi về trang bị, lượng máu và kết quả chiến đấu sau đó. Mô hình phải bắt đầu từ ngày thứ 7, suy luận lại hàng chục ngày sau đó, trong văn bản gốc không có đáp án sẵn.


Nhóm đã thiết kế 117 loại nhiệm vụ, 159 loại câu hỏi, dài nhất khoảng 1200 sự kiện. 14 cấu hình mô hình bao gồm GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 và Qwen3.5 Plus. Ở mức khó nhất, điểm trung vị chỉ có 11,3%; GPT-5.5-xhigh thể hiện tốt nhất cũng chỉ đạt 59,3%.


Bộ dữ liệu này cũng có thể dùng để huấn luyện mô hình. Một mô hình A3B nội bộ sau khi thêm 6000 mẫu dữ liệu loại này, đã cải thiện trên cả 8 bài kiểm tra bên ngoài, trung bình tăng 5,25 điểm.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành