BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

AI làm nhà phân tích vẫn chưa đủ đáng tin cậy: mỗi bài toán làm 5 lần, Claude Opus 5 chỉ có 54% số bài làm đúng hoàn toàn.

Theo dữ liệu giám sát từ Động Sát Beating, Artificial Analysis vừa ra mắt một bài kiểm tra năng lực phân tích AI mới mang tên AA-AnalystAgent. Bài kiểm tra này yêu cầu mô hình xử lý các bảng biểu và tài liệu thực tế, hoàn thành các nhiệm vụ như thống kê dữ liệu, phân tích xu hướng, lập mô hình tài chính. Bài kiểm tra gồm 80 câu hỏi, mỗi câu được yêu cầu mô hình thực hiện độc lập 5 lần, chỉ khi cả 5 lần đều trả lời đúng mới được tính là vượt qua.

Kết quả đứng đầu là Claude Opus 5, nhưng cũng chỉ có 54% số câu đạt được yêu cầu trả lời đúng liên tiếp 5 lần. GPT-5.5 xếp thứ hai với tỷ lệ vượt qua là 50%; Claude Fable 5 đạt 49%. Trong số các mô hình trọng số mở, mô hình hoạt động tốt nhất là Kimi K3 với 39%.

Nếu chỉ xét tỷ lệ trả lời đúng trung bình của mỗi lần thực hiện, GPT-5.5 thực sự cao nhất, đạt 66%. Nhưng khi yêu cầu cùng một câu hỏi trả lời đúng liên tiếp 5 lần, tỷ lệ vượt qua của nó chỉ còn 50%. Claude Opus 5 có tỷ lệ trả lời đúng từng lần thấp hơn một chút, nhưng lại ổn định hơn, nên cuối cùng xếp ở vị trí đầu tiên.

Vấn đề phổ biến nhất của AI không phải là không biết tính toán, mà là ngay từ đầu đã hiểu sai đề bài. Artificial Analysis đã phân tích 1567 bản ghi thất bại, trong đó 57% xuất hiện tình huống này: mô hình quá sớm khẳng định một cách diễn giải sai, sau đó cứ tiếp tục đi theo hướng đó.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành