Theo dữ liệu giám sát từ Động Sát Beating, Artificial Analysis vừa ra mắt một bài kiểm tra năng lực phân tích AI mới mang tên AA-AnalystAgent. Bài kiểm tra này yêu cầu mô hình xử lý các bảng biểu và tài liệu thực tế, hoàn thành các nhiệm vụ như thống kê dữ liệu, phân tích xu hướng, lập mô hình tài chính. Bài kiểm tra gồm 80 câu hỏi, mỗi câu được yêu cầu mô hình thực hiện độc lập 5 lần, chỉ khi cả 5 lần đều trả lời đúng mới được tính là vượt qua.
Kết quả đứng đầu là Claude Opus 5, nhưng cũng chỉ có 54% số câu đạt được yêu cầu trả lời đúng liên tiếp 5 lần. GPT-5.5 xếp thứ hai với tỷ lệ vượt qua là 50%; Claude Fable 5 đạt 49%. Trong số các mô hình trọng số mở, mô hình hoạt động tốt nhất là Kimi K3 với 39%.
Nếu chỉ xét tỷ lệ trả lời đúng trung bình của mỗi lần thực hiện, GPT-5.5 thực sự cao nhất, đạt 66%. Nhưng khi yêu cầu cùng một câu hỏi trả lời đúng liên tiếp 5 lần, tỷ lệ vượt qua của nó chỉ còn 50%. Claude Opus 5 có tỷ lệ trả lời đúng từng lần thấp hơn một chút, nhưng lại ổn định hơn, nên cuối cùng xếp ở vị trí đầu tiên.
Vấn đề phổ biến nhất của AI không phải là không biết tính toán, mà là ngay từ đầu đã hiểu sai đề bài. Artificial Analysis đã phân tích 1567 bản ghi thất bại, trong đó 57% xuất hiện tình huống này: mô hình quá sớm khẳng định một cách diễn giải sai, sau đó cứ tiếp tục đi theo hướng đó.
