Theo Động Sát Beating giám sát, bảng xếp hạng Arena Agent dựa trên các nhiệm vụ người dùng thực tế và bản ghi gọi công cụ. Mức cải thiện tổng hợp thuần của Kimi K3 là 9,62%, xếp thứ 4. Nó đứng sau Claude Fable 5, Claude Opus 4.8 Thinking và GPT-5.6 Sol.
Arena trộn đều tất cả các mô hình tham gia đánh giá thành một chuẩn trung bình ảo, sau đó ước tính mức cải thiện của từng kết quả khi thay bằng K3. Năm chỉ số cải thiện thuần cuối cùng được lấy trung bình để ra điểm tổng hợp.
K3 đã tích lũy 8344 phiên kiểm tra. Chỉ số thành công do người dùng xác nhận cải thiện thuần 14,42%, xếp hạng nhất. Chỉ số khen nhiều hơn chê cải thiện 20,62%, xếp hạng ba. Thực thi sửa lỗi của nó xếp hạng 14, phục hồi lỗi Bash xếp hạng 17. K3 dễ đưa ra kết quả được người dùng chấp nhận hơn, nhưng sửa lỗi giữa chừng và phục hồi lỗi lệnh vẫn là điểm yếu.
