动察 Beating AI tin nhanh, Tencent Hunyuan hợp tác với Đại học Thanh Hoa và Đại học Bắc Kinh ra mắt IWC-Bench, chuyên đánh giá xem các trang web do AI tạo ra thực sự hoạt động như thế nào khi sử dụng.
Nhiều đánh giá về tạo trang web chủ yếu nhìn vào mã hoặc ảnh chụp màn hình. Trang có thể trông rất đẹp, trong mã cũng thực sự có viết chức năng, nhưng nút bấm không mở được, biểu mẫu không gửi được, chuyển trang là báo lỗi, những vấn đề này rất khó phát hiện qua kiểm tra tĩnh.
IWC-Bench giống như nghiệm thu bởi người thật hơn. Nó để một Agent thực sự mở trang web, nhấp nút, nhập nội dung, chuyển trang, rồi kiểm tra xem những chức năng nào thực sự đã chạy. Cuối cùng đánh giá riêng ba điều: trang có đẹp không, thao tác có thuận không, các chức năng người dùng yêu cầu có được làm ra không.
Benchmark thu thập 369 nhu cầu người dùng thực tế và 5088 tiêu chuẩn nghiệm thu, 17 mô hình tổng cộng tạo ra 6273 ứng dụng web. Trong 197 nhóm so sánh được con người kiểm tra lại khác, IWC-Bench có 168 nhóm lựa chọn nhất quán với con người, tỷ lệ nhất quán đạt 85,3%.
Kết quả cũng cho thấy, trang web "trông có vẻ ổn" và "thực sự dễ dùng" không phải là một chuyện. GPT-5.6-Sol có độ đẹp trang cao nhất, nhưng tính dễ dùng chỉ xếp thứ sáu; cụ thể đến từng trang web, đẹp cơ bản không thể nói lên nó có dễ dùng hay không, hệ số tương quan của hai hạng mục chỉ là 0,36.
