Theo Động Sát Beating giám sát, nền tảng tự động hóa quy trình làm việc Zapier đã hợp tác với tổ chức đánh giá Artificial Analysis để ra mắt chuẩn đánh giá tự động hóa quy trình SaaS độc lập mang tên AutomationBench-AA.
Chuẩn đánh giá này dựa trên dữ liệu thực đã được ẩn danh hóa trên nền tảng Zapier, thiết kế một bộ kiểm thử riêng tư bao gồm 657 tác vụ đa bước và 40 môi trường phần mềm SaaS mô phỏng (bao gồm Gmail, Slack, Salesforce, Jira, v.v.), nhằm thực hiện đánh giá khách quan từ bên thứ ba.
Điểm khắt khe của bài kiểm tra nằm ở việc đưa vào các quy tắc tuân thủ an ninh (Guardrails). Mô hình lớn phải hoàn thành thao tác mà không vi phạm bất kỳ quy tắc kinh doanh doanh nghiệp nào đã được thiết lập trước. Nếu trong quá trình thực thi xảy ra bất kỳ vi phạm tuân thủ nào, điểm số cuối cùng của tác vụ sẽ bị đặt về 0 ngay lập tức. Trong đợt đánh giá đầu tiên, các mô hình lớn thường bị giảm điểm mạnh do hình phạt tuân thủ, và điểm số cuối cùng không có mô hình nào vượt quá một nửa.
Trong số đó, Claude Fable 5, áp dụng cơ chế giảm cấp an toàn "chuyển tác vụ khó về Opus 4.8 (chiếm khoảng 18%)", đã hoàn thành 73% mục tiêu ở các bước tác vụ thuần túy, nhưng điểm tổng hợp chỉ đạt 48,6%; Gemini 3.5 Flash và GPT-5.5 dù cũng hoàn thành gần bảy phần mười mục tiêu (lần lượt là 68% và 67%), nhưng điểm cuối cùng giảm xuống còn 42,6% và 42,1%. Người dẫn đầu mã nguồn mở GLM-5.2 chỉ đạt 27,8%.
Kết quả kiểm tra cho thấy, việc mô hình duy trì phòng tuyến an toàn trong quá trình tự động hóa thao tác đã trở thành thách thức then chốt để ứng dụng thực tế.
