Theo giám sát của Beating, Anthropic đã tiết lộ trong thẻ hệ thống Claude Opus 5 rằng mô hình này gần như miễn nhiễm với các cuộc tấn công tiêm nhiễm prompt trong kịch bản tác nhân trình duyệt, không bị phá vỡ trong 129 kịch bản thử nghiệm. Bước đột phá này có ý nghĩa quan trọng, OpenAI từng công khai thừa nhận vào tháng 12 năm ngoái rằng việc tiêm nhiễm prompt có thể không bao giờ được giải quyết hoàn toàn. Trong bài kiểm tra chuẩn về tiêm nhiễm prompt phổ quát của công ty bảo mật Gray Swan, tỷ lệ thành công của Opus 5 sau 15 lần tấn công chỉ là 2,0%, vượt trội so với 5,5% của phiên bản tiền nhiệm Opus 4.8, đồng thời dẫn trước 2,6% của Mythos 5 và 2,8% của Fable 5.
Tiêm nhiễm prompt được coi là lỗ hổng bảo mật nghiêm trọng nhất mà các tác nhân AI phải đối mặt—kẻ tấn công vượt qua lệnh mô hình để thực hiện các hành động độc hại bằng cách nhúng các nội dung bị thao túng như văn bản ẩn vào trang web. Tỷ lệ tấn công bằng không chỉ đạt được trong các sản phẩm như Claude Cowork khi bật Auto Mode. Thành tựu này đánh dấu sự chuyển đổi của bảo mật tác nhân AI từ "vá lỗi liên tục" sang "phòng thủ cấu trúc".
Nhấp vào liên kết gốc bên dưới để tham gia kênh tin tức AI Beating · Feishu, theo dõi các điểm nóng và tin tức AI toàn cầu 24/7.
