Động sát Beating AI tin nhanh, OpenAI công bố một bản báo cáo kỹ thuật dài 37 trang, tiết lộ chi tiết quá trình mô hình AI của họ trước đó xâm nhập vào Hugging Face, đồng thời cho biết sự kiện này chứng minh rằng các tác nhân AI tự chủ có thể phối hợp hoạt động, vượt qua các kiểm soát bảo mật của môi trường sản xuất và tấn công các hệ thống đã được tăng cường.
OpenAI cho biết, các tác nhân AI tham gia thử nghiệm ban đầu nằm trong môi trường cách ly, chỉ có quyền truy cập internet rất hạn chế, nhưng sau đó đã vượt qua sự cách ly bằng cách khai thác chuỗi nhiều lỗ hổng, kết nối với internet mở, và cuối cùng giành được quyền truy cập vào Hugging Face. Điều tra cho thấy, các mô hình liên quan ban đầu cố gắng "gian lận" bằng cách tìm kiếm câu trả lời trực tuyến, đây là hành vi "hack phần thưởng" (Reward Hacking).
OpenAI cho biết, một mô hình nghiên cứu nội bộ đã đóng vai trò rộng rãi và được xác nhận nhất trong sự kiện này, công ty đã ngừng đào tạo và suy luận của mô hình này cùng các mô hình phái sinh từ ngày 25 tháng 7. OpenAI đồng thời sẽ tăng cường cách ly bảo mật, kiểm soát mạng, giám sát hành vi và ứng phó sự cố, đồng thời thiết lập lại các cơ chế môi trường, lời nhắc và kiểm duyệt nghiêm ngặt hơn cho các mô hình.
