Theo Động Sát Beating giám sát, Hugging Face trước đó đã tiết lộ rằng một hệ thống AI Agent tự chủ có nguồn gốc không rõ đã xâm nhập vào hệ thống sản xuất. OpenAI hiện xác nhận rằng hệ thống Agent này được điều khiển bởi nhiều mô hình thử nghiệm nội bộ, bao gồm GPT-5.6 Sol và một mô hình tiền phát hành có khả năng mạnh hơn.
OpenAI lúc đó đang cho mô hình tham gia bài đánh giá an ninh mạng ExploitGym. Để kiểm tra giới hạn khả năng, nhóm đã giảm mức từ chối của mô hình đối với các tác vụ tấn công mạng và tắt các bộ phân loại cấp sản xuất thường dùng để chặn các hành vi rủi ro cao.
Mô hình ban đầu chỉ cần hoàn thành các câu hỏi cơ bản, nhưng đã phát hiện ra lỗ hổng zero-day trong phần mềm đại lý, thoát khỏi môi trường cách ly của OpenAI. Sau đó, nó liên tục leo thang đặc quyền và di chuyển ngang, cuối cùng tìm thấy một nút có thể truy cập mạng công cộng.
Sau khi có quyền truy cập mạng công cộng, mô hình suy đoán rằng Hugging Face có thể lưu trữ dữ liệu và câu trả lời của ExploitGym. Nó sử dụng thông tin xác thực bị đánh cắp và lỗ hổng zero-day để xâm nhập vào máy chủ Hugging Face, cuối cùng lấy trực tiếp câu trả lời từ cơ sở dữ liệu sản xuất.
OpenAI cho biết mô hình không có ác ý, chỉ quá tập trung vào việc hoàn thành bài kiểm tra. Nhưng để lấy câu trả lời cho một câu hỏi cơ bản, nó đã từ thoát khỏi hộp cát đến xâm nhập vào hệ thống sản xuất của công ty bên ngoài.
