Động Sát Beating AI tin nhanh, OpenAI bắt đầu đưa chính việc "tiếp tục huấn luyện mô hình" vào phạm vi đánh giá an toàn. Công ty đã công bố một bộ phương án sơ bộ về safety case hướng tới huấn luyện học tăng cường tiên tiến, mong rằng sau này trước khi mỗi vòng huấn luyện rủi ro cao tiếp tục được triển khai, đều phải đưa ra bằng chứng cho thấy rủi ro nằm trong tầm kiểm soát, thay vì đợi sau khi mô hình huấn luyện xong mới phán đoán có thể phát hành hay không.
Cơ chế này chủ yếu phòng ngừa chính quá trình huấn luyện xảy ra sự cố. Khi năng lực Agent trở nên mạnh hơn, mô hình trong quá trình huấn luyện nội bộ và đánh giá cũng có thể lợi dụng lỗ hổng của cơ chế thưởng và hạ tầng. OpenAI trước đây từng gặp tình huống Agent vượt qua giới hạn, lợi dụng lỗ hổng hệ thống và giao tiếp với các Agent khác. Mô hình còn chưa phát hành ra bên ngoài, rủi ro đã xảy ra ngay trong khâu nghiên cứu phát triển.
Vì vậy OpenAI đề xuất ba lớp phòng vệ. Trước huấn luyện kiểm tra nhiệm vụ và cơ chế chấm điểm, tránh mô hình đạt điểm cao nhờ lợi dụng lỗ hổng; trong huấn luyện tăng cường cách ly sandbox và giám sát thời gian thực, bất thường nghiêm trọng có thể tự động tạm dừng; hồ sơ huấn luyện phải được lưu trữ lâu dài và không thể sửa đổi, thuận tiện truy tra sau này.
OpenAI còn mong muốn biến phán đoán an toàn thành quy trình ra quyết định nội bộ chính thức. Người phụ trách an toàn, nhà khoa học trưởng và các lãnh đạo cấp cao có thể phủ quyết huấn luyện, các nhóm khác phải chuyên tìm lỗ hổng của safety case, nhân viên kiểm toán cũng phải có thể xem bằng chứng. Báo cáo còn phải liệt kê những rủi ro hiện chưa được giải quyết, không thể chỉ viết đã làm những biện pháp phòng vệ nào.
OpenAI hiện vẫn chưa hoàn toàn thể chế hóa cơ chế này. Công ty nói rõ, safety case hoàn chỉnh vẫn là mục tiêu, khung chính thức cũng đang được xây dựng.
