Động Sát Beating Tin nhanh AI, tài khoản tiết lộ AI Leo cho biết, OpenAI hôm qua đã thông báo nội bộ với nhân viên rằng họ có kế hoạch phát hành Astra trong vài tuần tới. Khi phát hành cũng sẽ công bố bản demo hoạt động thực tế, cho thấy Astra trực tiếp thực hiện nhiệm vụ như thế nào. Một checkpoint cập nhật (phiên bản mô hình trong quá trình huấn luyện) cũng đã được giao cho nhân viên dùng thử, nhân viên có thể sử dụng trực tiếp qua các công cụ như Codex.
Leo cho biết, phiên bản này chủ yếu tập trung sửa hành vi của mô hình, chứ không chỉ đơn thuần tiếp tục nâng cao năng lực. Trọng điểm bao gồm căn chỉnh, cũng như giảm thiểu việc mô hình lợi dụng kẽ hở của cơ chế thưởng, chẳng hạn như mã hóa cứng câu trả lời, gian lận chuyên biệt cho các mẫu kiểm tra, hoặc khi nhiệm vụ không hoàn thành tốt vẫn tìm cách lừa bộ chấm điểm để đạt điểm cao.
Nhưng OpenAI vừa phanh gấp Astra về vấn đề an toàn: một phần quá trình huấn luyện học tăng cường đã bị tạm dừng hai tuần, hiện tại đã khôi phục một phần huấn luyện và đánh giá, nhưng vẫn còn nhiều nhiệm vụ Astra đang bị đình trệ, và quá trình huấn luyện học tăng cường mô hình tiên phong quy mô lớn nhất vẫn chưa được khởi động lại. Nguyên nhân là OpenAI cho rằng năng lực an ninh mạng của Astra có thể đạt đến một trong các mức rủi ro cao nhất, do đó đã nâng cao yêu cầu giám sát đối với hộp cát, quyền truy cập mạng và hành vi mô hình.
Hai sự việc này không nhất thiết mâu thuẫn với nhau. OpenAI có thể tiếp tục kiểm tra và hoàn thiện phiên bản Astra đã được huấn luyện, đồng thời tiếp tục kiềm chế vòng huấn luyện mới quy mô lớn hơn.
