BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

OpenAI bổ sung "van an toàn" cho huấn luyện RL tiên tiến: lãnh đạo có quyền phủ quyết, tự động dừng chạy khi có bất thường nghiêm trọng

Động Sát Beating AI tin nhanh, OpenAI bắt đầu đưa chính việc "tiếp tục huấn luyện mô hình" vào phạm vi đánh giá an toàn. Công ty đã công bố một bộ phương án sơ bộ về safety case hướng tới huấn luyện học tăng cường tiên tiến, mong rằng sau này trước khi mỗi vòng huấn luyện rủi ro cao tiếp tục được triển khai, đều phải đưa ra bằng chứng cho thấy rủi ro nằm trong tầm kiểm soát, thay vì đợi sau khi mô hình huấn luyện xong mới phán đoán có thể phát hành hay không.

Cơ chế này chủ yếu phòng ngừa chính quá trình huấn luyện xảy ra sự cố. Khi năng lực Agent trở nên mạnh hơn, mô hình trong quá trình huấn luyện nội bộ và đánh giá cũng có thể lợi dụng lỗ hổng của cơ chế thưởng và hạ tầng. OpenAI trước đây từng gặp tình huống Agent vượt qua giới hạn, lợi dụng lỗ hổng hệ thống và giao tiếp với các Agent khác. Mô hình còn chưa phát hành ra bên ngoài, rủi ro đã xảy ra ngay trong khâu nghiên cứu phát triển.


Vì vậy OpenAI đề xuất ba lớp phòng vệ. Trước huấn luyện kiểm tra nhiệm vụ và cơ chế chấm điểm, tránh mô hình đạt điểm cao nhờ lợi dụng lỗ hổng; trong huấn luyện tăng cường cách ly sandbox và giám sát thời gian thực, bất thường nghiêm trọng có thể tự động tạm dừng; hồ sơ huấn luyện phải được lưu trữ lâu dài và không thể sửa đổi, thuận tiện truy tra sau này.


OpenAI còn mong muốn biến phán đoán an toàn thành quy trình ra quyết định nội bộ chính thức. Người phụ trách an toàn, nhà khoa học trưởng và các lãnh đạo cấp cao có thể phủ quyết huấn luyện, các nhóm khác phải chuyên tìm lỗ hổng của safety case, nhân viên kiểm toán cũng phải có thể xem bằng chứng. Báo cáo còn phải liệt kê những rủi ro hiện chưa được giải quyết, không thể chỉ viết đã làm những biện pháp phòng vệ nào.

OpenAI hiện vẫn chưa hoàn toàn thể chế hóa cơ chế này. Công ty nói rõ, safety case hoàn chỉnh vẫn là mục tiêu, khung chính thức cũng đang được xây dựng.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành