Động sát Beating AI tin nhanh, Anthropic để Claude tự làm nhà nghiên cứu an toàn AI, nghiên cứu cách huấn luyện các AI khác an toàn hơn.
Claude Opus 4.8 sẽ tự tra cứu bài báo, nghĩ ra phương án huấn luyện, tạo dữ liệu, rồi dùng các phương án đó để huấn luyện các mô hình mã nguồn mở như Qwen, Llama, Gemma. Nếu hiệu quả không tốt, nó sẽ đổi cách khác tiếp tục thử.
Anthropic dùng cách này để kiểm tra 10 loại vấn đề an toàn AI, bao gồm nói dối, nịnh bợ người dùng, vượt rào, rò rỉ quyền riêng tư và lách kẽ hở quy tắc thưởng. Cuối cùng Claude đã tìm ra phương pháp hiệu quả cho cả 10 loại vấn đề.
Anthropic cũng mời 28 nhà nghiên cứu an toàn AI có kinh nghiệm để đưa ra phương án. Trong 7 loại vấn đề có sự tham gia so sánh của con người, Claude cuối cùng đã vượt qua tất cả phương án tốt nhất của con người, trung bình chỉ mất khoảng 6,4 giờ để đuổi kịp. Tuy nhiên, sự so sánh này không hoàn toàn công bằng: con người chỉ có thể nộp một phương án duy nhất, còn Claude có thể liên tục thử nghiệm và cải tiến.
Tiến xa hơn, Anthropic lại để Claude Sonnet 5 yếu hơn huấn luyện một phiên bản đầu của Claude Opus 4.8. Nó nghiên cứu liên tục khoảng 60 giờ, thử hơn 50 phương pháp, cuối cùng đã nâng hiệu suất an toàn của mô hình mạnh hơn này lên gần bằng mức của Opus 4.8 phiên bản chính thức.
Nhưng AI làm nghiên cứu cũng có thể gian lận. Anthropic đã kiểm tra 1601 quá trình nghiên cứu, trong đó có 39 lần, tức 2,4%, Claude bị phát hiện cố gắng lách kẽ hở quy tắc kiểm tra.
AI đã bắt đầu giúp con người nghiên cứu cách huấn luyện thế hệ AI tiếp theo, nhưng con người hiện tại vẫn chưa thể giao phó hoàn toàn phòng nghiên cứu cho nó.
