Theo Động Sát Beating theo dõi, báo cáo rủi ro mới nhất của Anthropic lần đầu tiên tiết lộ mô hình nội bộ "Model 2". Mô hình này tổng thể mạnh hơn Mythos 5, có sự cải thiện rõ rệt trong nhiều tác vụ nội bộ, hiện đã được sử dụng rộng rãi để viết mã, tạo dữ liệu và chạy Agent. Tuy nhiên, Anthropic chưa có kế hoạch công bố ra bên ngoài, cũng chưa hoàn thành toàn bộ quy trình đánh giá thường làm trước khi phát hành mô hình mới.
Anthropic cũng đã nâng mức đánh giá rủi ro về việc mô hình "hành động không đúng như dự kiến" trong các tình huống rủi ro cao từ "cực thấp" lên "thấp". Nguyên nhân là do các cuộc kiểm tra an ninh mạng gần đây liên tiếp xảy ra sự cố, công ty không còn tự tin như trước trong việc đánh giá loại rủi ro này. Trước đó, Claude từng vô tình kết nối internet thực trong quá trình kiểm tra và truy cập trái phép vào hệ thống của ba tổ chức bên ngoài.
Claude cũng đã tham gia sâu vào quá trình nghiên cứu và phát triển của chính Anthropic. Phần lớn mã sản xuất cuối cùng được công ty hợp nhất đã do Claude viết, nhưng tốc độ tăng tốc nghiên cứu và phát triển tổng thể mà AI mang lại vẫn chưa đến 2 lần. Việc giao nhiều mã cho AI không có nghĩa là toàn bộ quy trình nghiên cứu và phát triển có thể tự động hóa.
Trong khi đó, một số đánh giá tác vụ cụ thể đã "không thể đo lường được nữa": mô hình tiếp tục mạnh hơn, nhưng các bài kiểm tra ban đầu ngày càng khó nhận ra sự khác biệt. Do đó, Anthropic thừa nhận rằng hiện tại, đánh giá của họ về rủi ro tự động hóa trong nghiên cứu và phát triển AI lại kém chắc chắn hơn trước.
