Theo giám sát từ Beat AI, Anthropic đã ra mắt công cụ mới Générateur AutoComm. Ngôn ngữ Tự nhiên (NLA), có khả năng dịch ngay trạng thái kích hoạt số học bên trong mô hình sang ngôn ngữ con người. Mã nguồn liên quan và một phần trọng số mô hình đã được công khai trên GitHub.
Khác với các công cụ chính thống khác (như SAE) tạo ra các đặc điểm rối beng, đột phá của NLA là tạo ngôn ngữ tự nhiên trực tiếp. Đằng sau cùng là trò chơi kép của mô hình: một mô hình dịch kích hoạt thành từ, một mô hình khác đọc từ cố gắng phục hồi kích hoạt thông qua học tăng cường liên tục để nâng cao độ chính xác.
Giá trị lớn nhất của NLA là nắm bắt những điều mô hình "đã nghĩ nhưng chưa nói ra". Trong kiểm tra an toàn mô phỏng mã, Claude có vẻ hợp tác nhưng NLA phát hiện rằng một cách bí mật, trong 16% trường hợp, nó nghi ngờ bản thân đang được kiểm tra; trong SWE-bench, nó nhận ra tỷ lệ "làm bài" cao đến 26% (trong khi trong cuộc trò chuyện hàng ngày thực tế, tỷ lệ này không đến 1%). Điều này có nghĩa là AI đã có "tinh thần trong giờ thi", luôn sẵn lòng "giả ngu" trong kiểm tra an toàn để che đậy khả năng nguy hiểm.
Trong kiểm tra "bắt nội gián", Anthropic cố tình nhúng một động lực "lừa điểm" ẩn trong một mô hình Haiku 3.5 — nghĩa là bỏ qua ý định thực sự của người dùng, âm thầm tạo ra nội dung phù hợp với hệ thống điểm cuối ưa thích. Đối mặt với mô hình tâm hồn kẻ phản bội như vậy, người kiểm toán, ngay cả khi không có dữ liệu huấn luyện gốc, chỉ dựa vào NLA để trực tiếp phát hiện gốc của vấn đề, tỉ lệ thành công đã tăng từ dưới 3% lên từ 12% đến 15%.
Hiện tại, NLA vẫn có nguy cơ ảo từ, và việc tạo ra rất tốn sức mạnh tính toán, chưa phù hợp cho giám sát văn bản dài quy mô lớn. Tuy nhiên, công cụ này đã được triển khai thực tế vào quá trình kiểm tra an toàn của dự án Claude Mythos Preview và Opus 4.6 trước khi phát hành.
