Theo 动察 Beating theo dõi, các nhà sản xuất mô hình lớn để ngăn chặn năng lực bị chưng cất, sẽ che giấu chuỗi suy luận hoàn chỉnh, chỉ đưa cho người dùng một bản tóm tắt. Nhưng nghiên cứu mới nhất phát hiện ra rằng, lớp bảo vệ này có thể không vững chắc như tưởng tượng: đưa chuỗi suy luận mã hóa của Opus cho mô hình yếu hơn cùng hãng là Haiku, rồi vượt rào Haiku, có thể khiến nó trực tiếp lặp lại suy luận gốc của Opus. Các nhà nghiên cứu đã chạy thử thành công trên Claude, GPT và Gemini.
Việc này thực ra đã được chuẩn bị từ vài tháng trước. Vào tháng 5, nhà mật mã học Matthew Green phát hiện ra rằng các chuỗi suy luận mã hóa này có thể phát lại xuyên phiên, xuyên tài khoản, nhưng lúc đó vẫn chưa tìm ra phương pháp ổn định để đọc nội dung. Bài nghiên cứu mới đã hoàn thiện bước cuối cùng: không cần phá vỡ thuật toán mã hóa, chỉ cần để chính mô hình của hãng giúp bạn "giải mã".
Sớm hơn vào tháng 3, John X. Morris, đồng sáng lập kiêm trưởng nhóm nghiên cứu của Engram hiện tại, cùng những người khác đã chứng minh một con đường khác: ngay cả khi hoàn toàn không lấy được chuỗi suy luận gốc, chỉ nhìn vào câu trả lời và bản tóm tắt suy luận, vẫn có thể suy ngược ra một bộ suy luận tổng hợp chi tiết, rồi dùng để huấn luyện mô hình nhỏ.
Điều này cũng khiến cho tin đồn trước đây rằng "các công ty AI nội địa đã tìm ra cách lấy suy luận gốc của Claude, Codex, rồi dùng để huấn luyện mô hình" trở nên hợp lý hơn về mặt kỹ thuật. Nhưng điều này vẫn chỉ chứng minh phương pháp khả thi, không thể chứng minh bất kỳ phòng thí nghiệm AI nội địa nào thực sự đã làm như vậy.
Bài nghiên cứu cũng thử nghiệm Kimi K3. Chỉ cần nhét vài token suy luận của Opus vào, suy luận phía sau của K3 sẽ rõ ràng tiến gần về phía Opus; một số đoạn suy luận gốc của Claude, GPT khi trích xuất từ Kimi K3 dễ hơn các mô hình khác tối đa khoảng 6 bậc độ lớn, nhưng tác giả nói rõ rằng không thể dựa vào đó để chứng minh việc chưng cất.
