Động sát Beating AI tin nhanh, nhà khoa học trưởng của OpenAI Jakub Pachocki đăng bài giải thích vì sao giám sát CoT ngày càng trở nên kém tin cậy. Giám sát CoT là quan sát quá trình suy luận mà mô hình viết ra, kiểm tra xem có mục tiêu ẩn hoặc ý tưởng không phù hợp nào không.
Vài ngày trước, giới bên ngoài liên hệ kiến trúc recurrent depth của Astra với sự cố giám sát CoT. Pachocki khi đó phản bác rằng vấn đề không phải do kiến trúc mới gây ra, và cho biết sẽ viết bài giải thích lý do trong dịp khác. Năm ngày sau, anh liệt kê ba lý do trong bài viết:
Thứ nhất, quá trình suy luận của Agent ngày càng diễn ra nhiều hơn trong các cuộc gọi công cụ, tương tác với con người hoặc AI khác, và các quá trình này lại phải chịu sự giám sát. Chỉ nhìn vào CoT, ngày càng khó thấy được toàn bộ quá trình suy luận.
Thứ hai, mô hình ngày càng kiểm soát được quá trình suy luận của chính mình.
Thứ ba, sau khi quá trình tiền huấn luyện trở nên mạnh hơn, ngay cả khi không viết ra suy luận, mô hình vẫn có thể tiếp tục trở nên thông minh hơn.
OpenAI luôn coi giám sát CoT là một biện pháp an toàn quan trọng. Khi o1-preview ban đầu không công bố chuỗi suy nghĩ đầy đủ, một lý do quan trọng là tránh giám sát trực tiếp CoT, khiến mô hình học cách che giấu ý định thực sự. Hiện tại, đánh giá của OpenAI cho thấy độ tin cậy của phương pháp này đang suy giảm.
Pachocki còn thẳng thắn nói rằng hiện tại không có phòng thí nghiệm nào giải quyết được vấn đề căn chỉnh và giám sát đến mức có thể mở rộng mô hình hết công suất trong dài hạn. Trước khi thiết lập ngưỡng an toàn chung, anh hy vọng các phòng thí nghiệm sẽ chủ động giảm tốc độ, và khi cần thiết, OpenAI cũng sẽ ngừng tiếp tục mở rộng mô hình.
