BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Chống chưng cất của Claude khó có hiệu quả: mô hình nhỏ có thể trực tiếp moi ra chuỗi suy nghĩ của mô hình lớn

Theo 动察 Beating theo dõi, các nhà sản xuất mô hình lớn để ngăn chặn năng lực bị chưng cất, sẽ che giấu chuỗi suy luận hoàn chỉnh, chỉ đưa cho người dùng một bản tóm tắt. Nhưng nghiên cứu mới nhất phát hiện ra rằng, lớp bảo vệ này có thể không vững chắc như tưởng tượng: đưa chuỗi suy luận mã hóa của Opus cho mô hình yếu hơn cùng hãng là Haiku, rồi vượt rào Haiku, có thể khiến nó trực tiếp lặp lại suy luận gốc của Opus. Các nhà nghiên cứu đã chạy thử thành công trên Claude, GPT và Gemini.

Việc này thực ra đã được chuẩn bị từ vài tháng trước. Vào tháng 5, nhà mật mã học Matthew Green phát hiện ra rằng các chuỗi suy luận mã hóa này có thể phát lại xuyên phiên, xuyên tài khoản, nhưng lúc đó vẫn chưa tìm ra phương pháp ổn định để đọc nội dung. Bài nghiên cứu mới đã hoàn thiện bước cuối cùng: không cần phá vỡ thuật toán mã hóa, chỉ cần để chính mô hình của hãng giúp bạn "giải mã".

Sớm hơn vào tháng 3, John X. Morris, đồng sáng lập kiêm trưởng nhóm nghiên cứu của Engram hiện tại, cùng những người khác đã chứng minh một con đường khác: ngay cả khi hoàn toàn không lấy được chuỗi suy luận gốc, chỉ nhìn vào câu trả lời và bản tóm tắt suy luận, vẫn có thể suy ngược ra một bộ suy luận tổng hợp chi tiết, rồi dùng để huấn luyện mô hình nhỏ.

Điều này cũng khiến cho tin đồn trước đây rằng "các công ty AI nội địa đã tìm ra cách lấy suy luận gốc của Claude, Codex, rồi dùng để huấn luyện mô hình" trở nên hợp lý hơn về mặt kỹ thuật. Nhưng điều này vẫn chỉ chứng minh phương pháp khả thi, không thể chứng minh bất kỳ phòng thí nghiệm AI nội địa nào thực sự đã làm như vậy.

Bài nghiên cứu cũng thử nghiệm Kimi K3. Chỉ cần nhét vài token suy luận của Opus vào, suy luận phía sau của K3 sẽ rõ ràng tiến gần về phía Opus; một số đoạn suy luận gốc của Claude, GPT khi trích xuất từ Kimi K3 dễ hơn các mô hình khác tối đa khoảng 6 bậc độ lớn, nhưng tác giả nói rõ rằng không thể dựa vào đó để chứng minh việc chưng cất.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành