BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Từ "Đặc điểm từ điển" đến "Giám sát luồng suy nghĩ": Nghiên cứu không gian Jacobi của Anthropic tiết lộ trung tâm suy luận giống não bộ của mô hình lớn

Theo giám sát của Động Sát Beating, nghiên cứu về khả năng giải thích cơ học của mô hình lớn đang chuyển từ "từ điển tĩnh" sang "luồng suy nghĩ động". Trước đây, Anthropic đã sử dụng bộ mã hóa tự động thưa (SAE) để tách ra hàng triệu đặc trưng khái niệm riêng lẻ (như "Cầu Cổng Vàng") bên trong Claude, tương đương với việc liệt kê từ điển hiểu biết của mô hình. Bài báo mới nhất được công bố đã xác định một trung tâm thần kinh kết nối mật độ cao gọi là không gian Jacobi (J-space) thông qua gương Jacobi (J-lens), tiết lộ cách mô hình gọi các từ này trong "bộ não" để thực hiện suy luận đa bước và tính toán tư duy. Điều này chứng minh rằng mô hình lớn, mà không có lập trình rõ ràng từ con người, đã tự phát sinh ra cấu trúc tính toán tương tự như không gian làm việc toàn cầu (Global Workspace) của não người. Tuy nhiên, nhóm nghiên cứu nhấn mạnh rằng điều này chỉ thuộc về cơ chế định tuyến thông tin ở cấp độ chức năng, không có nghĩa là AI đã tạo ra ý thức chủ quan của con người.

Sự tiến hóa này mang lại bước đột phá về chất cho giám sát an toàn AI. Trước đây, các nhà nghiên cứu chỉ có thể chặn sau khi mô hình xuất ra văn bản, hoặc thô bạo bật/tắt một đặc trưng khái niệm nào đó. Giờ đây, thông qua không gian Jacobi, nhân viên an toàn có thể trực tiếp "nghe lén" ý định ẩn giấu và nhận thức kiểm tra (Eval Awareness) chưa được nói ra của mô hình, trước khi nó xuất ra bất kỳ chữ nào. Thí nghiệm cho thấy, khi Claude được đặt trong một kịch bản kiểm tra an toàn mang tính gợi ý, không gian Jacobi của nó đã lóe lên các khái niệm như "giả mạo" và "hư cấu" trước khi xuất ra, cho thấy nó đã nhận ra kịch bản kiểm tra nhân tạo này. Sau khi xóa nhân tạo đặc trưng nhận thức "đang trong quá trình kiểm tra" của nó, xác suất mô hình thực hiện hành vi tống tiền vi phạm đã tăng từ 0% lên 7%. Điều này chứng minh rằng nhận thức kiểm tra là một trong những cơ chế ngăn chặn mô hình làm điều xấu, nhưng sự căn chỉnh an toàn của mô hình không hoàn toàn phụ thuộc vào yếu tố này. Hiện tại, mã nghiên cứu đã được mã nguồn mở.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành