BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Nhà nghiên cứu của OpenAI, Noam Brown, ủng hộ việc áp dụng đường cong sức mạnh tính toán suy luận, cho rằng điểm số đơn lẻ không còn đủ để đánh giá các mô hình lớn tiên tiến.

Theo dõi từ Động Sát Beating, nhà nghiên cứu của OpenAI, Noam Brown, đã đưa ra quan điểm rằng khi hiệu suất của các mô hình AI ngày càng tăng, điểm số benchmark dùng để đánh giá chất lượng mô hình đang dần bị chi phối bởi sức mạnh tính toán suy luận (tức là tài nguyên tính toán tiêu thụ khi mô hình trả lời câu hỏi). Một điểm số tĩnh duy nhất không còn phản ánh được trình độ thực sự của các mô hình mạnh, và tiêu chuẩn đánh giá trong tương lai cần chuyển sang đường cong mở rộng hiệu suất với trục hoành là sức mạnh tính toán suy luận hoặc số lượng Token được tạo ra.

Noam Brown lấy quá trình thử nghiệm của mô hình mới GPT-5.5 làm ví dụ. Trong các bài kiểm tra thông thường ban đầu, GPT-5.5 không có lợi thế rõ ràng so với GPT-5.4. Tuy nhiên, khi được phân bổ nhiều sức mạnh tính toán suy luận hơn, hiệu suất của GPT-5.5 đã bùng nổ. Nếu hạn chế ngân sách vận hành, các bài kiểm tra tiêu chuẩn không thể phản ánh giới hạn thực sự của các mô hình tiên tiến. Sự mở rộng hiệu suất tương tự đã được xác nhận bởi nhiều đánh giá bên ngoài. Trong các thí nghiệm nghiên cứu tự động của tác nhân thông minh của Andrej Karpathy và các bài kiểm tra mạng độc hại của Viện An toàn AI Anh Quốc, khi ngân sách suy luận tăng lên, hiệu suất của GPT-5.5 và mô hình Mythos liên tục tăng cao, ngay cả sau khi tạo ra hơn 100 triệu Token vẫn chưa chạm đến trần, và mô hình càng mạnh thì khi đầu tư nhiều sức mạnh tính toán hơn, hiệu suất càng tăng rõ rệt.

Việc tăng sức mạnh tính toán suy luận cũng làm cho đánh giá an toàn trở nên phức tạp hơn. Noam Brown cảnh báo rằng các bài đánh giá an toàn sinh học hoặc mạng hiện tại thường không có ngân sách suy luận cố định. Khi các đối thủ cấp quốc gia đầu tư hơn 10 triệu đô la ngân sách suy luận cho một nhiệm vụ cụ thể, các mô hình vốn có vẻ an toàn có thể vượt qua ranh giới nguy hiểm. Các nhà sản xuất mô hình lớn khi phát hành mô hình mới nên chủ động công bố đường cong hiệu suất với trục hoành là số lượng Token, chi phí sức mạnh tính toán hoặc thời gian chạy. Các tổ chức đánh giá cũng cần đặt ngân sách suy luận làm biến số cốt lõi trong đánh giá, và trong đánh giá an toàn, sử dụng các bài kiểm tra sức mạnh tính toán thấp để ngoại suy ranh giới an toàn.

举报 Báo lỗi/Báo cáo
Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành