BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Trí Phổ Đường Kiệt nhìn lại Scaling Law: Tham số nghìn tỷ là con đường vòng mà cả ngành cùng đi qua

Động Sát Beating AI tin nhanh, đồng sáng lập Zhipu là Đường Kiệt đã đăng bài dài tổng kết về Scaling Law. Trong vài năm qua, mỗi khi mô hình lớn ra mắt, mọi người thường hỏi nhất là "bao nhiêu tham số". Nhưng theo quan điểm của Đường Kiệt, tham số từ lâu không thể giải thích riêng lẻ năng lực của mô hình. Dữ liệu có bao nhiêu, sức tính toán dùng vào đâu, mô hình sau này dùng thế nào, đều quan trọng không kém.

Ngành công nghiệp đã từng đi qua một lần đường vòng vì điều này. Năm 2020, Scaling Law của Kaplan và cộng sự cho rằng, khi tăng sức tính toán, tham số nên tăng nhanh hơn dữ liệu huấn luyện. GPT-3, Gopher, MT-NLG đều đi theo hướng này ngày càng lớn, ngành công nghiệp lao thẳng tới cuộc đua nghìn tỷ tham số.

Năm 2022, Chinchilla làm lại thí nghiệm và phát hiện vấn đề nằm ngay ở đó. Nhiều mô hình lớn được tạo ra quá lớn, nhưng dữ liệu lại không được cung cấp đủ. Khi tiếp tục tăng sức tính toán, tham số và dữ liệu nên tăng trưởng cùng nhau. Đường Kiệt nhìn lại, cuộc đua nghìn tỷ tham số đó chính là con đường vòng mà cả ngành công nghiệp cùng đi qua rồi sau đó quay đầu.

Nhưng Chinchilla vẫn chỉ tính toán chi phí huấn luyện. Khi mô hình thực sự được triển khai, nó sẽ được gọi lặp đi lặp lại, chi phí suy luận dài hạn ngày càng quan trọng. Nếu tính cả phần này vào, phương án tối ưu sẽ lại thay đổi. Mô hình có thể nhỏ hơn, rồi dùng nhiều dữ liệu hơn để huấn luyện kỹ hơn. Sau đó, các mô hình như Llama-2-7B, Gemma-2-9B đã đi theo hướng này.

Xa hơn nữa, MoE lại làm vấn đề phức tạp hơn. Tổng tham số nhiều hơn, thường đại diện cho khả năng chứa nhiều kiến thức hơn; số tham số và độ sâu tính toán thực sự tham gia mỗi lần, lại ảnh hưởng nhiều hơn đến khả năng suy luận. Hai thứ này không thể trộn lẫn. Đến năm 2025, nghiên cứu mới phát hiện thêm rằng, các nhiệm vụ khác nhau thậm chí có phương pháp Scaling phù hợp nhất khác nhau. Trí nhớ cần nhiều tham số hơn, suy luận cần nhiều dữ liệu hơn; trong MoE, chỉ tăng tổng tham số thậm chí có thể kéo lùi suy luận, tăng số chuyên gia thực sự tham gia tính toán lại hiệu quả hơn.

Khai thác lỗ hổng là một ví dụ trực quan. Phát hiện lỗ hổng mới, không phải chỉ cần học thuộc thêm vài CVE là đủ. Điều thực sự khó là đi hết hai mươi bước suy luận, giữa chừng không được đứt đoạn. Tham số nhiều, chưa chắc đã suy nghĩ sâu hơn.

GLM-5.3 là minh chứng mà Đường Kiệt đưa ra lần này. Nó và GLM-5.2 dùng cùng một nền tảng, cùng một kiến trúc, tổng tham số và tham số kích hoạt đều không đổi. Đội ngũ chỉ tiếp tục huấn luyện thêm một tháng, tập trung mở rộng môi trường nhiệm vụ dài hạn và học tăng cường, năng lực vẫn được cải thiện rõ rệt. Lần này tăng không phải tham số, mà là hậu huấn luyện.

Phán đoán cuối cùng của Đường Kiệt rất rõ ràng. Scaling vẫn chưa kết thúc. Quy mô mô hình, dữ liệu tiền huấn luyện, mức sức tính toán đầu tư mỗi lần, độ sâu hậu huấn luyện, đều còn dư địa. Chỉ là mỗi thế hệ mô hình có điểm nghẽn khác nhau, nơi cần tăng cường nhất cũng sẽ thay đổi.

Vòng cạnh tranh tiếp theo của mô hình lớn, có thể không còn là ai có nhiều tham số nhất, mà là ai hiểu rõ hơn sức tính toán nên dùng vào đâu.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành