Động Sát Beating AI tin nhanh, chuyên gia thiết kế chip kỳ cựu và nhà phân tích phần cứng "Mr. Bubble" trong cuộc phỏng vấn trên Frictionless Podcast cho biết, nút thắt cốt lõi của hạ tầng tính toán AI đang chuyển từ việc đơn thuần nâng cao năng lực tính toán của chip sang đóng gói tiên tiến, độ trễ kết nối hệ thống và quản lý phân cấp bộ nhớ.
Mr. Bubble cho rằng, chi phí quy trình tiên tiến tăng nhanh trong khi mức tăng mật độ transistor có hạn, khiến định luật Moore truyền thống đối mặt với thách thức kinh tế. Thay vì tiếp tục thu nhỏ quy trình, ngành công nghiệp đang chuyển sang kết nối nhiều chip thành một hệ thống tính toán thông qua đóng gói tiên tiến. Ông chỉ ra rằng, đơn vị cơ bản của năng lực tính toán AI trong tương lai có thể không còn là một chip hay một máy chủ đơn lẻ, mà là cả một rack hoặc thậm chí nhiều rack, năng lực PCB, đóng gói và kết nối sẽ trở thành yếu tố hạn chế then chốt.
Về mặt lưu trữ, ông cho rằng, khi cửa sổ ngữ cảnh suy luận AI mở rộng, lượng lớn ngữ cảnh lịch sử không nên chiếm toàn bộ HBM đắt đỏ, ngành công nghiệp có thể tận dụng nhiều hơn việc giảm tải sang flash, giữ dữ liệu tần suất cao trong HBM, chuyển ngữ cảnh tần suất thấp sang tầng lưu trữ có dung lượng lớn hơn, chi phí thấp hơn. Ông dự đoán thêm rằng, 3D DRAM có thể trở thành hướng quan trọng của công nghệ bộ nhớ thế hệ tiếp theo.
Đối với đầu tư hạ tầng AI, Mr. Bubble cho rằng, khi prefill và decode dần áp dụng kiến trúc tách rời, tầm quan trọng của thiết kế phần cứng cấp hệ thống sẽ được nâng cao hơn nữa. Ông cũng cho biết, so với việc đặt cược trực tiếp vào các công ty mô hình lớn, các doanh nghiệp sở hữu năng lực phần cứng, đóng gói, lưu trữ và các hạ tầng then chốt khác có thể đóng vai trò dài hạn hơn trong chuỗi công nghiệp AI.
