Động sát Beating AI tin nhanh, CEO NVIDIA Jensen Huang sáng nay tiết lộ, quá trình huấn luyện GPT-6 Astra đã sử dụng hơn 100.000 GPU Grace Blackwell, kết nối thành cụm liên kết tốc độ cao thông qua NVLink72. Ông cũng cho biết lô tiếp theo có 400.000 GPU sẽ được đưa vào hoạt động, nhưng không nêu rõ model cụ thể và đơn vị sở hữu.
Lấy Astra làm chuẩn, công suất tính toán công khai của các công ty mô hình hàng đầu Trung Quốc vẫn còn khoảng cách rõ rệt. ByteDance hiện là gần nhất, năm nay họ kết nối khoảng 36.000 chip B200 thông qua Malaysia. Lô chip này cùng thuộc thế hệ Blackwell với GB200 mà Astra sử dụng, nhưng công suất tính toán được triển khai ở nước ngoài. Khi ByteDance công khai giới thiệu cụm trong nước năm nay, họ vẫn chủ yếu sử dụng H20 và H800 - phiên bản đặc biệt cho Trung Quốc của kiến trúc Hopper.
Kimi gần đây bị lộ đã nhận khoảng 20.000 GPU Hopper thông qua Alibaba. Nguồn tin Bloomberg cho biết cụ thể là H200, nhưng Alibaba phủ nhận thông tin về model H200. H200 thuộc thế hệ Hopper trước đó; B200 đã nâng cấp lên Blackwell. GB200 tiếp tục kết hợp CPU Grace và GPU Blackwell, NVL72 có thể đưa 72 GPU vào cùng một miền liên kết tốc độ cao.
DeepSeek chưa công bố toàn bộ phần cứng huấn luyện của V4. Bản ghi chép cuộc họp nhà đầu tư của Lương Văn Phong bị rò rỉ cho biết, công ty có khoảng 20.000 công suất tính toán tương đương H vào tháng 5, phần lớn vừa mới về hàng, đợt mua tiếp theo "về cơ bản đều là NVIDIA". Huawei cung cấp cho DeepSeek khoảng 16.000 đơn vị công suất 950. Lương Văn Phong cho biết lô chip nội địa này tương đương khoảng 4.000 GPU dòng B của Nvidia, chỉ đủ cho quá trình huấn luyện mô hình thế hệ hiện tại.
Và Blackwell mà Astra sử dụng cũng không còn là thế hệ mới nhất của Nvidia. Vera Rubin đã bước vào giai đoạn sản xuất hàng loạt toàn diện. NVIDIA ước tính, số GPU cần thiết để Rubin huấn luyện các mô hình MoE lớn có thể giảm xuống còn một phần tư so với Blackwell.
Trong tài liệu công khai, chưa có công ty Trung Quốc nào tiết lộ trường hợp sử dụng 100.000 GPU tiên tiến cùng thế hệ cho một lần huấn luyện mô hình. Vì vậy, khoảng cách công khai hiện tại giữa các công ty AI Trung-Mỹ không chỉ đơn thuần là số lượng card, mà còn là thế hệ card nào có thể tiếp cận được, và một lần có thể tập trung bao nhiêu card cho một mô hình.
