TL;DR
· The Information cho biết Google đang khám phá chip suy luận chuyên dụng cho Gemini, mã nội bộ Frozen v2, có thể được triển khai sớm nhất vào năm 2028.
· Tranh cãi nằm ở chỗ liệu việc mã hóa cứng cấu trúc mô hình có thể bù đắp cho sự giảm linh hoạt và rủi ro thời gian bằng hiệu suất năng lượng cao hơn hay không.
· Các mã liên quan: Alphabet, Nvidia, chuỗi chip tự phát triển của các nhà cung cấp đám mây, cơ sở hạ tầng hiệu quả năng lượng AI.
Google đang khám phá một chip AI máy chủ, mã nội bộ không chính thức là Frozen v2, với mục tiêu tích hợp trực tiếp một số yếu tố của mô hình Gemini vào phần cứng để nâng cao hiệu quả suy luận. Sau khi tin tức lan truyền, cổ phiếu Alphabet đã tăng hơn 3% trong phiên giao dịch ngày 20 tháng 7, nhưng mức tăng thu hẹp vào cuối phiên.
Điểm chính của tin tức này không phải là Google lại phát triển một chip tự thiết kế. Các nhà đầu tư quan tâm hơn đến việc, sau khi dịch vụ AI ngày càng đắt đỏ, liệu Alphabet có thể không chỉ dựa vào việc tăng chi tiêu vốn, mà thông qua việc gắn kết mô hình và phần cứng, giảm áp lực điện năng, sức mạnh tính toán và trung tâm dữ liệu cho mỗi lần trả lời câu hỏi hay không.
Mục tiêu được báo cáo đưa ra rất táo bạo. Frozen v2 hy vọng tăng số lượng token phục vụ trên mỗi đơn vị năng lượng lên gấp 6 đến 10 lần so với TPU hiện tại hoặc mới nhất được báo cáo đề cập. Token có thể hiểu đơn giản là đơn vị cơ bản để AI xử lý văn bản. Con số này vẫn là mục tiêu của dự án chưa công bố, không phải kết quả sản xuất hàng loạt được Google xác nhận chính thức.
Thị trường tăng trước, giao dịch không phải là hiệu suất ngắn hạn, mà là các lựa chọn chi phí dài hạn. Vấn đề nhạy cảm nhất của các nhà đầu tư AI hiện nay là liệu chi tiêu vốn của các công ty mô hình lớn có tiếp tục tăng hay không, và liệu biên lợi nhuận gộp của dịch vụ đám mây có bị xói mòn liên tục bởi chi phí suy luận hay không.
Áp lực mà Google phải đối mặt không hề trừu tượng. Cùng một báo cáo đề cập rằng dự án nhằm giảm bớt tình trạng thiếu hụt công suất tính toán AI, và Google Cloud đã từ chối một số hợp đồng bên ngoài do vấn đề công suất. Dù những căng thẳng về công suất này có trực tiếp thúc đẩy Frozen v2 hay không, chúng đều cho thấy một sự thay đổi: sức mạnh tính toán không chỉ là đầu tư tăng trưởng, mà còn bắt đầu trở thành ràng buộc trong việc hiện thực hóa doanh thu.
Khi người dùng thông thường đặt câu hỏi cho Gemini, đằng sau đó tiêu tốn sức mạnh tính toán suy luận. Mô hình càng lớn, người dùng càng nhiều, câu trả lời càng dài, trung tâm dữ liệu càng cần nhiều chip, điện năng và làm mát. Đối với các nhà đầu tư, điều này cuối cùng sẽ ảnh hưởng đến chi tiêu vốn, biên lợi nhuận gộp của dịch vụ đám mây và định giá dịch vụ mô hình.
Ý nghĩa thị trường của Frozen v2 không phải là "Google sắp giải quyết tình trạng thiếu hụt sức mạnh tính toán". Nó giống như một lộ trình công nghệ dài hạn mà Alphabet đưa ra: nếu mỗi watt điện có thể phục vụ nhiều token hơn, Google sẽ có cơ hội xử lý nhiều yêu cầu AI hơn trong cùng một giới hạn về điện năng và cơ sở hạ tầng.
Cốt lõi của Frozen v2 là mã hóa cứng. Có thể hiểu nó như sau: chip đa năng giống như một căn bếp đa chức năng, có thể làm được mọi món ăn. Frozen v2 giống như việc viết trực tiếp một phần công thức nấu ăn của Gemini vào bếp, giảm bớt các bước tra cứu công thức, di chuyển dụng cụ và điều chỉnh quy trình tạm thời.
Suy luận AI không chỉ đơn thuần là tính toán, mà còn bao gồm một lượng lớn việc vận chuyển và điều phối dữ liệu. Khi mô hình chạy, chip cần liên tục đọc các tham số, sắp xếp đường dẫn tính toán và di chuyển dữ liệu giữa các lớp lưu trữ khác nhau. Bản thân những thao tác này tiêu tốn điện năng, thời gian và cũng chiếm dụng tài nguyên của chip.
Nếu cấu trúc của một số mô hình đủ ổn định, chúng có thể được chế tạo thành các mạch cố định. Lợi ích là đường dẫn ngắn hơn, ít điều phối hơn và mức tiêu thụ điện năng thấp hơn. Cái giá phải trả cũng rất trực tiếp: một khi chip được thiết kế theo một cấu trúc mô hình nhất định, nó sẽ khó có thể thích ứng với nhiều mô hình mới khác nhau như GPU hoặc TPU.
Vì vậy, mục tiêu hiệu suất năng lượng gấp 6 đến 10 lần cần được xem xét một cách chi tiết. Nó đề cập đến số lượng token có thể phục vụ trên mỗi đơn vị công suất, không có nghĩa là tổng chi phí trung tâm dữ liệu của Google trong tương lai sẽ giảm từ 6 đến 10 lần. Chip thực tế, tải trọng thực tế và quy mô triển khai thực tế sẽ thay đổi ý nghĩa tài chính của con số này.
Mốc thời gian cũng cần được hiểu một cách thận trọng. Theo báo cáo, Frozen v2 có thể được triển khai sớm nhất vào năm 2028 và các chi tiết của dự án vẫn đang được xác định. Trước thời điểm đó, tác động của nó đối với định giá của Alphabet gần giống như một quyền chọn dài hạn hơn là một sự cải thiện chi phí có thể được ghi nhận vào báo cáo lợi nhuận.
Điểm đáng chú ý của Frozen v2 là nó đưa mâu thuẫn trong lộ trình chip AI ra ánh sáng: tính đa năng và hiệu suất tối đa rất khó để tối ưu hóa đồng thời. Trong vài năm qua, lợi thế của GPU và TPU nằm ở khả năng thích ứng với các mô hình và khối lượng công việc khác nhau, đặc biệt phù hợp với giai đoạn lặp lại mô hình nhanh chóng.
Hướng đi mà Google được cho là đang khám phá còn táo bạo hơn. Vì Gemini là mô hình chủ lực của riêng họ, tại sao không thiết kế một chip suy luận chuyên dụng hơn cho nó? Khi suy luận AI chuyển từ trình diễn sang dịch vụ hàng ngày, cải thiện hiệu suất không còn chỉ là một chỉ số kỹ thuật, mà là một phần của mô hình kinh doanh.
Điều này sẽ tạo ra thách thức biên cho câu chuyện của Nvidia, nhưng chưa thể nói là "khủng hoảng Nvidia". Hào phòng thủ của Nvidia vẫn nằm ở hệ sinh thái đa năng, chuỗi công cụ phần mềm và cụm đào tạo. Nếu Frozen v2 có giá trị, thì nó chủ yếu nằm trong các kịch bản suy luận Gemini cụ thể nội bộ của Google, giúp giảm sự phụ thuộc biên vào sức mạnh tính toán đa năng.
Điều này cũng không có nghĩa là TPU bị gạt ra ngoài lề. Theo cách diễn giải của báo chí, Frozen v2 là một nhánh mới ngoài TPU, giống như một công cụ hiệu quả được thiết kế riêng cho dòng Gemini. TPU vẫn sẽ đảm nhận các nhiệm vụ huấn luyện và suy luận rộng hơn, phục vụ các mô hình và khách hàng đám mây khác nhau.
Một nhận định chính xác hơn là, khi một mô hình đủ quan trọng, khối lượng gọi đủ lớn và kiến trúc đủ ổn định, chip chuyên dụng bắt đầu có sức hấp dẫn về mặt kinh tế. Đây không phải là tín hiệu cho thấy toàn ngành chuyển sang chip chuyên dụng, mà là các công ty mô hình hàng đầu bắt đầu tính toán riêng cho các kịch bản suy luận tần suất cao.
Rủi ro lớn nhất của Frozen v2 không chỉ nằm ở việc đội ngũ phần cứng có thể tạo ra các mạch hiệu quả hơn hay không, mà còn ở việc kiến trúc cơ bản của Gemini có đủ ổn định để đáng được ghi vào chip hay không. Các mô hình AI vẫn đang trong quá trình lặp lại với tốc độ cao; cấu trúc tối ưu hôm nay chưa chắc đã là giải pháp tối ưu sau hai năm nữa.
Nếu Gemini có những thay đổi kiến trúc lớn trong tương lai, Frozen v2 có thể cần được thiết kế lại. Điều này sẽ kéo dài thời gian biểu và cũng làm suy yếu lợi thế chi phí từ việc mã hóa cứng. Chuyên môn hóa càng sâu, tiềm năng hiệu quả càng lớn, nhưng chi phí khi bị khóa vào một lộ trình kỹ thuật cũng càng cao.
Thị trường cần xác minh liệu lộ trình này có thể chuyển từ các manh mối dự án ban đầu sang các mốc kỹ thuật cứng hơn hay không. Lộ trình chính thức, tiến độ chế tạo, thời gian sản xuất hàng loạt, hiệu suất năng lượng thực tế và quy mô triển khai sẽ quyết định liệu nó trở thành một điểm neo mới trong đường cong chi phí của Alphabet, hay chỉ là một thí nghiệm dài hạn bị định giá trước.
Đối với Alphabet, ý nghĩa hiện tại của Frozen v2 là cho thị trường thấy rằng áp lực chi tiêu AI không nhất thiết chỉ có thể được giải quyết bằng cách tiếp tục tăng chi tiêu vốn. Nhưng trước năm 2028, nó giống một quyền chọn hơn. Điều thực sự có thể thay đổi định giá không phải là tên mã, mà là liệu con chip này có thể biến các cuộc gọi tần suất cao của Gemini thành sự giảm chi phí có thể đo lường được hay không.
Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:
Nhóm Telegram đăng ký: https://t.me/theblockbeats
Nhóm Telegram thảo luận: https://t.me/BlockBeats_App
Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia