BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Kimi K3 đặt ra câu hỏi mới: Mô hình càng rẻ, nhu cầu về chip lại càng lớn?

Đọc bài viết này mất 19 phút
Citigroup và Bank of America Securities cho rằng, mặc dù Kimi K3 giảm chi phí suy luận, nhưng có thể kích thích nhiều lệnh gọi hơn, ngữ cảnh dài hơn và các tác vụ tác nhân thông qua "Nghịch lý Jevons", từ đó đẩy cao nhu cầu về GPU, HBM, DDR5, eSSD và cơ sở hạ tầng mạng.
Tiêu đề gốc: 《Thêm Token, Thêm Chip! Kimi K3 Thể Hiện "Nghịch Lý Jevons", Hiệu Suất Tăng Lại Làm Gia Tăng Tiêu Thụ Tài Nguyên》
Tác giả gốc: Triệu Dĩnh, Wall Street News


Kimi K3 đưa các nhà đầu tư AI trở lại một câu hỏi cốt lõi: Mô hình rẻ hơn, hiệu quả hơn có đồng nghĩa với nhu cầu về chip và bộ nhớ giảm xuống không? Câu trả lời từ Citigroup và Bank of America Securities đều nghiêng về phía phủ định: hiệu suất tăng có thể giải phóng nhiều khối lượng sử dụng hơn, từ đó đẩy tổng tiêu thụ tài nguyên lên cao.


Theo báo cáo từ Zhuifeng Trading Desk, Kimi K3 do Moonshot AI phát hành sở hữu 2,8 nghìn tỷ tham số, hướng đến cửa sổ ngữ cảnh 100 triệu token và các tác vụ tác nhân chu kỳ dài. Nhà phân tích bán dẫn của Citigroup, Peter Lee, cho rằng, ngay cả khi Kimi K3 được sử dụng rộng rãi, nhu cầu về bộ nhớ phổ thông như DDR5 và eSSD cho máy chủ vẫn sẽ tăng.


Trong nghiên cứu ngày 17 tháng 7, nhà phân tích bán dẫn của Bank of America Securities, Vivek Arya, cũng chỉ ra rằng các phòng thí nghiệm AI tiên tiến của Mỹ có nhiều khả năng tăng cường đầu tư sức mạnh tính toán hơn là giảm đầu tư. Nếu các mô hình mã nguồn mở của Trung Quốc tiếp tục tiến gần, những người dẫn đầu như OpenAI, Anthropic và Google sẽ cần quy mô đào tạo lớn hơn, suy luận nặng hơn và vòng đời sản phẩm nhanh hơn để duy trì sự khác biệt.


Điều này có nghĩa là logic định giá thị trường đối với Kimi K3 không thể chỉ nhìn vào chi phí suy luận đơn lẻ giảm. Quan trọng hơn là liệu mô hình giá rẻ có mang lại nhiều lệnh gọi hơn, chuỗi tác vụ dài hơn và nhiều token được tạo ra hơn không. Nếu câu trả lời là có, GPU, HBM, DDR5, eSSD, mạng tốc độ cao và hệ thống suy luận đều có thể tiếp tục hưởng lợi.


Giá rẻ Hiệu suất cao, Kích hoạt "Nghịch lý Jevons"


Citigroup coi Kimi K3 là một trường hợp tiềm năng của "Nghịch lý Jevons" trong chuỗi ngành AI. Cốt lõi của nghịch lý này là, sau khi cải thiện hiệu suất công nghệ làm giảm chi phí sử dụng đơn vị, khối lượng sử dụng có thể tăng mạnh, cuối cùng tổng tiêu thụ tài nguyên không giảm mà còn tăng.


Sức hấp dẫn của Kimi K3 đến từ sự kết hợp giữa chi phí thấp và hiệu suất cao. Giá công khai cho thấy, giá đầu vào khi cache hit là 0,3 USD mỗi triệu token, giá đầu ra là 15 USD mỗi triệu token. Kế hoạch công bố trọng số đầy đủ của nó vào ngày 27 tháng 7, nhằm hỗ trợ các tác vụ tác nhân chu kỳ dài.


Đánh giá của Citigroup là, việc giảm giá mô hình sẽ không tự động làm giảm nhu cầu phần cứng. Ngược lại, chi phí thấp có thể nâng cao ý định của nhà phát triển và doanh nghiệp trong việc gọi mô hình, thúc đẩy triển khai nhiều tác nhân AI hơn. Các tác vụ tác nhân không phải là hỏi đáp một lần, mà liên tục tạo ra, đọc và xử lý token trong các tác vụ liên tiếp. Số lần gọi và độ dài tác vụ tăng lên sẽ chuyển đổi chi phí đơn vị giảm trở lại thành tổng tiêu thụ tài nguyên.


Do đó, tác động của Kimi K3 lên chuỗi bán dẫn không nằm ở chỗ "mỗi lần gọi có rẻ hơn hay không", mà ở chỗ "tổng lượng token có mở rộng hay không". Đây chính là lý do Citigroup lạc quan về nhu cầu đối với DDR5 máy chủ và eSSD.


Suy luận ngữ cảnh dài, chuyển áp lực sang bộ nhớ


Kimi K3 áp dụng ba công nghệ chính: Kimi Delta Attention, Attention Residuals và Stable LatentMoE. Kimi Delta Attention được sử dụng để giảm chi phí cho cửa sổ ngữ cảnh 1 triệu token, Attention Residuals dùng để truy xuất biểu diễn có chọn lọc giữa các độ sâu khác nhau của mô hình, còn Stable LatentMoE nâng cao mức độ thưa thớt, mỗi token chỉ kích hoạt 16 trong số 896 chuyên gia.


Tài liệu kỹ thuật của Moonshot AI cho biết, kiến trúc này giúp hiệu suất mở rộng của Kimi K3 đạt gấp 2,5 lần so với K2. Khả năng thưa thớt cao và ngữ cảnh dài là nền tảng quan trọng để giảm chi phí vận hành.


Tuy nhiên, Citigroup nhấn mạnh rằng điều này không đồng nghĩa với việc áp lực tài nguyên suy luận biến mất. Kimi K3 vẫn không phải là giải pháp triển khai nhẹ, nó yêu cầu cụm đa nút để vận hành, với cấu hình siêu nút hơn 64 GPU. Quan trọng hơn, ngữ cảnh dài và tác vụ tác nhân sẽ đẩy mức sử dụng KV Cache lên cao, từ đó gia tăng gánh nặng bộ nhớ suy luận.


Nhu cầu KV Cache liên quan trực tiếp đến DDR5 máy chủ và eSSD. DDR5 đảm nhận truy cập dữ liệu tần suất cao, eSSD hưởng lợi từ nhu cầu bộ nhớ đệm và lưu trữ dữ liệu lớn hơn. Đối với các nhà sản xuất bộ nhớ, biến số chính không phải là liệu một mô hình đơn lẻ có tiết kiệm sức mạnh tính toán hơn hay không, mà là sau khi giá thấp, mô hình được gọi bao nhiêu lần, mỗi lần gọi tạo ra bao nhiêu token, và chuỗi tác vụ tác nhân được kéo dài đến đâu.


Mô hình tiến gần, ngược lại nâng ngưỡng sức mạnh tính toán


Kết luận của Bank of America Securities tương đồng với Citigroup, nhưng tập trung hơn vào GPU và cơ sở hạ tầng AI. Vivek Arya cho rằng, các mô hình nguồn mở mạnh hơn từ Trung Quốc không nhất thiết khiến các gã khổng lồ AI Mỹ cắt giảm đầu tư sức mạnh tính toán. Ngược lại, khoảng cách mô hình thu hẹp sẽ làm tăng chi phí duy trì lợi thế của những người dẫn đầu.


Bank of America Securities chỉ ra rằng, nếu các mô hình nguồn mở tiếp tục tiến gần, OpenAI, Anthropic và Google sẽ cần dựa vào quy mô đào tạo lớn hơn, nhiều vòng lặp học tăng cường và dữ liệu tổng hợp hơn, suy luận thử nghiệm nặng hơn, và nhịp độ ra mắt sản phẩm nhanh hơn để duy trì sự khác biệt.


Logic này không phụ thuộc vào việc mô hình nào dẫn đầu trong ngắn hạn. Bảng xếp hạng các mô hình lớn có thể thay đổi nhanh chóng, nhưng doanh nghiệp thực sự mua là đầu ra AI ổn định, độ trễ thấp, khả dụng cao, cùng với chi phí "trên mỗi đơn vị sản lượng hiệu quả" thấp hơn. Khi năng lực mô hình hội tụ, áp lực cạnh tranh sẽ truyền xuống hạ tầng cơ bản, bao gồm GPU, HBM, mạng tốc độ cao và hệ thống suy luận.


Do đó, Ngân hàng Chứng khoán Mỹ cho rằng, sự xuất hiện của các mô hình như Kimi K3 không nên được hiểu đơn giản là "mô hình hiệu quả hơn, ít chip hơn". Con đường thực tế hơn là cạnh tranh mô hình gia tăng, và những người dẫn đầu sẽ tiếp tục tăng cường sức mạnh tính toán để duy trì khoảng cách.


Kiến trúc MoE thay đổi nút thắt, bộ nhớ hiển thị và kết nối trở nên quan trọng hơn


Kimi K3 sử dụng kiến trúc MoE, có nghĩa là tổng số tham số và số tham số thực tế được kích hoạt trong mỗi lần suy luận có thể được tách rời. Sự thay đổi này làm giảm một phần áp lực tính toán, nhưng cũng chuyển nút thắt hạ tầng từ sức mạnh tính toán thuần túy sang truy cập bộ nhớ hiển thị, định tuyến chuyên gia, độ trễ phản hồi và khả năng kết nối.


Ngân hàng Chứng khoán Mỹ nhấn mạnh, suy luận MoE yêu cầu hệ thống vận chuyển dữ liệu hiệu quả hơn, điều phối các mô-đun chuyên gia và kết nối các cụm tính toán lớn hơn. NVIDIA đề xuất rằng suy luận MoE hiện đại cần miền GPU lớn hơn. Tính toán của họ cho thấy, hiệu suất trên mỗi watt của GB300 NVL72 trên các mô hình mã nguồn mở hàng đầu có thể đạt tới 25 lần so với nền tảng Hopper.


Các thử nghiệm của CoreWeave xung quanh Kimi K2.6 cũng cho thấy, ngay cả khi các mô hình MoE mã nguồn mở chỉ kích hoạt một phần tham số mỗi lần, để duy trì vị thế dẫn đầu về tốc độ và hiệu quả chi phí, vẫn cần hạ tầng NVIDIA GB300/GB200 NVL72 được tối ưu hóa.


Điều này có nghĩa là, trọng số mô hình có thể dần trở thành hàng hóa, nhưng GPU, bộ nhớ băng thông cao, kết nối mạng và hệ thống suy luận cần thiết để chạy mô hình sẽ không mất đi giá trị. Ngược lại, khi khối lượng gọi mô hình mở rộng, các khâu này có thể trở thành nơi cạnh tranh tập trung hơn.


Việc sử dụng Token vẫn đang mở rộng, phía cầu chưa đạt đỉnh


Ngân hàng Chứng khoán Mỹ cũng trích dẫn dữ liệu từ OpenRouter cho thấy, khối lượng gọi mô hình vẫn đang tăng nhanh. Là nền tảng API bên thứ ba kết nối nhiều phòng thí nghiệm mô hình, lượng token sử dụng trên OpenRouter tiếp tục tăng, trong đó lượng token sử dụng từ các mô hình phòng thí nghiệm AI Trung Quốc đã vượt qua các mô hình phòng thí nghiệm không phải Trung Quốc.



Dữ liệu này không thể trực tiếp đại diện cho tất cả các doanh nghiệp và tình huống tiêu dùng, nhưng ít nhất nó cho thấy sự lựa chọn của các nhà phát triển trong hệ sinh thái mô hình mở đang thay đổi. Việc giảm giá mô hình và cải thiện năng lực có thể thúc đẩy khối lượng gọi tiếp tục mở rộng, thay vì bị triệt tiêu bởi sự cải thiện hiệu quả của một mô hình đơn lẻ.


Việc doanh nghiệp trả phí sử dụng cũng đang gia tăng. Dữ liệu từ Ramp cho thấy, tính đến tháng 6 năm 2026, khoảng 55% doanh nghiệp Mỹ đã đăng ký trả phí cho các mô hình, nền tảng hoặc công cụ AI, cao hơn ước tính 21% từ khảo sát BTOS của Cục điều tra dân số Mỹ. Xét theo từng mô hình, tỷ lệ áp dụng của Anthropic trong doanh nghiệp là 42,4%, OpenAI là 39,5%.


Tuy nhiên, chi tiêu cho AI vẫn tập trung cao độ. 1% doanh nghiệp hàng đầu có chi tiêu AI trung bình mỗi nhân viên khoảng 4.833 USD/tháng, 10% hàng đầu là 516 USD, trong khi mức trung bình toàn bộ chỉ là 11 USD. Tỷ lệ đăng ký trong ngành công nghệ và truyền thông đạt 79,8%, tỷ lệ áp dụng của doanh nghiệp lớn là 65,5%, cao hơn so với 61,3% của doanh nghiệp vừa và 48,7% của doanh nghiệp nhỏ.



Nhóm dữ liệu này ủng hộ một nhận định: việc sử dụng AI vẫn đang trong quá trình lan tỏa. Nếu mô hình giá rẻ hạ thấp rào cản gia nhập, nhu cầu gia tăng trong tương lai có thể đến từ nhiều doanh nghiệp hơn, nhiều nhà phát triển hơn và nhiều ứng dụng tác tử hơn.


Từ "tiết kiệm sức mạnh tính toán" sang "nhiều khối lượng công việc hơn"


Kết luận chung của Citigroup và Bank of America Securities là, ý nghĩa của Kimi K3 không nằm ở việc một mô hình đơn lẻ có giảm chi phí suy luận đơn vị hay không, mà ở việc chi phí thấp có giải phóng khối lượng công việc lớn hơn hay không.


Đối với Citigroup, hướng hưởng lợi trực tiếp nhất là server DDR5 và eSSD. Ngữ cảnh dài, KV Cache và các tác vụ tác tử sẽ làm tăng nhu cầu truy cập bộ nhớ và lưu trữ. Đối với Bank of America Securities, quan trọng hơn là GPU, HBM, mạng tốc độ cao và hệ thống suy luận, bởi vì cạnh tranh mô hình sẽ buộc những người dẫn đầu tiếp tục đầu tư vào cơ sở hạ tầng.


Bank of America Securities cũng đề cập rằng, việc Kimi K3 liên quan đến "EDA mã nguồn mở 45nm" không nên được hiểu đơn giản là sự thay thế EDA thương mại. Ngược lại, điều này cho thấy thiết kế chip vẫn không thể thiếu các công cụ EDA. Trên các quy trình tiên tiến, các nhà sản xuất EDA thương mại như Cadence và Synopsys vẫn ở vị trí then chốt.


Rủi ro nằm ở một kịch bản khác: nếu nén mô hình, tối ưu hóa suy luận và cải thiện hiệu quả phần cứng trong dài hạn nhanh hơn khối lượng công việc mới, việc mở rộng cơ sở hạ tầng AI có thể tạm thời hạ nhiệt. Nhưng trong khuôn khổ của hai ngân hàng đầu tư hiện tại, Kimi K3 giống như một chất xúc tác thúc đẩy khối lượng sử dụng hơn là một tín hiệu làm suy yếu nhu cầu chip. Sau khi cải thiện hiệu quả, thị trường cần chú ý đến nhiều token hơn, nhiều suy luận hơn và nhiều tiêu thụ phần cứng cơ bản hơn.


Liên kết gốc


Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:

Nhóm Telegram đăng ký: https://t.me/theblockbeats

Nhóm Telegram thảo luận: https://t.me/BlockBeats_App

Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia

Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Báo lỗi/Báo cáo
Gửi