BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Đội ngũ DFlash tiến vào Mac, mô hình 27B đạt tốc độ 144 Token/s

动察 Beating AI tin nhanh, Inco AI mã nguồn mở engine suy luận cục bộ Splash, chạy Qwen3.8-27B trên M5 Max MacBook Pro đạt tốc độ tối đa 144 Token/s. LM Studio ngay lập tức tích hợp, phiên bản 0.4.25 đã có thể sử dụng trực tiếp.


DFlash mà Inco tạo ra trước đây đã được đưa vào SGLang, vLLM, TensorRT-LLM và llama.cpp. Meta, NVIDIA, Xiaomi, Poolside và những hãng khác cũng đã trang bị DFlash tăng tốc mô hình nhỏ cho mô hình của mình. DFlash sẽ để mô hình nhỏ đoán song song nhiều Token trước, sau đó giao cho mô hình lớn xác minh theo lô, giảm tính toán sinh từng Token.


Splash mở rộng tối ưu hóa này ra toàn bộ engine suy luận cục bộ. Hiện tại nó chỉ hỗ trợ Qwen3.8-27B và Qwen3.6-35B-A3B, mỗi mô hình đều được cấu hình riêng GPU kernel, phương án bộ nhớ và mô hình nhỏ DFlash 2. Số mô hình được hỗ trợ ít, nhưng đổi lại là tối ưu hiệu năng mạnh mẽ hơn.


144 Token/s là giá trị demo cao nhất trên M5 Max. Chuyển sang M5 Pro 48GB mà Inco dùng để kiểm thử ngang, Qwen3.8-27B một luồng ngữ cảnh ngắn đạt 74 Token/s; khi 4 luồng đồng thời, tổng thông lượng đạt 170 Token/s, gấp 3,9 lần vị trí thứ hai. Đây cũng là điểm Splash phù hợp hơn với kịch bản Agent. Khi một Agent đồng thời khởi chạy nhiều tác vụ con, tổng thông lượng đồng thời thường quan trọng hơn tốc độ một cuộc hội thoại đơn lẻ.


Bản thân Splash là mã nguồn mở, không ràng buộc với LM Studio. Hiện tại cần Mac M3 trở lên, macOS 26.4 trở lên, tối thiểu 36GB bộ nhớ hợp nhất.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành