动察 Beating AI tin nhanh, Inco AI mã nguồn mở engine suy luận cục bộ Splash, chạy Qwen3.8-27B trên M5 Max MacBook Pro đạt tốc độ tối đa 144 Token/s. LM Studio ngay lập tức tích hợp, phiên bản 0.4.25 đã có thể sử dụng trực tiếp.
DFlash mà Inco tạo ra trước đây đã được đưa vào SGLang, vLLM, TensorRT-LLM và llama.cpp. Meta, NVIDIA, Xiaomi, Poolside và những hãng khác cũng đã trang bị DFlash tăng tốc mô hình nhỏ cho mô hình của mình. DFlash sẽ để mô hình nhỏ đoán song song nhiều Token trước, sau đó giao cho mô hình lớn xác minh theo lô, giảm tính toán sinh từng Token.
Splash mở rộng tối ưu hóa này ra toàn bộ engine suy luận cục bộ. Hiện tại nó chỉ hỗ trợ Qwen3.8-27B và Qwen3.6-35B-A3B, mỗi mô hình đều được cấu hình riêng GPU kernel, phương án bộ nhớ và mô hình nhỏ DFlash 2. Số mô hình được hỗ trợ ít, nhưng đổi lại là tối ưu hiệu năng mạnh mẽ hơn.
144 Token/s là giá trị demo cao nhất trên M5 Max. Chuyển sang M5 Pro 48GB mà Inco dùng để kiểm thử ngang, Qwen3.8-27B một luồng ngữ cảnh ngắn đạt 74 Token/s; khi 4 luồng đồng thời, tổng thông lượng đạt 170 Token/s, gấp 3,9 lần vị trí thứ hai. Đây cũng là điểm Splash phù hợp hơn với kịch bản Agent. Khi một Agent đồng thời khởi chạy nhiều tác vụ con, tổng thông lượng đồng thời thường quan trọng hơn tốc độ một cuộc hội thoại đơn lẻ.
Bản thân Splash là mã nguồn mở, không ràng buộc với LM Studio. Hiện tại cần Mac M3 trở lên, macOS 26.4 trở lên, tối thiểu 36GB bộ nhớ hợp nhất.
