动察 Beating AI tin nhanh, framework suy luận/triển khai mô hình lớn SGLang bổ sung API quyết định gốc, cho phép các LLM có sẵn như Qwen3.8-27B và mô hình đa phương thức không cần thay đổi trọng số, cũng không cần tinh chỉnh lại, có thể trực tiếp đưa ra lựa chọn, phán đoán và chấm điểm. Nhà phát triển đưa ra tình huống hiện tại và một vài câu trả lời ứng viên, mô hình trực tiếp trả về xác suất của từng lựa chọn, không còn phải sinh ra một đoạn văn bản rồi mới phân tích.
Nó tận dụng 「xác suất token tiếp theo」 mà mô hình lớn vốn đã tính toán. Ví dụ câu trả lời ứng viên là A, B, C, mô hình chat thông thường sẽ tiếp tục sinh văn bản; SGLang thì trực tiếp đọc xác suất của mô hình đối với A, B, C, xem nó nghiêng về câu trả lời nào hơn. Bản thân mô hình không thay đổi, chỉ là đổi một cách đọc kết quả.
SGLang đã dùng Qwen3.8-27B làm một bản demo 《Pokémon FireRed》. Mô hình dựa trên trạng thái trò chơi thời gian thực để phán đoán tấn công, đổi Pokémon hay hồi máu, một lần ra quyết định dưới 100ms, và đánh bại liên tiếp Tứ Đại Thiên Vương và Nhà Vô Địch trong một lần. Qwen3.8-27B vốn hỗ trợ đầu vào hình ảnh, nên phương pháp này cũng có thể xử lý quyết định đa phương thức.
SGLang còn bổ sung giao diện /v1/systemone, tương thích với TypeSafe SDK mà Jev sử dụng. Các ứng dụng đã dùng bộ SDK này có thể đổi địa chỉ dịch vụ thành instance SGLang của mình để tiếp tục gọi. Tính năng mới đã vào phiên bản nightly, dự kiến phát hành chính thức cùng v0.5.21.
