Theo dõi từ Động Sát Beating, Ant Bailing chính thức công bố trọng số Ling-3.0-tiny, cung cấp ba phiên bản BF16, FP8 và INT4, trang Hugging Face ghi nhận giấy phép MIT. Mô hình có tổng cộng 7,9 tỷ tham số, mỗi Token chỉ kích hoạt 1,3 tỷ, chủ yếu hướng đến triển khai cục bộ và các tình huống Agent.
Ling-3.0-tiny có 128 chuyên gia định tuyến, mỗi Token chỉ chọn 8 trong số đó, cộng thêm 1 chuyên gia dùng chung mà mọi Token đều sử dụng. Phần chú ý áp dụng kiến trúc lai KDA và MLA theo tỷ lệ 3:1, tức là cứ 3 lớp Kimi Delta Attention thì tiếp theo là 1 lớp MLA.
Theo công bố chính thức, phiên bản FP8 trên M4 Pro MacBook đạt khoảng 86–90 Token/s; trên DGX Spark đạt khoảng 100–105 Token/s.
