Theo tin tức 1M AI, vào ngày 4 tháng 3, Google đã phát hành bản xem trước Gemini 3.1 Flash-Lite, định vị là mô hình nhanh nhất và chi phí thấp nhất trong dòng Gemini 3. Mô hình này dựa trên kiến trúc Gemini 3 Pro, sử dụng thiết kế Mixture of Experts (MoE), chỉ kích hoạt một phần tham số để giảm chi phí suy luận. Giá cả API là $0.25/triệu token vào, $1.50/triệu token ra, lần lượt khoảng 1/8 so với Gemini 3.1 Pro ($2/$18).
Về hiệu suất, so với Gemini 2.5 Flash, độ trễ token đầu tiên giảm 2.5 lần, tốc độ ra mỗi token tăng 45%, đạt 363 token mỗi giây. Hỗ trợ tối đa 1 triệu token vào và 64,000 token ra, chấp nhận đầu vào văn bản, hình ảnh, âm thanh và video. Trong 11 bài kiểm tra nội bộ, Flash-Lite vượt qua GPT-5 mini và Claude 4.5 Haiku ở 6 bài, GPQA Diamond (trả lời câu hỏi khoa học cấp tiến) đạt 86.9%, MMMU-Pro (suy luận đa phương tiện) 76.8%, LiveCodeBench (tạo mã) 72.0%.
Mô hình này tích hợp "cấp độ suy nghĩ" có thể điều chỉnh, các nhà phát triển có thể kiểm soát độ sâu suy luận của mô hình, cân bằng chất lượng và chi phí trong các tình huống tần suất cao. Hiện tại, truy cập bản xem trước thông qua Gemini API (Google AI Studio) và Vertex AI.
