动察 Beating AI tin nhanh, Alibaba Qianwen ra mắt mô hình đa phương thức gốc Qwen3.8-Omni-Flash, hỗ trợ văn bản, hình ảnh, âm thanh, video và ngữ cảnh 1M.
Thế hệ này rõ ràng đã tăng cường khả năng Agent âm thanh và video. Mô hình có thể tự tìm thông tin từ video, lập kế hoạch nhiệm vụ, rồi gọi công cụ bên ngoài để hoàn thành việc cắt ghép, lồng tiếng và kết xuất. Phía chính thức đã trình diễn các kịch bản như xử lý cuộc họp dài, dịch phim ngắn, bình luận phim, sản xuất MV và chuyển video thành ghi chú văn bản - hình ảnh.
Đối với video dài hàng giờ, nó cũng không cần xử lý toàn bộ từ đầu đến cuối. Mô hình sẽ phán đoán trước câu trả lời có thể nằm ở đâu, rồi dần dần định vị đoạn then chốt. Trên OmniVideoBench, độ chính xác tăng từ 63,4 lên 67,8, mức tiêu thụ Token giảm từ 145.736 xuống 79.117, giảm 45,7%.
Qianwen cho biết, Qwen3.8-Omni-Flash có điểm trung bình trên 30 bài đánh giá cao hơn Qwen3.5-Omni-Plus hơn 26%, khả năng âm thanh và video tiệm cận Gemini 3.8 Flash, khả năng âm thanh nhìn chung vượt qua mô hình sau. Chi phí đầu vào âm thanh giảm hơn 98%, đầu vào âm thanh và video giảm hơn 93%.
Hiện tại trọng số mô hình Qwen3.8-Omni-Flash chưa được công khai, chỉ mở API. Qianwen đồng thời mã nguồn mở Qwen-MM-Plugins, có thể cài vào Claude Code, Codex, Gemini CLI, Qwen Code và các Agent khác, bổ sung cho chúng khả năng xử lý hình ảnh, âm thanh, video dài và cắt ghép video.
Bộ Qwen-Live Harness khác giống như một lớp điều phối thời gian thực. Người dùng có thể trực tiếp nói chuyện với mô hình đa phương thức thời gian thực, rồi giao nhiệm vụ phức tạp cho các Agent chạy nền như Gemini CLI, Claude Code, Codex để tiếp tục thực thi. Nó sẽ theo dõi tiến độ nhiệm vụ, sau khi hoàn thành sẽ chủ động quay lại thông báo kết quả cho bạn.
