动察 Beating Tin nhanh AI, Meta đã chính thức tích hợp mô hình phân đoạn thị giác SAM 3.1 vào Model API. Nhà phát triển truyền vào hình ảnh hoặc video, sau đó nhập cụm từ như "xe đạp màu đỏ", là có thể trực tiếp tìm ra vật thể tương ứng, trả về hộp giới hạn và mặt nạ cấp độ điểm ảnh. Trong video còn có thể theo dõi cùng một mục tiêu suốt quá trình, thuận tiện cho việc tự động làm mờ, thêm hiệu ứng, v.v.
Meta đã phát hành phiên bản trọng số mở của SAM 3.1 vào tháng 3 năm nay. So với SAM 3, nâng cấp lớn nhất của nó là Object Multiplex, trước đây nhiều mục tiêu phải xử lý từng cái một, giờ đây có thể xử lý đồng thời tối đa 16 cái cùng lúc. Trong thử nghiệm của Meta, tốc độ xử lý video đa mục tiêu của một card H100 đã tăng từ 16 khung hình mỗi giây lên 32 khung hình mỗi giây; khi theo dõi 128 mục tiêu, tốc độ khoảng gấp 7 lần SAM 3.
Trước đây nhà phát triển cần tự tải trọng số, chuẩn bị GPU và môi trường triển khai, giờ đây có thể trực tiếp sử dụng API do Meta lưu trữ. Phân đoạn hình ảnh thu 2,5 USD mỗi 1000 ảnh, video thu 0,2 USD mỗi 1000 khung hình, còn có thể tích hợp trực tiếp bằng OpenAI SDK.
Tuy nhiên phiên bản API hiện chỉ chấp nhận gợi ý văn bản, phiên bản trọng số mở còn có thể dùng gợi ý thị giác như hộp, điểm để chỉ định mục tiêu. API video theo dõi tối đa 16 vật thể mỗi khung hình.
