Theo giám sát của Beating, ByteDance Seed đã phát hành mô hình sáng tạo âm thanh Seed Audio 1.0. Mô hình này có thể đồng thời tạo ra lời thoại, hiệu ứng âm thanh và âm thanh môi trường chỉ với một prompt, đồng thời kiểm soát thời gian xuất hiện của âm thanh theo dòng thời gian.
Mô hình hỗ trợ nhập văn bản và âm thanh tham chiếu, với độ chính xác kiểm soát thời gian là 100ms. Mỗi lần có thể tạo ra khoảng 2 phút âm thanh, có thể kéo dài thêm và duy trì tính nhất quán của giọng nói nhân vật.
Seed Audio 1.0 hỗ trợ hơn 20 ngôn ngữ. Cùng một giọng nói có thể chuyển đổi giữa các ngôn ngữ, cũng có thể thay đổi giọng điệu và cảm xúc.
Đánh giá chính thức cho thấy, tỷ lệ sử dụng âm thanh trong hầu hết các tình huống vượt quá 90%. Điểm MOS tự nhiên của hầu hết các ngôn ngữ đều trên 4 điểm. Mô hình đã được đưa lên Trung tâm trải nghiệm Volcano Ark và mở API để tích hợp.
