动察 Beating AI tin nhanh, StepFun ra mắt StepAudio 3, tung ra một loạt năm mô hình giọng nói gồm Realtime, ASR, TTS, Gen và Music.
Trong hai bài đánh giá giọng nói của Artificial Analysis, StepAudio 3 Realtime đều đứng đầu. Điểm Conversational Dynamics đạt 98,9%, cao hơn 98,4% của Qwen Audio 3.0 Realtime Plus và 95,3% của GPT-Realtime-2 High; điểm Speech Reasoning đạt 99,7%, cũng đứng đầu. Bài trước chủ yếu kiểm tra liệu mô hình có xử lý được khoảng dừng, luân phiên nói, người dùng ngắt lời và những câu đáp như "ừm" "đúng" hay không, bài sau kiểm tra liệu mô hình có thể trực tiếp hiểu âm thanh và hoàn thành suy luận hay không.
ASR cũng đạt 1,7% WER (tỷ lệ lỗi từ) trên bảng xếp hạng nhận dạng giọng nói phi luồng của Artificial Analysis, đồng hạng nhất với Fun-Realtime-ASR-preview. Ngoài ra, StepAudio 3 Gen có thể tạo giọng người, hiệu ứng âm thanh, âm thanh môi trường và âm nhạc trong một lần, đồng thời sắp xếp thống nhất theo bối cảnh.
Năm mô hình hiện đều đã gia nhập dòng sản phẩm giọng nói của StepFun.
