Theo theo giám sát từ Dự báo Đánh Bại, Sao Bước nhảy đã phát hành Mô hình lớn thời gian thực End-to-End StepAudio 2.5 Realtime, chú trọng vào trò chuyện "cảm giác như người thật", hỗ trợ tùy chỉnh nhân vật toàn diện và cảm nhận ngôn ngữ phụ (đặc điểm không ngôn ngữ như giọng điệu, dấu cạnh...). Mô hình đã được triển khai hoàn toàn trên Nền tảng API công khai.
Ngũ chiều đánh giá chính thức (kiểm tra tháng 4 năm 2026) đã đạt giải nhất trên tất cả. Trong đó, đánh giá chủ quan nhất phản ánh trải nghiệm thực sự nhất (điểm trò chuyện thực tế trên ứng dụng điện thoại) đạt 80.41, GPT-Realtime-1.5 đạt 68.01, Gemini Live đạt 67.16. Đánh giá câu hỏi giọng nói đạt 79.80, gần 1,5 lần so với GPT-Realtime-1.5 (53.20). Hiểu biết ngôn ngữ phụ đạt 82.18, Đối thoại chung đạt 86.36, Bối cảnh trên xe đạt 84.80.
Có ba thiết kế chính trong lộ trình công nghệ. Thứ nhất, dựa trên hơn 10.000 nhân vật nguyên thủy, mô hình đã tách biệt ra từng tri thức vạn vật với ma trận đặc điểm tri thức hàng triệu, kết hợp với việc huấn luyện trên lượng lớn dữ liệu trò chuyện thực tế, giúp mô hình duy trì ổn định trên các chủ đề đuôi dài và ngách. Thứ hai, đối với trường hợp chơi vai, đã thực hiện việc điều chỉnh RLHF riêng biệt (Học tăng cường dựa trên phản hồi của con người) để giải quyết vấn đề lỗi thời "sụp đổ của nhân vật" khi trò chuyện với AI. Thứ ba, sự hòa trộn sâu giữa hiểu biết và tạo ra, kế thừa khả năng thể hiện từ TTS StepAudio 2.5 của riêng mình, đạt được quy mô toàn cảnh của bối cảnh và tinh tế từng chi tiết trong câu.
API tương thích với giao thức OpenAI Realtime API (dựa trên WebSocket), nhà phát triển có thể chuyển đổi với chi phí thấp. Giá cả là 10 đồng vào/ triệu token (đánh trúng bộ nhớ cache 2 đồng), đầu ra là 70 đồng/ triệu token, ước lượng chính thức cho chi phí trò chuyện giọng nói liên tục xấp xỉ 3,8 đồng/giờ.
