BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

小红书 đã mã nguồn mở mô hình TTS tự hồi quy liên tục hoàn toàn dots.tts, hỗ trợ nhân bản giọng nói zero-shot.

Theo Động Sát Beating giám sát, phòng thí nghiệm hi lab của Xiaohongshu đã mã nguồn mở mô hình chuyển văn bản thành giọng nói (TTS) tự hồi quy đầu cuối với 2 tỷ tham số mang tên dots.tts, đồng thời công bố mã nguồn hoàn chỉnh cho suy luận và tinh chỉnh theo giao thức Apache 2.0. Các trọng số được công bố công khai bao gồm phiên bản tiền huấn luyện cơ bản, phiên bản tinh chỉnh tự sửa lỗi căn chỉnh (SCA) và phiên bản chưng cất suy luận độ trễ thấp.

Khác với các kiến trúc TTS truyền thống phụ thuộc vào Token mã hóa âm thanh rời rạc (Discrete Codec Tokens) như VALL-E, CosyVoice, ChatTTS, dots.tts triển khai kiến trúc ghép dòng tự hồi quy hoàn toàn liên tục, đầu cuối, không sử dụng bất kỳ Token rời rạc nào trong toàn bộ pipeline. dots.tts kết hợp các đặc trưng liên tục được trích xuất từ AudioVAE với tốc độ lấy mẫu 48 kHz, bộ mã hóa ngữ nghĩa, mô hình ngôn ngữ nền (khởi tạo từ Qwen2.5-1.5B-Base, xử lý trực tiếp văn bản BPE, không cần đầu vào pinyin) và đầu âm thanh ghép dòng tự hồi quy, dự đoán các biến tiềm ẩn liên tục và tái tạo thành âm thanh thông qua bộ tạo. Do dự đoán trực tiếp các đặc trưng liên tục, dots.tts tránh được tổn thất chất lượng âm thanh do lượng tử hóa rời rạc, giữ lại chi tiết phát âm, độ tương đồng âm sắc và khả năng biểu cảm cảm xúc.

dots.tts được tiền huấn luyện trên khoảng 1,5 triệu giờ dữ liệu giọng nói. Trong đánh giá Seed-TTS-Eval, dots.tts đạt tỷ lệ lỗi từ (WER) lần lượt là 0,94% / 1,30% / 6,60% trên các bộ kiểm tra tiếng Trung, tiếng Anh và tiếng Trung khó, điểm tương đồng (SIM) là 81,0 / 77,1 / 79,5, đều đạt mức SOTA mã nguồn mở. Trong bài kiểm tra đa ngôn ngữ MiniMax Multilingual với 24 ngôn ngữ, độ tương đồng trung bình của người nói đạt 83,9. Xiaohongshu đã cung cấp không gian trải nghiệm Gradio trên Hugging Face để người dùng kiểm tra trực tuyến khả năng sao chép giọng nói zero-shot.

举报 Báo lỗi/Báo cáo
Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành