BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Tencent mã nguồn mở "Nano Banana phiên bản âm thanh": thay đổi từ ngữ và giọng nói trọn gói, chỉnh sửa giọng nói vượt trội bảng xếp hạng

动察 Beating AI tin nhanh, Tencent Hunyuan mã nguồn mở mô hình tạo và chỉnh sửa giọng nói 1,5 tỷ tham số AuK, chính thức gọi nó là "Nano Banana phiên bản âm thanh". Nhân bản giọng nói, sửa lời, đổi cảm xúc, loại bỏ giọng địa phương, điều chỉnh tốc độ nói và cao độ, khử nhiễu, tách nhiều người và nhạc, tất cả đều được nhét vào cùng một mô hình, có thể điều khiển bằng ngôn ngữ tự nhiên.


AuK có thể trực tiếp chỉnh sửa bản ghi âm có sẵn. Nói sai vài chữ, chỉ cần sửa vài chữ đó, không cần thu lại toàn bộ; nội dung không đổi, cũng có thể đổi cảm xúc, âm sắc hoặc giọng địa phương. Sửa lời bài hát, loại bỏ tiếng cười và tiếng ho, chuyển giọng nói bình thường thành thì thầm cũng đều được hỗ trợ. Nhân bản giọng nói cũng không cần cung cấp bản chép lời cho bản ghi âm tham chiếu trước, chỉ cần một đoạn âm thanh và văn bản mới là có thể tạo.


Trong thử nghiệm chính thức, AuK dẫn đầu trong nhiều đánh giá về tạo giọng nói và chỉnh sửa giọng nói tổng quát. Điểm SpeechEditBench đạt 49,73, đứng thứ hai là Ming-UniAudio với 28,70. Phiên bản nhanh AuK-Flash sau khi chưng cất chỉ cần 4 bước suy luận, tốc độ nhanh hơn khoảng 4,5 lần. Tuy nhiên, bài báo cũng thừa nhận rằng AuK hiện tại vẫn chưa thể hiểu ổn định tất cả các lệnh ngôn ngữ tự nhiên tùy ý, vẫn phải dựa vào Prompt Enhancer để xác định nhiệm vụ, sắp xếp tham số và viết lại lệnh. Mã nguồn và trọng số mô hình đã được công khai, sử dụng giấy phép MIT.

举报 Báo lỗi/Báo cáo
Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành