动察 Beating AI tin nhanh, Tencent Hunyuan mã nguồn mở mô hình tạo và chỉnh sửa giọng nói 1,5 tỷ tham số AuK, chính thức gọi nó là "Nano Banana phiên bản âm thanh". Nhân bản giọng nói, sửa lời, đổi cảm xúc, loại bỏ giọng địa phương, điều chỉnh tốc độ nói và cao độ, khử nhiễu, tách nhiều người và nhạc, tất cả đều được nhét vào cùng một mô hình, có thể điều khiển bằng ngôn ngữ tự nhiên.
AuK có thể trực tiếp chỉnh sửa bản ghi âm có sẵn. Nói sai vài chữ, chỉ cần sửa vài chữ đó, không cần thu lại toàn bộ; nội dung không đổi, cũng có thể đổi cảm xúc, âm sắc hoặc giọng địa phương. Sửa lời bài hát, loại bỏ tiếng cười và tiếng ho, chuyển giọng nói bình thường thành thì thầm cũng đều được hỗ trợ. Nhân bản giọng nói cũng không cần cung cấp bản chép lời cho bản ghi âm tham chiếu trước, chỉ cần một đoạn âm thanh và văn bản mới là có thể tạo.
Trong thử nghiệm chính thức, AuK dẫn đầu trong nhiều đánh giá về tạo giọng nói và chỉnh sửa giọng nói tổng quát. Điểm SpeechEditBench đạt 49,73, đứng thứ hai là Ming-UniAudio với 28,70. Phiên bản nhanh AuK-Flash sau khi chưng cất chỉ cần 4 bước suy luận, tốc độ nhanh hơn khoảng 4,5 lần. Tuy nhiên, bài báo cũng thừa nhận rằng AuK hiện tại vẫn chưa thể hiểu ổn định tất cả các lệnh ngôn ngữ tự nhiên tùy ý, vẫn phải dựa vào Prompt Enhancer để xác định nhiệm vụ, sắp xếp tham số và viết lại lệnh. Mã nguồn và trọng số mô hình đã được công khai, sử dụng giấy phép MIT.
