BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Mô hình ASR mới của Meta đứng đầu về phiên âm thời gian thực, chỉ với 0,18 USD mỗi giờ.

Động sát Beating Tin nhanh AI, Meta Superintelligence Labs đã phát hành Muse Voice Transcribe. Công cụ này tích hợp chuyển giọng nói thời gian thực thành văn bản, phân biệt các người nói khác nhau, và xác định khi nào người dùng nói xong, tất cả trong một mô hình duy nhất. Nó có thể xử lý âm thanh dài hơn 1 giờ và phân biệt hơn 20 người cùng lúc.


Trong bài kiểm tra chuyển văn bản tiếng Anh thời gian thực của Artificial Analysis, WER (tỷ lệ lỗi từ, càng thấp càng tốt) của nó là 3,1%. GPT Live Transcribe là 3,9%, Gemini 3.5 Transcribe Live là 4,0%. Muse Voice Transcribe có thể đưa ra văn bản cuối cùng khoảng 0,16 giây sau khi người nói kết thúc.


Nó không cố định cùng một thời gian chờ cho tất cả các từ. Mô hình đọc 80ms âm thanh mỗi lần và tự quyết định tiếp tục nghe hay bắt đầu xuất ra. Các từ đơn giản có thể được viết nhanh hơn, còn các từ khó thì nghe thêm ngữ cảnh trước khi xác định. Meta sử dụng học tăng cường để tối ưu hóa đồng thời độ chính xác và độ trễ.


Mô hình được huấn luyện với hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ đã được xác minh trọng điểm, và có thể trực tiếp nhận diện việc trộn tiếng Trung và tiếng Anh trong một câu. Hiện tại nó đã được tích hợp vào Meta AI for Mac và Muse Code, đồng thời mở API Meta Model. Giá là 3 đô la cho mỗi 1000 phút, tức 0,18 đô la mỗi giờ.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành