BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Perplexity ra mắt mô hình Embedding mới mã nguồn mở: đọc toàn bộ văn bản cùng lúc, cắt khối vẫn giữ được ngữ cảnh

动察 Beating AI tin nhanh, Perplexity mã nguồn mở mô hình embedding ngữ cảnh mới pplx-embed-v2-context-9b-preview, chủ yếu dùng cho truy xuất RAG. Embedding thông thường thường chia tài liệu dài thành các đoạn nhỏ rồi hiểu riêng từng đoạn, mô hình mới sẽ mã hóa các đoạn này cùng nhau, để mỗi đoạn khi tạo vector đều có thể tham chiếu ngữ cảnh của toàn bộ tài liệu. Mô hình đã được mở trên Hugging Face, sử dụng giấy phép MIT.


Ví dụ một đoạn văn chỉ viết "nó tăng 20%", nếu tách riêng ra thì rất khó biết "nó" là ai. Mô hình mới có thể kết hợp các phần khác của tài liệu để hiểu câu này. Khi huấn luyện, nó còn chuyên học cách đồng thời tìm lại câu trả lời và các đoạn khác hỗ trợ câu trả lời, để AI tiếp theo không chỉ nhận được câu trả lời mà còn nhận được bằng chứng cần thiết để xác minh câu trả lời.


Trong bài kiểm tra mù context-bench do turbopuffer thiết kế, Answer@10 của mô hình mới đạt 45,5%, cao hơn Voyage Context 4 14,4 điểm phần trăm; Evidence Recall@10 là 40,6%, cao hơn 5 điểm phần trăm. Bài kiểm tra bao gồm 38.894 tài liệu dài và 2.099 truy vấn, đề bài không công khai, có thể giảm rủi ro tập kiểm tra bị ô nhiễm bởi dữ liệu huấn luyện.


Mô hình hiện vẫn là phiên bản Preview. Perplexity nhắc nhở rằng trọng số, giao diện và embedding được tạo ra sau này đều có thể thay đổi, nên các vector được tạo ra hiện tại không nhất định có thể dùng trực tiếp lẫn với phiên bản tương lai.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành