BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Jev rốt cuộc có ngưỡng cửa không? OpenJEV đã chia thành 4 phe: không nhả chữ thì dễ, xác suất đáng tin thì rất khó

Động sát Beating AI tin nhanh, Jev mới ra mắt chưa đầy một tuần, cộng đồng mã nguồn mở đã bắt đầu tái tạo mô hình "không viết đáp án, đưa thẳng xác suất" này.


Chúng đều muốn làm cùng một việc: bỏ qua việc sinh từng token, đưa thẳng các lựa chọn và xác suất. Nhưng cách làm cụ thể đã chia thành nhiều hướng hoàn toàn khác nhau.


1. SemIf đơn giản nhất, thậm chí không cần huấn luyện lại mô hình. Nó trực tiếp dùng Qwen có sẵn, khi mô hình chuẩn bị trả lời A, B, C thì chặn lại, không cho viết tiếp, đọc thẳng điểm số của từng lựa chọn, rồi chuyển thành xác suất.


2. Simple Jev cũng dùng mô hình lớn có sẵn, nhưng tiết kiệm thêm phần tính toán lặp lại. Cùng một đoạn tài liệu chỉ đọc một lần, các câu hỏi phía sau dùng chung kết quả này, rồi phán đoán đáp án riêng. Tác giả cũng nói rõ, nó tái tạo cách sử dụng Jev, còn độ chính xác, tốc độ và hiệu chuẩn xác suất đều chưa đạt tương đương.


3. Laya thậm chí không dùng mô hình lớn biết sinh văn bản, mà thay bằng mô hình mã hóa giống bộ phân loại truyền thống hơn. Ưu điểm là nhỏ và nhanh, nhược điểm cũng rất rõ. Khi chọn một lần từ 77 lựa chọn, độ chính xác của Laya chỉ 42,5%, Jev là 87,0%.


4. Von cũng đi theo hướng mô hình quyết định chuyên dụng. Nó chỉ có khoảng 400 triệu tham số, không sinh văn bản, một lần lan truyền xuôi hoàn thành trực tiếp Choice, Noul và Score, giống một bộ phân loại thế hệ mới biết đọc ngôn ngữ tự nhiên.


5. Verdict còn nhỏ hơn, chỉ khoảng 150 triệu tham số. Tác giả tập trung xử lý hai vấn đề: trả lời sai vẫn báo độ tin cậy rất cao, và đổi thứ tự lựa chọn thì kết quả cũng thay đổi theo. Nó quan tâm hơn đến việc làm sao để xác suất và phán đoán đều ổn định.


6. Kev chọn giữ lại mô hình lớn. Nó lấy Qwen làm nền, thêm cấu trúc quyết định chuyên dụng, để cùng một đầu vào chỉ đọc một lần, nhiều câu hỏi tự tính xác suất. Bên thứ ba trước đây khi dịch ngược Jev cũng suy đoán nó có thể dùng thiết kế tương tự.


Trong tự kiểm tra của Kev, dùng câu hỏi mới chưa từng thấy khi huấn luyện để kiểm tra, độ chính xác bản 8B khoảng 78%, Jev khoảng 86%. Khoảng cách rõ hơn nằm ở độ tin cậy, Kev vẫn có một số câu trả lời sai đưa ra độ chắc chắn trên 90%.


7. Nimble tập trung vào huấn luyện. Nó dùng Qwen3.5-9B, rồi chuẩn bị một loạt dữ liệu "chỉ đổi một sự thật, đáp án đúng lập tức đảo ngược" để huấn luyện sau. Trong 324 mẫu kiểm tra không tham gia huấn luyện, Nimble có 90,1% chọn đúng đáp án tham chiếu, Jev là 93,2%. Nhưng tác giả cũng nhắc rằng, hiện tại vẫn chưa thể đảm bảo mô hình "báo 90% thì thực sự đúng 90%".


8. OpenJev đi xa nhất, chuyển thẳng sang DiffusionGemma. Nó để trống một vài vị trí câu trả lời trước, rồi điền một lần giống như mô hình khuếch tán bù hình. Trên RTX PRO 6000, độ trễ trung vị cho một yêu cầu đơn khoảng 94ms.


Sau vài ngày, OpenJEV đã chia thành bốn hướng: đọc trực tiếp điểm câu trả lời của mô hình có sẵn, huấn luyện mô hình quyết định chuyên dụng, cải tạo mô hình lớn thành mô hình quyết định, và dùng mô hình khuếch tán để điền câu trả lời trực tiếp.


Hướng đi của Jev trông rất dễ sao chép. Thứ thực sự tạo ra khác biệt vẫn là độ chính xác, khả năng tổng quát hóa và hiệu chỉnh xác suất. Mô hình dám báo 90%, nhưng 90% này thực sự đáng tin đến mức nào mới là phần khó nhất.

举报 Báo lỗi/Báo cáo
Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành