BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Bảng xếp hạng thực chiến cho Agent cá nhân cũng đã có: Muse tạm đứng đầu, dẫn trước Instinct và Grok Bot

动察 Beating AI tin nhanh, dự án đánh giá độc lập Assistant Benchmark bắt đầu dùng các tác vụ thực tế để đánh giá chéo các trợ lý AI cá nhân. Nó trực tiếp để Agent đặt khách sạn, chọn nhà hàng, mua đồ, trả lời email, kết nối dịch vụ bên thứ ba, rồi chấm điểm theo tình hình hoàn thành thực tế. Mỗi chiều đánh giá đều có một tác vụ cố định được công khai, và yêu cầu phải có bản ghi chạy thực tế mới được tính điểm.


Hiện tại Muse đạt trung bình 9,1 điểm trong 7 chiều đánh giá đã hoàn thành, tạm xếp thứ nhất; Instinct đã kiểm tra 11 chiều, trung bình 8,4 điểm; Grok Bot đã kiểm tra 7 chiều, trung bình 7,3 điểm. Muse đều đạt 10 điểm ở mua sắm, email và kết nối ứng dụng bên thứ ba.


Tuy nhiên điều này phù hợp hơn để xem như một bảng trải nghiệm thực tế được cập nhật liên tục. Mức 9,1 của Muse hiện chỉ là điểm trung bình của 7 chiều đã kiểm tra, không phải thành tích đầy đủ. Mỗi chiều hiện cũng chỉ dùng một tác vụ cố định để kiểm tra, sau khi bổ sung kiểm tra về sau thì điểm số và thứ hạng đều có thể thay đổi.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành