BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

AI thực tập 7 tháng vượt qua người thật: Fable 5.1 vị trí kế toán đạt tỷ lệ thành công 72%

动察 Beating tin nhanh AI, công ty khởi nghiệp AI Agent NeoCognition công bố ApprenticeBench, chuyên kiểm tra liệu AI có thể giống như nhân viên mới, sau khi vào làm tự học được một công việc hay không. Phiên bản đầu tiên cho Agent vào một công ty xây dựng mô phỏng ở California làm kế toán phải trả. Nó đọc trước hóa đơn lịch sử nửa năm, sổ tay công ty và hướng dẫn Odoo, sau đó liên tục xử lý 100 hóa đơn trong 7 tháng, trong thời gian đó còn gặp thay đổi quy tắc và phản hồi từ giám sát.


Tỷ lệ thành công cuối cùng của Fable 5.1 đạt 72%, GPT-6 Astra là 68%, người thử nghiệm tốt nhất chỉ đạt 51%. Nhiệm vụ ngoài nhập hóa đơn còn bao gồm phát hiện lỗi, phân bổ mã chi phí, liên hệ nhà cung cấp, đi quy trình phê duyệt, và học quy tắc nội bộ của công ty từ hồ sơ lịch sử và phản hồi. Thành tích của hai mô hình thao tác trực tiếp GUI thậm chí còn cao hơn một chút so với gọi API, tổn thất hiệu năng thường thấy của Computer Use trước đây về cơ bản đã biến mất.


Tuy nhiên, "vượt qua con người" chỉ đúng ở vị trí mô phỏng này, và mẫu người thật chỉ có 2. Chi phí cũng cao hơn, Fable 5.1 trung bình mỗi nhiệm vụ tốn 18,23 USD, con người khoảng 7,21 USD. Con người càng làm càng nhanh, Agent ngược lại sẽ chậm đi vì ghi nhớ ngày càng nhiều.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành