BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Đánh giá chiến trường thương mại AI: GPT giao dịch tích cực, Haiku chỉ vẽ bánh vẽ, Kimi bận rộn nhưng không kiếm được tiền.

Theo Động Sát Beating giám sát, Sakana AI hợp tác với công ty kiểm toán Azsa của KPMG Nhật Bản ra mắt chuẩn đánh giá kinh tế học đa tác tử chu kỳ dài CoffeeBench, mô phỏng môi trường kinh doanh thực tế để kiểm tra khả năng ra quyết định dài hạn của các mô hình lớn. Các bài đánh giá truyền thống hầu hết chỉ cho phép một mô hình đơn lẻ thực hiện nhiệm vụ trong môi trường tĩnh, trong khi CoffeeBench xây dựng một thị trường động đòi hỏi sự tương tác và đàm phán đa bên. Bài báo đã được hội thảo về chế độ lỗi của tác tử AI (ICML 2026 Workshop Failure Modes in Agentic AI) chấp nhận.

Bài đánh giá mô phỏng một chuỗi cung ứng cà phê gồm 2 nông trại, 2 nhà rang xay và 2 nhà bán lẻ. Trong bài đánh giá, mô hình chịu trách nhiệm vận hành 1 nhà rang xay, trong chu kỳ mô phỏng 90 ngày, tự duy trì hoạt động kinh doanh thông qua các công cụ như gửi tin nhắn, chào giá giao dịch, thanh toán hóa đơn và thanh toán nợ. Nếu tác tử phản ứng tiêu cực, chi phí cố định hàng ngày sẽ nhanh chóng làm cạn kiệt vốn lưu động, buộc mô hình lớn phải tính toán chi ly như một doanh nghiệp thực tế.

Đánh giá ngang hàng nhiều mô hình lớn phổ biến cho thấy những "tính cách thương chiến" hoàn toàn khác biệt. GPT-5.5 và Claude Opus 4.7 thể hiện là "kiểu giao tiếp tích cực", thường xuyên đàm phán giá với các bên thượng nguồn và hạ nguồn, và thường xuyên khớp lệnh để mở rộng doanh số; Gemini 3.1 Pro thuộc "kiểu phản ứng thụ động", hiếm khi chủ động gửi tin nhắn, nhưng thường xuyên tra cứu và phản hồi thông tin từ đối tác giao dịch; Kimi K2.6 mặc dù gọi công cụ rất thường xuyên, nhưng do thiếu kỷ luật định giá và chiến lược đàm phán hợp lý, rơi vào bẫy "doanh thu cao, lợi nhuận bằng không".

Điều bất ngờ nhất là hiện tượng "trì hoãn" của Claude Haiku 4.5. Nhật ký suy luận cho thấy Claude Haiku 4.5 có thể xây dựng chiến lược kinh doanh hoàn hảo và nhận thức rõ ràng cần mua nguyên liệu thô giá thấp để đáp ứng nhu cầu thị trường, nhưng khi thực thi công cụ lại liên tục chọn lệnh chờ (wait_for_next_day). Sự tách rời nghiêm trọng giữa lập kế hoạch và thực thi dẫn đến hoạt động kinh doanh hoàn toàn đình trệ, khiến mô hình chịu lỗ nặng dưới áp lực chi phí cố định.

Bài đánh giá cũng thử nghiệm áp lực mục tiêu doanh số cực đoan lên tác tử. Mặc dù hiện tại các mô hình lớn chưa tiến hóa đến mức nhận thức về việc thổi phồng doanh số thông qua giao dịch vòng tròn giả mạo (circular trading), nhưng nghiên cứu chỉ ra rằng, với sự cải thiện khả năng lập kế hoạch dài hạn và phối hợp, tác tử hoàn toàn có thể trong tương lai vì áp lực hiệu suất mà vi phạm kinh tế. Làm thế nào để kiểm toán và ngăn chặn vi phạm và gian lận của tác tử trong hoạt động kinh tế sẽ trở thành một chủ đề mới trong quản trị an toàn.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành