BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Còn xa mới thực sự thay thế được lập trình viên: Agent khi vào mã nguồn riêng của doanh nghiệp, tỷ lệ vượt qua cao nhất cũng chỉ đạt bốn mươi phần trăm

动察 Beating AI tin nhanh, công ty dữ liệu AI Specific Labs được YC ươm mầm ra mắt bài đánh giá lập trình Real-SWE, chuyên dùng mã nguồn riêng tư của các công ty thực tế để kiểm tra Coding Agent. Nhiệm vụ đến trực tiếp từ môi trường sản xuất của doanh nghiệp, bao gồm tính thuế, di chuyển hóa đơn, tính phí API và di chuyển dữ liệu khách hàng. Mã nguồn và đáp án đều không được công khai trên mạng, Agent phải tự mình tìm hiểu quy tắc kinh doanh và cấu trúc mã nguồn của công ty.


Kết quả Fable 5.1 đứng đầu, tỷ lệ vượt qua cũng chỉ 38,8%; GPT-6 Astra là 33,8%, Gemini 3.8 Flash là 31,2%. GLM 5.3 với 28,8% đứng thứ tư, cao hơn Grok 4.6, Kimi K3 và GPT-5.6 Sol. Trong 10 nhiệm vụ được công khai hiện tại, có 6 nhiệm vụ có tỷ lệ vượt qua tổng thể dưới 15%, và còn một nhiệm vụ tất cả các mô hình đều thất bại.


Điều bất ngờ nhất là GLM 5.3. Real-SWE càng kiểm tra khả năng của Agent trong việc liên tục đọc mã nguồn, tìm quy tắc và hoàn thành nhiều bước thay đổi trong dự án xa lạ. Nhà nghiên cứu Xiaopu Peng của Zhipu phản hồi rằng, họ đã huấn luyện nhiệm vụ dài hạn từ GLM-5.1, Real-SWE gần với loại năng lực này hơn so với bảng SWE công khai, điều này cũng có thể phần nào giải thích tại sao GLM 5.3 thể hiện nổi bật trên bảng xếp hạng này.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành