BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

RSI bắt đầu rơi vào dự án Harness: Pi giúp Agent chạy lâu, DeepSeek giúp Agent dễ chỉnh sửa.

Theo dõi từ 动察 Beating, việc tự cải thiện đệ quy đang ngày càng được áp dụng cụ thể lên Harness. Gần đây, hai thiết kế của Pi và DeepSeek Harness vừa bổ sung hai nền tảng then chốt: một giúp Agent chạy đủ lâu, một giúp bản thân Agent dễ dàng chỉnh sửa.

Đặc tả Harness V3 mới nhất của Pi thiết kế Agent thành một runtime bền vững có thể khôi phục. Trước khi gửi yêu cầu mô hình và gọi công cụ, hệ thống ghi lại ý định thực thi, sau khi hoàn thành thì ghi kết quả và trạng thái bước tiếp theo. Khi tiến trình sụp đổ, hệ thống có thể biết nhiệm vụ dừng ở đâu, thao tác nào có thể chạy lại an toàn, thao tác nào có tác dụng phụ và không thể thực thi lần nữa. Để Agent chạy lâu dài, trước tiên không thể để một lần sụp đổ mà phải bắt đầu lại từ đầu.

DeepSeek Harness bổ sung nửa còn lại. Cordis biến bộ điều hợp mô hình, hệ thống công cụ, Session Log, thậm chí cả Agent Loop thành các thành phần có thể kết hợp; chế độ sáng tạo còn cho phép Agent kiểm tra môi trường Cordis trong lúc chạy, tạm thời định nghĩa, tải và gỡ bỏ các thành phần mới.

Pi giúp trạng thái thực thi có thể tiếp tục, DeepSeek giúp cấu trúc thành phần của Agent có thể tái tổ chức động.

Đây chính là hướng mà Ông Lệ đã thảo luận vào tháng 7 về Harness và tự cải thiện đệ quy. RSI trong tương lai gần không nhất thiết bắt đầu từ việc mô hình trực tiếp viết lại trọng số, con đường thực tế hơn là tối ưu hóa ngữ cảnh và quy trình làm việc trước, rồi đào sâu vào mã Harness, cuối cùng ngay cả "cách tối ưu hóa Harness" cũng trở thành đối tượng tối ưu hóa.

Hiện vẫn thiếu mảnh thứ ba: xác minh chính xác. Nghiên cứu Agent tự tiến hóa đã coi đánh giá và an toàn là vấn đề cốt lõi. Agent có thể chạy lâu dài, cũng có thể tự sửa đổi, nhưng nếu ngay cả "thế nào là tiến bộ" cũng có thể thay đổi cùng nhau, thì rất dễ tối ưu hóa để vượt qua bài kiểm tra của chính mình. Ông Lệ cũng đặc biệt nhấn mạnh rằng verifier, tracer và ranh giới an toàn nên được đặt bên ngoài vòng lặp tự sửa đổi.

Vì vậy, vòng khép kín RSI thực sự ít nhất phải giải quyết ba điều: chạy lâu, sửa được, xác minh chính xác. Pi đang bổ sung mảnh thứ nhất, DeepSeek đang bổ sung mảnh thứ hai, mảnh thứ ba quyết định liệu "tiến hóa" này cuối cùng là tăng trưởng năng lực thực sự, hay chỉ học được cách vượt qua kỳ thi do chính mình tạo ra.

Tự sửa đổi chỉ là khởi đầu của tiến hóa, chứng minh được mình thực sự mạnh hơn mới là km cuối cùng khó nhất của RSI.

Báo lỗi/Báo cáo
Gửi
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành