动察 Beating AI tin nhanh, Aether AI - công ty mô hình thế giới nhân quả do trợ lý giáo sư UCSD Huang Biwei sáng lập - đã mã nguồn mở RSIAgent.
Đây là một bộ khung tự cải thiện đệ quy không huấn luyện mô hình. Tham số mô hình nền được cố định trong suốt quá trình, Agent sẽ tự tìm những nhiệm vụ đáng luyện tập, thực sự thao tác, kiểm tra kết quả, rồi ghi phương pháp thành công và bài học thất bại vào Memory dài hạn. Vòng tiếp theo tiếp tục tận dụng những kinh nghiệm này để dần bù đắp điểm yếu về năng lực.
Hệ thống gồm ba Agent phối hợp. Curriculum Agent quyết định luyện gì tiếp theo, Actor Agent thực sự thao tác phần mềm, Verifier Agent kiểm tra kết quả một cách độc lập. Quá trình khám phá chia làm hai bước: trước tiên thử rộng nhiều nhiệm vụ khác nhau, sau đó tiếp tục đào sâu vào thất bại, giới hạn ẩn và tình huống biên. Cuối cùng Memory sẽ được đóng băng, đem đi thực thi nhiệm vụ chính thức.
Trên OSWorld 2.0, sau khi thêm bộ RSI này, điểm trung bình phần đạt tăng từ 71,97% lên 78,98%; Agents' Last Exam tăng từ 83,75% lên 84,82%. Tuy nhiên đây không phải so sánh A/B nghiêm ngặt của toàn bộ bài kiểm tra. OSWorld chỉ có một nửa nhiệm vụ thực sự dùng kết quả mới sau RSI, các nhiệm vụ còn lại vẫn giữ nguyên điểm cũ.
Nó cùng hướng lớn với các ý tưởng tự cải thiện Harness như Prime Agent: trọng số mô hình không đổi, liên tục cập nhật những thứ bên ngoài mô hình. Đặc điểm của RSIAgent là tập trung cải thiện vào Memory, rồi dùng việc tự ra đề và xác minh độc lập để kho kinh nghiệm bên ngoài này không ngừng tích lũy.
