Động Sát Beating Tin nhanh AI, Scale AI ra mắt RSI Bench, chuyên kiểm tra xem AI có thể tự mình nghiên cứu và phát triển AI như một nhà nghiên cứu hay không.
AI sẽ trực tiếp nhận bài báo khoa học, mã nguồn và tài nguyên tính toán, sau đó tự nghĩ ra thí nghiệm, chạy huấn luyện, điều chỉnh phương pháp, rồi xem liệu có thể cải thiện AI ban đầu hay không.
Đợt kiểm tra đầu tiên sử dụng Claude Opus 5 và GPT-5.6 Sol. Cả hai mô hình đã có thể tự chạy thí nghiệm, điều chỉnh tham số, lặp lại phương án, và ở một số nhiệm vụ thực sự vượt qua mức cơ sở đã cho.
Nhưng AI hiện tại vẫn chưa giỏi trong việc "phát minh". Khi thách thức chúng với các nghiên cứu mới nhất, hầu hết các nỗ lực vẫn dừng lại ở các phương pháp đã có trong bài báo và điều chỉnh tham số, hiếm khi đề xuất những hướng đi thực sự mới.
