动察 Beating AI tin nhanh, nhóm dự án đánh giá thao tác robot RoboDojo do MMLab của Đại học Hồng Kông dẫn đầu đã thực hiện một thí nghiệm đi ngược thông thường. Họ không trang bị thêm cho GPT-6 Astra một chiến lược robot đã được huấn luyện, mà để mô hình đa phương thức tổng quát này trực tiếp nhìn camera, đọc trạng thái robot, hiểu nhiệm vụ, rồi tự quyết định bước tiếp theo nên di chuyển thế nào. Ở giữa chỉ có một bộ công cụ điều khiển cố định, chuyển vị trí mục tiêu do Astra đưa ra thành động tác của cánh tay robot.
Trong 42 nhiệm vụ mô phỏng, Astra đạt 28,97 điểm, tỷ lệ thành công trung bình 22,48%, vượt qua DM0.5 đứng đầu bảng công khai trước đó với 24,90 điểm, 19,34%. Cùng một cách điều khiển, nếu đổi sang GPT-5.5, chỉ có 1,13 điểm, 0,88%.
Bảng công khai của RoboDojo trước đây chủ yếu là các chiến lược robot được huấn luyện chuyên biệt như VLA, WAM. Hiện nay, một phần quyết định động tác vốn cần mô hình chuyên dụng để hoàn thành đã có thể được mô hình lớn tổng quát trực tiếp đảm nhận, hơn nữa thành tích tổng thể còn vượt qua quán quân cũ. Liệu robot có còn cần huấn luyện riêng một "bộ não" hay không, lần đầu tiên vấn đề này trở nên rất cụ thể.
Nhưng Astra vẫn chưa thể thay thế "tiểu não" của robot. Những nhiệm vụ phụ thuộc vào điều khiển vật lý thực như cắm vào, rót chất lỏng, tiếp xúc tinh vi, nó rõ ràng yếu hơn. Thử nghiệm trên máy thật còn bị nhóm dừng sớm vì nhiều lần xuất hiện động tác nguy hiểm và làm hỏng phần cứng.
Khi năng lực của mô hình tổng quát trở nên mạnh hơn, sự phân công của mô hình robot có thể sẽ được phân chia lại: mô hình lớn chịu trách nhiệm hiểu môi trường, phán đoán và lập kế hoạch, còn VLA chuyên dụng và bộ điều khiển truyền thống chịu trách nhiệm làm động tác chính xác và ổn định.
