动察 Beating tin nhanh AI, nghiên cứu sinh tiến sĩ Princeton Yifan Zhang đề xuất Recurrent Looped Transformer (RLT), thêm một trạng thái nội bộ luôn truyền về phía sau cho Transformer.
Transformer thông thường khi sinh Token tiếp theo, chủ yếu đọc phần văn bản trước thông qua Attention và KV cache. RLT ngoài việc nhìn phần văn bản trước, còn đưa trạng thái nội bộ còn lại sau khi tính xong Token trước đó trực tiếp cho Token tiếp theo tiếp tục sử dụng.
Có thể hiểu nó như thêm một "cây gậy tiếp sức tư duy" cho mô hình. Token thứ nhất tính xong, truyền trạng thái hiện tại cho Token thứ hai; Token thứ hai cập nhật xong lại truyền cho Token thứ ba. Số lớp mạng mà mỗi Token tự chạy không thay đổi, nhưng chuỗi trạng thái này sẽ ngày càng dài theo văn bản. Bài báo gọi nó là "độ sâu thời gian vô hạn", ý chỉ chuỗi tính toán này không có giới hạn độ dài cố định.
Nó cũng khá khác với các kiến trúc tuần hoàn kiểu Ouro, Astra được thảo luận nhiều gần đây. Các phương pháp đó chủ yếu để cùng một Token chạy nhiều vòng trong cùng một bộ mạng; RLT thì để các Token khác nhau liên tục truyền trạng thái nội bộ cho nhau. Cái trước giống như làm một bài toán rồi kiểm tra lại vài lần trước khi nộp; cái sau giống hơn với việc một chặng chạy xong, trao thẳng tiến độ trong tay cho chặng tiếp theo.
