Theo dữ liệu giám sát từ Động Sát Beating, nhóm nghiên cứu của Apple đã thực hiện một loạt thí nghiệm học tăng cường với 9 mô hình và 11 ngôn ngữ, nhằm tìm hiểu: nếu dữ liệu huấn luyện chỉ có một ngôn ngữ, thì khả năng giải bài mà mô hình học được có thể áp dụng cho các ngôn ngữ khác không?
Câu trả lời là có, và hiệu quả khá rõ rệt. Chỉ cần huấn luyện bằng một ngôn ngữ, mô hình cũng sẽ mạnh lên đồng thời ở nhiều ngôn ngữ khác.
Ví dụ, trong bài kiểm tra tiếng Pháp, khi huấn luyện trực tiếp bằng tiếng Pháp, điểm số trung bình tăng 25,6 điểm phần trăm; khi hoàn toàn không dùng tiếng Pháp để huấn luyện mà chỉ dùng bài tập tiếng Tây Ban Nha, thì khi thi tiếng Pháp vẫn tăng 24,6 điểm phần trăm, chỉ chênh lệch 1 điểm phần trăm.
Mô hình không chỉ học được bài tập trong một ngôn ngữ cụ thể, mà còn học được một phần phương pháp giải bài có thể chuyển đổi sang ngôn ngữ khác. Vì vậy, trong tương lai nếu muốn tăng cường khả năng suy luận tiếng Trung cho mô hình, không nhất thiết phải làm lại toàn bộ dữ liệu học tăng cường thành tiếng Trung.
Tuy nhiên, ngôn ngữ huấn luyện cũng không thể thay đổi tùy tiện, vì một ngôn ngữ cụ thể có thể kích hoạt sự suy giảm khả năng ở một số lĩnh vực. Cùng một quy trình học tăng cường, nếu đổi ngôn ngữ huấn luyện, một số mô hình có thể suy giảm rõ rệt ở các ngôn ngữ và nhiệm vụ khác. Trong nhóm thí nghiệm cực đoan nhất, sau khi Qwen3-4B được huấn luyện bằng tiếng Swahili, bài kiểm tra tiếng Anh chưa từng thấy trong quá trình huấn luyện đã giảm 19,2 điểm phần trăm so với mô hình gốc; khi huấn luyện đa ngôn ngữ cùng lúc, bài kiểm tra này lại tăng 4,5 điểm phần trăm.
Bài nghiên cứu này chủ yếu xác thực các bài toán suy luận có thể tự động đánh giá đúng sai như toán học, logic, đồ thị, hình học. Khi đổi sang ngôn ngữ khác, phương pháp giải cơ bản của những bài này thường không thay đổi. Đối với các nhiệm vụ thực sự phụ thuộc vào ngôn ngữ như đọc hiểu, ẩn dụ, phán đoán ngữ nghĩa, kiến thức văn hóa, bài nghiên cứu chưa xác thực.
