Theo theo dõi từ Beat Inteligent, Google DeepMind đã phát hành trợ lý AI toán học, một nền tảng nghiên cứu tương tác đa tác nhân dành cho các nhà toán học. Hệ thống này đã đạt được tỷ lệ chính xác 47,9% (giải đúng 23/48 câu hỏi) trên bài kiểm tra toán học cấp độ nghiên cứu khó nhất hiện nay FrontierMath Tier 4, vượt qua kỷ lục cao nhất trước đó của GPT-5.5 Pro với 39,6%.
Hệ thống này không sử dụng hệ thống cơ sở thế hệ mới, mà trực tiếp sử dụng Gemini 3.1 Pro. Mô hình này chạy thử Tier 4 một mình chỉ đạt 19%, nhưng khi thêm khung tác nhân thì điểm số tăng gấp đôi và thậm chí nhiều hơn. DeepMind đã xây dựng cho nó một cấu trúc đa tầng: ở tầng đỉnh có một "người phối hợp dự án" phân chia nhiệm vụ nghiên cứu thành nhiều luồng công việc, sau đó phân phối xuống dịch vụ tìm kiếm tài liệu, viết mã và các tác nhân con chịu trách nhiệm về suy luận. Bằng chứng viết ra còn phải trải qua một vòng kiểm duyệt từ một hội đồng gồm nhiều "tác nhân phê duyệt" trước khi được nộp. Cấu trúc cứng cáp này đã chứng minh rằng: trong lĩnh vực suy luận toán học hàng đầu, việc sắp xếp có thể khai thác độ tăng của khả năng một cách lớn hơn so với việc thay đổi mô hình.
Thử nghiệm mù được tiến hành bởi Epoch AI, để ngăn chặn gian lận, nhóm DeepMind không được nhìn thấy câu hỏi, mỗi câu hỏi được phép chạy trong 48 giờ. Kết quả không chỉ vượt qua mà còn giải quyết được 3 câu hỏi mà trước đó tất cả các mô hình đều thất bại.
Mặc dù được gọi là trợ lý, nó giống như một đồng nghiệp biết cách mở mang trí óc. Chuyên gia về nhóm học Marc Lackenby đã sử dụng nó trong nghiên cứu thực tế để giải một giả thuyết công khai trong Kourovka Notebook. Đáng chú ý là, chiến lược ban đầu mà hệ thống đưa ra đã bị từ chối bởi tác nhân kiểm duyệt của chính nó là "có thiếu sót", nhưng Lackenby đã nhận ra cách tiếp cận tinh tế ẩn sau trong văn bản và tự điền vào khoảng trống, cuối cùng hoàn thiện bằng chứng.
Hiện tại, trợ lý AI toán học chỉ dành cho một số lượng ít các nhà toán học tham gia thử nghiệm nội bộ.
