Theo Động Sát Beating theo dõi, nhóm MiniMax H3 đã tiết lộ trong phiên AMA trên Reddit rằng họ đang phát triển một mô hình hình ảnh chuyên dụng và có kế hoạch mở trọng số. Mô hình này sẽ kết hợp tạo ảnh từ văn bản và chỉnh sửa ảnh tổng quát vào cùng một mô hình, hiện đã bước vào giai đoạn tối ưu hóa sau huấn luyện.
Mô hình này và H3 chia sẻ cùng một kiến trúc tư duy. Nó sẽ sử dụng lại bộ mã hóa VAE của H3 và thiết kế riêng bộ giải mã VAE cho việc tạo hình ảnh. MiniMax hình dung quy trình làm việc là: trước tiên dùng mô hình hình ảnh tạo khung hình đầu, sau đó chuyển cho H3 tiếp tục tạo video.
Nhóm cũng đề cập rằng bản thân H3 đã cho thấy tiềm năng nhất định trong việc tạo và chỉnh sửa ảnh. Trước đây họ chỉ huấn luyện mô hình dự đoán khung hình cuối dựa trên "khung hình đầu + mô tả văn bản", không huấn luyện chuyên sâu về chỉnh sửa ảnh, nhưng mô hình vẫn thể hiện khả năng zero-shot mạnh mẽ trong nhiều bài đánh giá chỉnh sửa ảnh. Đây cũng là cơ sở quan trọng để MiniMax tiếp tục mở rộng kiến trúc này sang mô hình hình ảnh.
