Önemli bir gelişme olarak, 动察 Beating tarafından yapılan takibe göre, MiniMax H3 ekibi Reddit AMA oturumunda özel bir görüntü modeli geliştirdiklerini ve ağırlıkları açık kaynak olarak yayınlamayı planladıklarını açıkladı. Bu model, metinden görüntü üretme ve genel görüntü düzenlemeyi tek bir modelde birleştirecek ve şu anda eğitim sonrası optimizasyon aşamasında.
Bu model, H3 ile aynı mimari yaklaşımı paylaşıyor. H3'ün VAE Kodlayıcısını kullanacak ve görüntü üretimi için ayrı bir VAE Çözücü tasarlayacak. MiniMax'ın öngördüğü iş akışı, önce görüntü modeliyle ilk kareyi üretmek, ardından bunu H3'e devrederek videoyu oluşturmaya devam etmek.
Ekip ayrıca, H3'ün zaten belirli bir görüntü üretme ve düzenleme potansiyeli gösterdiğini belirtti. Daha önce modeli yalnızca "ilk kare + metin açıklaması" temelinde son kareyi tahmin etmek üzere eğitmişlerdi ve görüntü düzenleme için özel bir eğitim yapmamışlardı, ancak model çeşitli görüntü düzenleme değerlendirmelerinde güçlü bir sıfır atış yeteneği sergiledi. Bu, MiniMax'ın bu mimariyi görüntü modeline genişletmeye devam etmesinin önemli bir gerekçesi.
